GLM员工Lou分享的省Token经验:----------------我发现,有些人会尝试缩短提示词来节省 token,但其实输出 token 才是更大的优化空间。因此,我会分享一些提升 token 使用效率的技巧。(这篇内容面向普通开发者和初学者,后续会介绍更高级的方法。)
可以先尝试以下几个简单做法:
a. 限制输出长度。例如,可以说:“回答不超过五个要点,每个要点一句话。”在 API 调用中,可以使用 max_tokens。
b. 使用简洁的输出结构。只要求返回特定的 JSON 字段或简短列表,并明确说明:“不要添加任何额外解释。”
c. 在 API 支持的情况下使用停止序列。它对固定格式的输出尤其有用。
d. 删除提示词中所有对任务没有帮助的内容,例如“请”“谢谢”等客套话。
e. 对于复杂任务,首先需要使用结构化提示词,以确保输出稳定可靠,之后再逐步优化。
f. 对于某些非推理模型,可以尝试重复提示词来提高准确率。不过,这目前还不是一种通用的最佳实践。
以上只是一些个人总结。请始终查看最新的官方文档。How I AI
