如果你在做AI应用的Prompt Engineering,推荐一个调试神器:LangSmith(langchain出品)。
它做的事情很简单但非常实用:把你的每一次LLM调用记录下来——输入的prompt、输出的结果、延迟、token消耗、错误信息——然后你可以在一个面板上搜索、过滤、对比。
最有价值的功能是「A/B测试」:同一个输入同时发给两个不同的模型或prompt,对比输出质量。盲评之后才知道哪个prompt真的更好。
免费套餐每月3000条trace,个人开发够了。
AI 开发工具 PromptEngineering