AI工具能力量化
最近做了一个AI工具,每次想改什么东西都要花大量时间验证它的效果分析它潜在的问题。自己用AI设计了一个针对我自己这个AI工具的E2E的测试,包含
“任务是否完成、格式是否正确、答案是否存在幻觉、pipeline是否完整执行、token效率、回答质量”这六个维度的打分。但做的实在是粗糙,尽管从效果上看似乎比原先好了一些,但心里始终踏实不下来。想问问经验丰富的大佬们在开发的时候是怎么解决AI工具能力这个问题的?
不懂就问有问必答 万能的 AI工具 大模型 用户体验优化 AI人工智能
