众力资讯网

快速的输出总有其代价 今晚被deepseek-v4.1-flash气到不行了,我

快速的输出总有其代价
今晚被deepseek-v4.1-flash气到不行了,我本来是要分子代理测试它在不同工具场景下的长文本阅读准确率,评价一下这个工具的有效性,结果它到汇总比较的阶段之后,就开始无限思考,每轮长度都能顶着1M上限输出,我观察了40分钟,发现它每隔两轮就开始重复之前已经全盘listing过的分析内容,在上一轮思考结尾说的“看完最后两个就开始输出文档”也在大约一两百K输出之后就完全淹没,完全忘记,又开始重复list所有比较项,逐一评价。

只能说这个架构确实太激进了,理论1M的上下文,实际体感超过200K就开始出现严重的漂移,任何有意或无意布置给它长上下文任务一定会失控(就比如这次,我本意不是给它长上下文任务,但它的超级健忘活活把一个很简单的比较任务跑了2.5小时,压缩了3次上下文都没结果)。

教训就是,真的不要用它做任何语义理解和思考任务,哪怕非常简单的任务也不要用,它只能用来对着极其明确的计划书做快速执行。
你永远预料不到,模型内部做摘要后传递、极限缓存压缩这些激进技术,能把模型的记忆力破坏到多低的程度。