以后所有本地AI,我一律能不碰性能就不碰性能了,如果后面RTX Spark要求我讲性能,我就往死里讲,把所有情况都给你测一遍,光AI部分就干他个4000字起步
不同上下文长度,是否带图,并发方式,Temp设置,投机解码,量化配方,缓存配置……一个toks/s背后能限定的条件真的太多了,能讲的东西也太多了
很多“专门测AI”的评测其实压根没有覆盖全这些东西,没把本地LLM的Agent体验核心说明白,吞吐高15%,但不支持并发,几个人同时用就只有一个人在爽,其他人都在狠狠排队,这样是得不偿失的
本地Agent,特别是做成服务器而非独享之后,是有许多取舍的,不是“优化”两个字可以简单覆盖的,也不是简单看吞吐就可以的
这评论区我真的回得心累,中秋为了和评论区讲道理补测到凌晨1点,图啥呢……