众力资讯网

Qwen3.8和Fable5、GPT5.6Sol同台,居然没输

刷到一个专门做AI模型评测的博主发的视频,说不看 benchmark,直接用自己的Goldie Bench做了253组head-to-head对比测试。

Qwen3.8、Fable 5、GPT5.6 Sol同时做 GTA 游戏、飞行模拟器、落地页设计等任务,条件很公平:同一个prompt、one-shot、不给迭代机会,出什么是什么。

结果 Qwen 3.8在两项上明显领先:一个是GTA风格游戏生成,画面完整度和场景丰富度都超过Fable 5;在 landing page设计上更是一骑绝尘,被评价为"完全不像AI生成",视觉质感碾压另外两个。

在他后续的 AI agent benchmark总结里,Qwen 3.8也是整体排名第一。但飞行模拟器Qwen3.8暴露了问题,版本没能正常起飞,而Fable 5做到了,这说明在需要连续物理反馈和精细控制的任务里,Qwen还有提升空间。

GPT 5.6 Sol的表现相对中规中矩,没有特别突出的单项,但也没有像 Qwen3.8在某个单项上做到"crushed everyone"的表现。

所以结论很明确,Qwen 3.8在视觉和前端类任务上很强,但在物理/控制类任务上还有差距。

原博的总结我很有同感:别问哪个AI最强,要问这个任务用哪个AI最合适。