8月以来,前沿模型团队的迭代节奏进一步加快。截至9月8日,共有7家公司发布新的模型:OpenAI GPT-6 Astra、Anthropic Claude Fable 5.1、Google Gemini 3.8 Flash、阿里Qwen3.8-Max、DeepSeek V4-Flash与V4-Pro、智谱GLM-5.3,以及腾讯Hy4-preview。chatgptclaudegooglegemini阿里千问deepseek智谱腾讯混元
xbench 对这一批新模型从科学推理(ScienceQA)、多模态理解(BabyVision)、真实复杂长程任务(OneMillion-Bench)三个维度进行评测,并更新了leaderboard。
结合本期重点模型的公开发布信息与榜单数据,本轮迭代各个榜单的总结:
· GPT-6 Astra的多模态推理能力断层式领先,BabyVision首次有模型近Human baseline:GPT-6 Astra以88.92分登顶第一,距Human baseline(94.10)仅差 5.18分,领先第二名Gemini 3.7 Flash(73.45)15.47分,是榜单最大的第一名领先幅度。OpenAI视觉条线四代累计提升54.52分,多模态理解从差异化卖点正在变成模型核心竞争维度。
· ScienceQA头部密度持续上升,模型挤入70–80分区间:榜首仍是Claude Opus 4.8(76.4/84.0),但本月新增模型高度密集地落在69–75分区间:Claude Fable 5.1、GPT-6 Astra、Qwen3.8-max、Gemini 3.8 Flash、DeepSeek-V4-Flash 等均在此区间。分数上限未有明显突破,竞争转向效率与性价比。
· OneMillion-Bench榜单中Claude系列继续保持榜首,腾讯Hy4-preview跃升至第二:Claude Fable 5.1以PR42.1%登顶榜首,较上一代Fable 5(33.6%)提升 8.5个百分点,腾讯Hy4-preview以PR 35.3%从中下游位置直接跳到第二名。








