众力资讯网

阿里Qwen3.8-Max前端编程全球第一,价格只有Claude的1/4

中国模型第一次在前端编程领域拿了全球第一。 不是第二名,不是第三名,是第一名。 2026年9月2日,阿里发布了Qwen

中国模型第一次在前端编程领域拿了全球第一。
不是第二名,不是第三名,是第一名。
2026年9月2日,阿里发布了Qwen3.8-Max的0902版本,在CodeArena WebDev前端编程榜单上以1691分登顶,超越Claude Opus 5(1688分)和Kimi K3(1674分)。
更狠的是价格:$5/百万Tokens,只有Claude的1/4。

今天就来聊聊,这个"全球第一"到底成色如何。
只靠"后训练"就超越了ClaudeQwen3.8-Max的0902版本有个很有意思的特点——它没有改基底模型,只靠后训练(post-training)优化,前端编程能力就提升了22分。
这就像你参加高考,没换教材没换老师,就是考前多刷了几套题,分数直接涨了22分,从第二名跳到第一名。
CodeArena WebDev是前端编程的权威榜单,专门测试模型生成网页的能力。Qwen3.8-Max在多个细分领域排名第一或第二:
数据与分析(#1): 图表、数据可视化消费级产品(#1): C端产品界面品牌与营销(#2): 品牌落地页游戏(#2): 交互式游戏阿里官方还披露了一个极端案例: Qwen3.8-Max从空文件夹出发,无人干预自主编程16天,交付了一个真实可用的完整项目。期间完成了265次代码提交、127个PR、151个Issues。
16天不睡觉写代码,这体力确实不是人类能比的。
20,性价比碾压前端编程能力全球第一还不够,价格还只要Claude的1/4。
模型
前端编程分数
价格($/百万Tokens)
Qwen3.8-Max-0902
1691(#1)
$5
Claude Opus 5
1688(#2)
$20
Kimi K3
1674(#3)
$12
在CodeArena的帕累托前沿上,Qwen3.8-Max-0902以$5的综合价格占据最高分位置。 换句话说,同等价格下它最强,同等能力下它最便宜。
开发者实测反馈也很积极: "直接用Qwen3.8-Max复刻了一版《愤怒的小鸟》,价格很合适,一周使用下来额度消耗不到九成。" "只用一条提示词,搭出了一个完整、可交互的开发者作品集。"
但等等——榜单和真实使用之间,差了13分
这是这篇文章最有价值的部分。
一家叫Startrise的旧金山AI工作室对15个主流模型做了12个真实前端任务测试,发现了一个有趣的现象:
AI评委平均给分:69.2分(读源码,看结构) 人工盲评给分:56.1分(看页面,看交互) 差距:13分
AI评委在看什么? 看代码结构、看规范性、看技术实现。 人类在看什么? 看页面能不能跑、交互顺不顺手、有没有BUG。
Qwen3.8-Max在12个真实任务中的表现也很分化:
表现好的(技术侧满分):
品牌落地页:87.3分,刷新历史纪录全屏WebGL着色器:84.6分,零BUG18个手绘SVG图标:81.6分,零BUG表现差的(有致命BUG):
Three.js滚动页面:29.3分,页面几乎不渲染3D游戏:47.7分,AI评委发现7个致命BUG状态应用(表单校验+撤销重做):62.8分,8个BUG结论很明确:Qwen3.8-Max"看起来对不对"很强,但"跑起来对不对"还有差距。
视觉呈现类任务碾压性胜利,但状态管理、异常处理、持续运行这些需要"逻辑严密"的任务,明显是弱项。
这对前端开发者意味着什么?好消息: 如果你需要快速生成页面、做UI设计、渲染数据可视化,Qwen3.8-Max是目前全球最强+最便宜的选择。
坏消息: 如果你的项目涉及复杂的状态管理、表单校验、长流程交互,目前还需要人工介入调试。
100万上下文窗口是另一个杀手锏。一个50页的合同文档,Qwen3.8-Max能一次性处理完,逐条做六维度风险分析,审查效率较人工提升90%。
但Token消耗量也确实大。 跑12个真实任务输出了47.7万Token,花费$2.92。有开发者吐槽:"用的真快。昨天到今天,3个5小时,就把138的一周量用完了。"
写在最后中国模型在前端编程领域首次登顶全球第一,这确实值得骄傲。
但13分的AI评委vs人工评审差距,也提醒我们:榜单和真实使用之间还有距离。
Qwen3.8-Max就像是一个"视觉系"选手——静态页面做得漂亮,代码写得规范,但一碰到复杂的动态交互就露怯。
不过这已经是国产模型的一大步了。 从"能用"到"好用",从"便宜"到"又便宜又强",Qwen3.8-Max-0902证明了一件事:
只靠后训练优化,不改变基底模型,就能实现22分的跨越。
国产模型的后训练,确实有点活儿。