众力资讯网

盲测赢了智谱和Kimi,虽然优势不大

腾讯今天发了个新模型,Hy4 preview,直接开源了。

我朋友圈刚才被刷屏了,技术群里全在聊这件事。简单看了一下,这个版本最大的看点是代码能力确实上来了。

有个叫Terminal Bench 2.1的测试,专门考命令行编程,Hy4 preview跑了85.4分,比上一代Hy3高了14.6分,直接超了DeepSeek V4 Pro,跟Claude Opus 5持平。

腾讯内部还搞了场盲测,找了一百多个专家,在两百多个真实的WorkBuddy任务里打分,Hy4 preview均分2.99/4,比智谱和Kimi都略高一点。虽然优势不大,但至少说明没掉队。

混元发Hy3的时候,外界的评价普遍是“能用,但不够顶”。这次Hy4 preview给我的感觉是,至少在产品落地上开始认真了。

直接跟WorkBuddy、CodeBuddy、元宝全线打通,开源、低价(输入6块输出18块,缓存命中3毛),连数学难题都顺手推进了2%。

团队自己也很坦诚,说这个版本还不完美,有时候“过于谨慎”,一个问题反复验证,有点啰嗦。现在是preview阶段,先放出来接反馈再迭代。这个姿态倒是挺务实的。

从今年2月重建基础设施开始,混元差不多两个月迭代一个大版本,节奏很稳定。

虽然算力一直是腾讯的短板,但这波至少证明了一件事:没躺平,在往前赶。能不能在AI马拉松里熬出头,还得看接下来的正式版。

但今天这一版,确实值得给个respect。
#腾讯 #Ai大模型 #Hy4 #混元 #大模型