Grok 4.6正式发布,多项基准测试逼近顶尖模型
8月12日,SpaceXAI正式发布Grok 4.6。官方表示,新模型在Grok 4.5基础上进行了进一步升级,重点强化长时间运行的Agent任务,以及更复杂的交互式和视觉类工作。
相比上一代,Grok 4.6更加注重处理需要多步骤持续执行的复杂任务,包括信息研究、数据分析、代码库开发,以及从一个产品创意直接构建出可运行的应用或工作成果。SpaceXAI表示,在较长任务链中,Grok 4.6还展现出更强的自我测试和验证能力,会在继续执行前主动检查工作结果。
在性能方面,Grok 4.6在多项Agent编程和知识工作基准测试中达到前沿水平。其中,Artificial Analysis Intelligence Index综合九项基准测试,Grok 4.6获得61分,与GPT-5.6 Sol持平;在GDPVal-AA v2、CursorBench v3.2、DeepSWE v1.1、FrontierCode v1.1等测试中,也展现出较强竞争力。不过,在部分编码测试中,Grok 4.6仍落后于GPT-5.6 Sol或其他顶尖模型。
训练方面,Grok 4.6进行了比Grok 4.5更长的补充训练,加入模型生成的推理和高级技术数据、高质量工程数据,并改进优化器和训练方案。随后,SpaceXAI利用Grok 4.5重新生成不同推理强度、Agent框架以及STEM、软件工程和知识工作领域的SFT训练轨迹,并进一步进行筛选和强化学习训练。
值得关注的是,Grok 4.6此次明显强化了“从想法到产品”的能力。SpaceXAI表示,用户给出一个较为宽泛的产品创意后,模型可以自行研究陌生领域、规划应用结构、实现核心交互,并根据反馈持续迭代。对于视觉和交互式项目,其首轮生成效果也较Grok 4.5明显提升。
目前,Grok 4.6已经登陆Cursor、Grok Build,同时开放API,并支持OpenRouter、Vercel和Cloudflare等合作平台。API价格从每百万输入Token 2美元、每百万输出Token 6美元起,快速版本价格为其两倍。SpaceXAI还宣布,Grok Build和Cursor首周提供两倍的包含用量。
从此次升级来看,Grok 4.6并非单纯追求聊天和推理能力,而是进一步把重点放在“长任务Agent”和“直接完成工作”上。随着AI竞争从模型能力逐渐转向实际执行能力,Grok 4.6能否凭借更强的持续工作能力,在Agent赛道进一步追赶OpenAI、Anthropic等竞争对手,值得持续关注。
