众力资讯网

Grok 4.6 在 Cursor 里悄悄上线,重点不是“更聪明”,而是宣称在代

Grok 4.6 在 Cursor 里悄悄上线,重点不是“更聪明”,而是宣称在代码库分析、研究写作、交互式项目里能连续多步工作不崩。AI 编码的考核项正从单轮回答质量,转向跑完一整条长链路会不会掉链子。过去大模型在长任务里最容易出问题:上下文装满后忘事、工具调用返回异常流程卡死、改到第五个文件时突然忘了第一份需求。Grok 4.6 把训练数据、SFT 与强化学习改进写进文档,并接入 Grok Build 和 API,把长程稳定性当成产品材料发,本身就说明 Cursor 想让人重新相信模型能撑住多步工作。

英伟达把 300 亿参数的 Nemotron 3.5 Lightning 开源,配套推出模型路由库 NeMo Switchyard,把多模型调度做成基础设施。Google DeepMind 的 SL2T 多语言手语转文本模型,首批支持美国手语转英语,准备塞进 Pixel 11 的 Gboard 和 Live Transcribe。三件事指向同一条线:AI 不再只拼单轮谁更强,而是拼能不能在长链路、长场景里稳定交付。

不过,原文只交代了 Grok 4.6 在训练数据与后训练上的改进,没有公开可验证的长程掉链率或基准。SL2T 只覆盖 ASL 到英语,其他语种和上线节奏仍是空白。

判断是:Grok 4.6 把“长时智能体能不能用”正式摆到台面,值得拿真实项目去试;但在跑出可复现数据之前,先别把它当万能协处理器。你在用 Cursor 跑多文件重构或长研究任务时,模型在哪一类步骤最容易先掉链子,是工具调用、上下文遗忘,还是中途格式崩?