
7月30日,SpaceXAI正式发布新一代语音模型Grok Voice Think Fast 2.0。SpaceXAI表示,这是目前其能力最强的端到端语音模型,在语音理解、推理能力、转录准确率以及多轮对话体验方面均实现升级。
Grok Voice Think Fast 2.0采用“语音到语音”架构,不再依赖传统的“语音识别—大语言模型—语音合成”多阶段流程,而是在理解用户语音后直接生成回应,从而降低延迟,并提升自然交互体验。
根据SpaceXAI公布的数据,Grok Voice Think Fast 2.0在Artificial Analysis的语音到语音综合评测中获得82.9%的质量指数,高于上一代Grok Voice Think Fast 1.0的75.7%,同时超过GPT-Realtime-2.1 High的79.1%以及Gemini 3.1 Flash High的69.5%。

在语音推理能力方面,新模型在Speech Reasoning Big Bench Audio测试中达到97.2%的成绩;在全双工对话测试中达到95.1%,相比上一代模型的77.8%大幅提升。此外,其智能代理能力测试成绩达到56.5%,超过GPT-Realtime-2.1 High的45.7%。
速度方面,Grok Voice Think Fast 2.0首次音频响应时间仅为0.70秒,相比上一代模型的1.25秒进一步降低,能够实现更加接近真人交流的即时反馈。
除了对话能力提升,SpaceXAI还重点优化了语音识别准确率。官方表示,在覆盖24种语言、数千条短语的测试中,Grok Voice Think Fast 2.0相比Deepgram Nova 3和ElevenLabs Scribe v2等专业语音转文字模型,准确率提升约1.5至2倍;在噪声环境和电话压缩场景下,优势进一步扩大。
SpaceXAI表示,Grok Voice Think Fast系列的一项重要特点,是模型能够在用户说话过程中同步进行推理,而不会增加额外延迟。相比传统语音AI需要等待完整输入后再思考,新模型可以边交流边完成复杂任务,并更快调用外部工具。
在实际应用方面,SpaceXAI称,新模型已经在星链客服场景中进行了测试,并带来了销售转化率和客服自动解决率的明显提升。
按照计划,默认模型名称grok-voice-latest将在8月5日自动升级至Grok Voice Think Fast 2.0,开发者无需修改现有提示词即可迁移。同时,新模型定价为每分钟音频0.08美元。
此次升级意味着SpaceXAI正在加速推进语音智能体的发展。从此前发布多款Grok Voice语音和智能体工具,到如今推出更低延迟、更强推理能力的语音模型,SpaceXAI希望让AI从文字助手进一步走向能够实时交流、执行任务的智能代理。