众力资讯网

谷歌 Gemini 3.8 Live 正式发布(当地时间9月15日) 谷歌DeepMind推出两款实时语音对话模型:Gemini 3.8 Live、Gemini 3.8 Live Extended Thinking(扩展思考版),主打低延迟实时语音+视觉理解+后台并行工具调用,实现边对话边后台执行复杂任务,对话不会中断卡死。 🧩两个版本区别 Gemini 3. ​

谷歌 Gemini 3.8 Live 正式发布(当地时间9月15日)谷歌DeepMind推出两款实时语音对话模型:Gemini 3.8 Live、Gemini 3.8 Live Extended Thinking(扩展思考版),主打低延迟实时语音+视觉理解+后台并行工具调用,实现边对话边后台执行复杂任务,对话不会中断卡死。🧩两个版本区别Gemini 3.8 Live(标准版)- 定位:高并发、成本优化,面向日常实时语音对话

- 能力:近实时视觉输入理解,对话中自动切换97种语言;后台异步调用工具/API,一边聊天一边检索、计算,不会出现长时间静默等待;支持随时打断对话;语音输出自带SynthID水印,可识别AI合成语音。

- 普通用户入口:Search Live搜索实时对话;开发者可通过Gemini API、Google AI Studio调用。Gemini 3.8 Live Extended Thinking(扩展思考版)- 定位:多步骤复杂长链路Agent任务

- 核心亮点:边思考边说话,后台做复杂推理、多步任务编排,同时语音向用户播报思考进度;例如语音下达复杂行程规划、代码生成、多步骤预订任务,AI会实时汇报“正在查询、正在核对”,不会中断对话流。

- 用户入口:Gemini Live;Google AI Pro/Ultra订阅用户可在Google Workspace文档、Gmail、Keep使用;企业版为私有预览。✨核心技术亮点1. 异步工具调用:AI后台执行搜索、API调用,语音对话持续输出,不会僵住等待结果,解决实时语音大模型“思考就断流”痛点。

2. 实时多模态:支持摄像头实时画面输入,语音对话同时理解视觉画面。

3. 多语言无缝切换:对话中途自由切换97种语言,无需重新设置。

4. 合成语音水印:全部AI生成语音内置SynthID水印,便于识别AI语音内容。📌可用渠道1. 开发者:Gemini API、Google AI Studio,现已开放调用。

2. 普通用户

- 3.8 Live:Search Live(谷歌搜索实时对话)

- Extended Thinking:Gemini Live App;Google Workspace订阅用户

3. 企业:Gemini Enterprise私有预览,后续逐步开放商用。

专注前沿科技资讯,解读新品与行业变化。欢迎关注,一起看科技如何改变生活。