众力资讯网

谷歌Gemini 3.8语音模型发布:30秒克隆声线,支持百种语言

【科技快报网】9月23日,谷歌宣布推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-
【科技快报网】9月23日,谷歌宣布推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,官方称其为迄今表现力最强的音频生成模型,当日即通过 Gemini API 与 Google AI Studio 上线。

两款模型定位分明:Flash TTS 面向深度创意与角色设计,服务游戏、沉浸式有声书、播客与互动媒体;Flash-Lite TTS 主攻大容量、高性价比场景,针对批量配音、音频内容创作与语音代理优化。二者均基于 Gemini 3 Pro,文本输入上限 8000 token,音频输出上限 64000 token。
最引人关注的是“造声”能力。用户可用自然语言提示,在 100 多种语言与方言中自定义角色、口音与声音特征;语音库由此前的 30 种扩展到 2000 多种现成音色,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。语音复制只需 30 秒音频样本,系统要求声音所有者先录制一段口头授权并核验通过才会生成。
表演控制方面,模型支持逐行指导,用户可自行撰写舞台提示,也可交由 Gemini 依据脚本线索发挥。官方称长篇生成可在数小时连续音频中保持音色、节奏与角色稳定,说话人漂移极小;原生双声音场景编排能从单个脚本驱动多轮对话,并可插入笑声、叹息等非语言提示以及“嗯”“对”之类的应答词。
成绩上,Flash TTS 在 Hume AI 语音设计基准中以 71.4 分位列总体第一,口音建模 60.8 分同样领先;两款模型在 Hume AI 综合质量指数上分列前二,并在 Voice Arena 盲测的日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语与印地语中排名居前。
所有生成音频均嵌入 SynthID 水印并附带 C2PA 凭据。谷歌 DeepMind 表示,前沿安全评估未发现较 Gemini 3.7 Flash 出现重大新能力。目前 Flash TTS 已登陆 Gemini Notebook、Flash-Lite TTS 进入 Google Vids,企业版将经由 Gemini Enterprise 提供,Figma、HeyGen、Wondercraft 等伙伴已接入。