众力资讯网

Google发数字人模型,30秒克隆你的声音 你上一次对着屏幕跟AI打字聊天

Google发数字人模型,30秒克隆你的声音

你上一次对着屏幕跟AI打字聊天是什么感觉?是不是总觉得中间隔着一层玻璃——你敲一句,它回一句,像在给一个看不见的客服留言。今天Google把这层玻璃砸了。

9月25日,Google DeepMind扔出Gemini 3.8 Live,最狠的不是参数堆多大,而是它第一次让AI有了"脸"和"表情"。

数字人不是换皮,是"面对面"的开始
过去我们用AI,本质上是在发短信。你问它问题,它回你一段文字,你得自己脑补语气、情绪、可信度。Gemini 3.8 Live装了个叫Live Avatar的东西——它能在视频里生成一个数字人,嘴型跟说话内容精准对上,表情会自然变化。你盯着屏幕看,对面就像坐着一个真人在跟你唠嗑。

这事儿的意思不是"AI变好看了",而是交互方式变了。以前你是"用户",现在你是"对话者"。

更关键的是,它能一边跟你说话,一边在后台干活。你让它查个航班、整理个文档,它脸上带着表情跟你聊,手底下同时把事办了。这就像你开会时旁边坐了个助理,一边给你递话,一边默默把会议纪要写了——你甚至不用停下来等它。

30秒录音,声音就是你的
跟数字人一起发布的还有Gemini 3.8 Flash TTS。这个功能简单粗暴:你录30秒自己的声音,它就能学会你的音色,然后用你的声音读任何你写的稿子。

做短视频旁白的人最懂这意味着什么。以前你得自己一句一句录,或者找配音演员花大价钱。现在把文案丢进去,30秒录音当样本,AI用"你的声音"把整篇稿子念出来,断句、语气、停顿都像你本人。

不想用自己的声音也行?你用文字描述——"一个中年大叔,带点东北口音,低沉浑厚"——它直接给你生成一个新嗓子。官方说支持100多种语言和方言,2000多个现成声音,定制过的还能存下来反复用。

但Google留了两道安全栓
这事最容易让人慌的就是"换脸换声诈骗"。Google自己也想到了:第一,克隆声音之前要有明确的授权确认流程,不是你录一段就能随便拿去用;第二,生成的音频和视频里加了AI水印,标明这东西是合成的。这两道栓虽然不能完全杜绝滥用,但至少把门关上了大半。

定价方面,Gemini 3.8 Flash是每百万输入token两美元、输出token十二美元。这个价格在大厂模型里属于中等偏下,不算贵得离谱,但也不是白送。

谁最先被改变?
我觉得三类人会最先感受到冲击:

内容创作者——旁白、配音、课程讲解的成本会被打下来。以前一个知识博主录一门课要花几十小时对着话筒念,现在写好稿子,AI用你的声音两小时念完。

在线教育——老师可以把一门课录一次声音,之后所有视频都用这个声音讲,数字人当出镜老师,老师本人甚至不用天天露脸。

客服和销售——现在的客服机器人还是个文字输入框,以后可能就是一个有表情、会说话的数字人,坐在网页里跟你视频通话。

但我有个判断:数字人不会马上取代真人出镜,因为观众对"真人感"的信任还在。它更像一个"24小时不下班的替身"——你睡觉的时候,它用你的脸和声音帮你直播、答疑、讲课程。

互动题:如果AI能用你的声音和脸24小时替你直播讲课,你愿意让它上吗?你觉得观众能看出来对面是AI吗?

科技 AI大模型 人工智能