一位在曼谷机场候机的旅客,很可能碰到的不是真人地勤,而是一块屏幕上实时生成的数字人,说着流利泰语指引登机口。这项技术刚刚在7月30日被科大讯飞摆上台面,他们端出的超拟人数字人实时生成,直接把行业从“实时驱动”推到了“实时生成”这一页。更叫人没法忽视的是,国内不少团队还在打磨虚拟人的皮肤质感,讯飞这套方案已经说着37种语言,同时出现在肯尼亚运营商营业厅、阿布扎比海关和曼谷机场的服务一线。实验室里的技术,转眼就蹲在海外窗口接客,这种落地速度的反差,很自然地带出一个问题:这套能力到底是怎么搭起来的,又为什么偏要先啃海外场景这块硬骨头。
过去很长时间里,数字人更像一个需要牵线的皮影。后台得有人穿着动捕服挤眉弄眼,或者对着摄像头表演,数字人才能跟着动。一旦后台那人去趟洗手间,前台的数字人就僵住。讯飞这次把路数翻了过来,靠星火语音大模型,听到语音或看到文字,就能同步算出对应的口型、面部微表情和头部摆动,几乎是零延迟生成画面。这意味着数字人不再依赖后台真人的临场发挥,能独立面对真实用户。就像一个原本需要技师全程操控的提线木偶,忽然有了自己的反应神经。这一步跨越,让它从需要伺候的展示品,变成能直接顶班的数字化劳动力,稳定性上了一个大台阶。
让数字人顶班的底气,不单是能实时生成画面,还得能听懂话、记人事、不跳戏。星火语音大模型在这方面下了两步棋。一步是通用对话叠加垂直知识库,放在海关就能讲清出入境规则,搁在运营商展厅就能帮你查套餐,不会聊着聊着就变成一本正经地胡说八道。另一步是长期记忆和人设自定义。如果一个数字人被设定成温和耐心的导游,它会一直保持这个调性。更关键的是,它记人。你隔几天再去找它,它还能认出你,接得上上次聊到一半的话。这种“记得住事”的能力,让数字人从一次性问答机器,变成能维护客户关系的数字员工,在商业场景里,这一点远比皮肤毛孔细不细要值钱得多。
有了能实时生成、能记忆的大脑,讯飞紧跟着甩出了“1加X”多终端方案。移动数字人可以塞进手机、平板,交互导游机能部署在景区和交通枢纽。星火大模型相当于共用的脑子,X就是各种不同形态的躯壳,需要什么场景就装什么壳。一口气支持37种语言,不只是把文字翻译过去那么简单,它要求数字人的口型和微表情必须跟不同语言的音节节奏同步生成。斯瓦希里语、阿拉伯语、泰语,每一种语言的口型张力都不一样,能一次性端出37套同步方案,本身就说明背后的生成模型已经打磨到相当工程化的程度。多语言加上多终端,让产品变成了一套可以快速复制的积木,这才是能同时在非洲、中东和东南亚落地的前提,而不是靠一个项目一个项目地去硬啃。
再看落地的几个场景,肯尼亚运营商展厅里,数字人导购已经上岗,帮客户查流量、办业务,不用培训、不闹情绪。阿布扎比海关用它来做多语种通关指引,面对大量不同国籍的旅客,人力本来就紧张,数字人可以24小时不闭眼地顶上去。曼谷机场的交互导游机,直接面对全球旅客的随机提问,对反应的准确性和稳定性要求极高。这几个场景有一个共同点:客流量大、服务标准化程度高、多语言需求迫切,而且都是真金白银的商业或公共服务入口。把数字人放在这里,既是在真实环境里打磨技术,也是一种无声的信任背书。海外场景一旦跑通,回头再切国内市场,说服力就不是PPT能比的了。
从这里其实能看出一条不一样的落地路径。国内不少数字人项目还在秀demo、比参数,拼谁更像真人,而讯飞选择直接绕开内卷,把产品空降到有真实付费意愿和服务痛点的海外现场。数字人的角色也跟着变掉,它不再只是拍宣传片、当虚拟偶像的营销道具,而是进入核心服务链条,开始承担解答、导引、办理业务这类实实在在的活计。当一个说着37种语言、能记住每个旅客对话历史的数字人,在海关和机场不眠不休地干活,人与机器交互的那条旧边界,就已经被悄悄挪动了。
当然,这种铺开也把一些绕不开的问题提前推到了眼前。数字人越像人,记得越牢、脾气越好,用户可能就越不在意对面到底有没有心跳。可当一个数字员工能准确记住你的行程、偏好甚至焦虑点,这套记忆该归谁管,什么该记、什么不该记,信息安全的边界又该划在哪里。技术不会自己给出答案,但落地越快,这些追问就越不是远虑,而是近忧。
