字节跳动今日推出SeedRealtime原生音视频全双工大模型,把文本、音频、视频融合进一套统一架构,实现实时多模态交互。可以做到边看画面、边听声音、同步对话反馈,不再是分开处理音频和视频。该模型主要面向直播、虚拟数字人、实时客服等场景,已经在内部产品开启灰度测试。

字节跳动今日推出SeedRealtime原生音视频全双工大模型,把文本、音频、视频融合进一套统一架构,实现实时多模态交互。可以做到边看画面、边听声音、同步对话反馈,不再是分开处理音频和视频。该模型主要面向直播、虚拟数字人、实时客服等场景,已经在内部产品开启灰度测试。
