众力资讯网

🤯 一张图就能"活"起来!Vivix发布全球首个实时互动模型,AI角色第一次真

🤯 一张图就能"活"起来!Vivix发布全球首个实时互动模型,AI角色第一次真正"听懂"你说话
你是不是也遇到过这样的场景——打开一个AI对话,对着屏幕打了一堆字,等它慢慢生成回复。想让它换个姿势?不行,得重新再跑一次。想中途插句嘴?抱歉,它已经自顾自说完了。
7月24日,Vivix灵动时刻打破了这堵墙。
这家由前商汤核心人物刘宇创立的AI独角兽(成立10个月估值13.2亿美元,红杉、IDG押注),正式发布了全球首个实时互动模型体系——Vivix-A1和Vivix-W1。这不是又一个把文生视频压到几秒钟的速度竞赛,而是直接改变了AI内容的底层逻辑:视频不再是"文件",而是一条能被你实时改写的"时间线"。
🔥 A1做"演员",W1做"导演"
Vivix-A1(开放世界演员)——专注做"活人"。它能生成一个完整全身的AI角色,有表情有声音,能走路、转身、跳舞、拿东西。最关键的是,你可以在它生成的过程中直接插话——"转身看看那件衣服""换开心的语气"——它不用中断、不用重来,直接在正在生成的视频流里跟着你变。首帧渲染延迟仅300-600毫秒,端到端响应低于1.7秒,原生打断只需300-900毫秒。
Vivix-W1(开放世界剧情)——专注"讲故事"。你说一句"外星人入侵地球",它就开始持续生成带镜头切换、对白和环境音的故事。你看着看着突然说"改成外星人是来帮助主角的",剧情走向立马跟着变。
说白了,A1就是那个随时听你指挥的"演员",W1就是那个边拍边改剧本的"导演+编剧+摄影"一体机。
📊 三个场景,一个比一个炸
场景一:直播电商——AI主播可以自由走动、拿起商品展示、你喊一嗓子"换左边那个",她不用卡顿不用重启,自然地在说话间隙切换过去。对现在那些"钉在屏幕前对口型"的数字人来说,这是降维打击。
场景二:虚拟陪伴——角色的动作、表情和语音是原生同步的,看不出分别输出再拼接的痕迹。它不用先转文字再规划动作,而是声学信号直接驱动视觉行为。你感受到的是一个"活人",不是一个拼凑的木偶。
场景三:互动短剧——你说一句话,W1就开始"拍电影"给你看。你说"改成雨夜追凶",画面和情节就跟着变。这是AI内容从"被动观看"到"主动参与"的拐点。
💡 为什么这次不一样?
过去绝大多数"实时"仍然是"加速版的请求-响应循环"——你给条件,它快速返回结果,你再给下一条。模型输出时你无法介入,你操作时模型已经停了。
Vivix的核心突破是统一流式架构:把多模态输入、时序状态和音视频输出放进同一条持续生成的链路。模型一边接收你的语音、文字、图片甚至触控,一边向前生成画面。
而且在消费级显卡上就能跑通——单卡吞吐超10000 video tokens/s,实时推理成本低于1美元/小时。这意味着这不是实验室概念,而是可以快速落地到直播、电商、游戏、教育这些真实场景中。
⚡ 局限存在,但方向已定
Vivix自己也承认,A1在复杂快速运动和精细物体交互上还有改进空间,W1的画质暂时还比不过头部离线视频模型。但这一步的意义不在画质——它第一次让AI视频从一个"文件"变成了一个"过程"。
它真正的竞争对手不是Sora、不是Runway,而是游戏引擎和实时数字人系统。它卖的不是某个10秒镜头有多精致,而是内容能否在播放过程中听你的话。
你觉得这样的AI角色,最先会在什么场景里火起来?直播带货、虚拟陪伴、还是互动短剧?评论区聊聊你的看法 👇