模型总参数约 114B,但它生成视频时,单次只激活约 6B 参数。
乍一看很奇怪:都做到千亿参数了,为什么不用全?
因为视频生成太吃算力了。
一段视频里有画面、有连续帧,还有声音和文本。模型变大以后,GPU 真正难受的地方,往往是数据在不同设备之间来回传。
参数一多、专家一多,通信就容易堵。MAGI-2 用的是 MoE 架构。
你可以把它理解成一个很大的专家库。做人物、动作、镜头、声音、语义的专家都在里面。生成一条具体视频时,系统挑一部分最相关的专家参与,其他专家先不动。
所以 114B 更像是模型储备的能力总量,6B 是这次任务实际动用的计算量。
技术报告里还有一个细节:它把一个 token 拆成多个小 head,每个 head 自己挑专家。这样人物外观、运动轨迹、环境音、对白这些信息,可以由不同的小组分别处理,最后再合起来。
对于视频这种长序列任务,分得更细会更好调度。这套设计还有一个现实意义。
过去看视频模型,大家习惯先看参数量、分辨率、时长和 Demo。
接下来可能还得加几项:
1. 生成一秒视频要花多少算力
2. 生成速度怎么样
3. 音画同步和动作稳定性怎么样
4. 同样效果下,成本能不能降下来
MAGI-2 Preview 给出的信号挺明确:视频模型还会继续做大,但“每次都全量计算”这条路越来越贵了。

