众力资讯网

minimax把海螺H3开源了,这是一个挺不错的模型。我看过有人内测的,视频生成

minimax把海螺H3开源了,这是一个挺不错的模型。我看过有人内测的,视频生成的还不错。据说comfyui做了量化和优化,可以在3060上非常缓慢的跑。这应该是近期非常有亮点的开源模型了。

下面是具体介绍:1. 一个"全能型"的视频生成模型 H3 是一个多模态生成系统,不仅能看图、看文字、听声音,还能同时生成带原生立体声的视频——最高支持 2K 分辨率、最长 15 秒、24 帧/秒,横屏竖屏各种比例都行,还会说 11 种语言。简单说就是:给它文字、图片、视频、音频,它能直接"一条龙"产出带声音的视频。

2. 输入非常灵活参考素材随便给 H3 分两个版本:一个是"首尾帧模式"(给一张或两张图,就能生成视频,不给图就是纯文字生成视频);另一个是"全参考模式",最多可以塞 9 张图 + 3 段视频 + 3 段音频 一起作为参考,它都能理解并生成出符合要求的视频。就像你给导演一堆素材,让他拍成片。

3. 整个系统是"三段式"流水线 H3 完整系统由三部分组成:H3-Context-IR(负责"读懂"你给的复杂指令,整理成模型能理解的形式)、H3-Base(真正干活生成 768p 的视频和音频)、H3-Regenerate-2K(把 768p 的结果再"回炉"重生成一遍,变成 2K 高清版,细节更准)。注意:第一和第三个模块目前没有开源,只能通过官方 API 调用,开源的是中间的 H3-Base。

4. 技术内核:一个 330 亿参数的"大一统"Transformer H3 没有给视频和音频各搞一套模型,而是把它们压缩成统一的"token 序列",交给同一个 33B 参数的 Transformer 一起预测。视觉用 16 倍空间压缩、4 倍时间压缩的 VAE,音频是立体声双声道独立处理。还内置了稀疏注意力来省算力(不过开源版暂时只有全注意力,稀疏版本以后才发)。

5. 开源范围和使用方式 这次开源的是 H3-Base 两个任务版 checkpoint(含处理器、分词器、文本编码器、视觉 VAE 和音频 VAE),可以直接本地部署生成 768p 视频。想要完整体验(Context-IR 预处理 + 2K 超清),需要用官方 API——平台是 minimax 的 API(分海外和国内版),网页应用叫"海螺 AI"(hailuoai)。

模型地址:huggingface.co/MiniMaxAI/MiniMax-H3