最新动态

2026年08月05日

你的位置: 首页> 最新动态> 正文
华业伙伴|Sand.ai开源并发布MAGI-2 Preview,全球首个千亿级开源MoE视频生成模型

今天,华业天成早期投资项目Sand.ai正式发布并开源 MAGI-2 Preview。这是全球首个千亿级开源 MoE 视频生成模型,总参数约 114B,单次前向计算仅激活约 6B 参数。


开源地址:

https://github.com/SandAI-org/MAGI-2-preview

https://huggingface.co/sand-ai/MAGI-2-preview 




凭借 6B 激活参数,MAGI-2 Preview 在 Artificial Analysis image to video 视频生成榜单排名第六。

按照当前 8 卡 H100 的月租金折算生成 10 秒 1080P 视频的推理成本约 0.5 元「蒸馏后模型」,每秒成本约为行业主流模型的十分之一。

MAGI-2 Preview 想回答两个问题:视频模型怎样稳定扩大规模,继续抬高能力上限;模型变大之后,怎样控制训练和推理成本。

参数、榜单和成本,最终都要落到画面与声音里。

先看一组MAGI-2 Preview 生成的视频。


电影级视频场景



复杂运动与镜头语言



产品、品牌广告场景



动漫场景



01
统一音视频,
让镜头从模型内部长出来


上面这些视频中,声音和画面均来自同一次生成。

人物说话时,模型也在生成相应的口型、表情和身体动作;环境里传来撞击声,画面中的物体要在同一时间作出反应;音乐节奏发生变化,人物表演和镜头推进也要随之改变。

这些细小的同步关系,决定了一个镜头能否成为完整的表演。

传统多流方案通常为画面和声音设置不同的主干网络,再通过 cross-attention 或后处理将它们连接起来。音频与视频在生成早期分别建模,音画对齐更依赖后续连接,链路越长,延迟和误差越容易累积。

为解决这一问题,MAGI-2 Preview 延续了我们在 daVinci-MagiHuman 论文《Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model》中提出的单流架构。文本、视频和音频进入同一个上下文,在同一个 Transformer 中,通过每一层 self-attention 持续交换信息。

模型内部还设置了共享专家与模态专属专家。共享专家处理三种模态之间的共性,专属专家分别处理文本、视频和音频独有的信息。语言理解、人物外观、运动时序、语音和环境声等能力,可以在同一个镜头中共同发挥作用。

统一主干也缩短了生成链路,减少多套模型串联带来的接口、等待和维护成本。对于广告、短剧、动画和游戏内容,一次生成可以更接近一个同时包含画面、声音与表演的完整镜头。

音画进入同一个模型,计算压力也随之上升。一段视频会被拆成大量空间 patch 和连续帧,再加入音频与文本,序列长度和信息量迅速增加。怎样让一个 114B 的统一音视频模型跑得动,成为下一个问题。


02
10 秒 1080P,推理成本仅 0.5 元


按照当前 8 卡 H100 的月租金折算,MAGI-2 Preview 「蒸馏后模型」生成 10 秒 1080P 视频的推理成本约 0.5 元。



几毛钱和几块钱之间,看起来只是一个小数点的差别,但放到真实创作里,改变的则是成本结构和内容生产方式。

生成视频很少一次就完全符合预期。人物的一个动作、镜头的一次转向,甚至一句对白的停顿,都可能影响最终效果。单次成本降下来,同样的预算可以测试更多提示词,调整动作、构图和风格,再从多个版本中筛选可用镜头。

创作流程也会逐渐转向多版本生成、自动筛选和人工选择。对于内容工具、广告系统、游戏资产生成和虚拟人互动,低成本还意味着模型可以被持续调用,视频生成开始具备进入高频应用的条件。

这组成本数字背后,是 MAGI-2 Preview 的 MoE 架构:总参数约 114B,每次前向计算只激活约 6B。


03
114B 总参数,单次只激活 6B


视频生成从短片段、无声画面走向更长、更复杂的统一音视频内容的过程中,模型需要同时处理人物与场景一致性、动作与镜头变化、对白、环境声和节奏,能力边界不断扩大,需要的模型容量也随之增加。稠密模型扩大规模时,每个 token 都要经过全部参数。模型越大,训练和推理需要的计算也越多。

视频进一步放大了这个问题。文本模型通常处理几百或几千个 token,视频还要容纳连续帧、大量空间 patch 和音频信息。序列长度与模态复杂度一起上升,计算量和跨设备通信开销很快被推高。

MoE 在模型内部设置一个庞大的专家池,每个 token 只选择与当前任务相关的一小部分专家参与计算。模型由此可以继续扩大容量,同时控制实际调用的参数量。

MAGI-2 Preview 用约 114B 总参数容纳更丰富的人物、动作、镜头、材质、语义、语音和环境声信息,再用约 6B 激活参数控制单次生成的计算量。

为了让专家分工更细,Magi-2 Preview 将 3072 维隐藏表示拆成 12 个 256 维 head,并在 36 层主体网络中使用 Multi-Head MoE。

每个 head 拥有 256 个专家,每次选择其中 6 个。每一层由此形成 3072 个 head-local 专家单元,一个 token 在 12 个 head 中合计激活 72 个小专家。我们将这种结构称为 Ultra-fine-grained MoE。

传统 MoE 通常针对一个 token 的完整隐藏表示进行路由,少数专家需要同时处理其中包含的多种特征。Multi-Head MoE 先把表示拆进多个低维子空间,再由每个 head 独立选择专家。

不同 head 因而有机会形成更细的分工,分别处理人物外观、动作时序、语言语义、语音或环境声。12 个 head 的结果在后续网络中重新融合,模型不仅可以获得更丰富的专家组合,还能把每个专家的任务控制在较小范围内。

专家数量增加后,新的问题随之出现,这些专家分散在不同设备上,token应该怎样送过去?


04
视频生成模型的 MoE,难点藏在通信里


传统 Expert Parallel 会先为 token 选择 Top-K 专家,再把 token 发送到专家所在的设备。

路由结果会随输入动态变化。某块 GPU 可能突然收到大量 token,另一块 GPU 却没有足够任务;激活专家越多,设备之间需要传输的数据通常也越多。到了视频的序列规模,通信和负载波动很快会成为瓶颈。

MAGI-2 Preview 受到 Multi-Head LatentMoE and Head Parallel 的启发,引入 Head Parallel 改变通信顺序。




模型先将隐藏表示拆成多个 head,在动态路由发生前,把固定形状的 head 表示分发到不同设备。数据抵达设备后,再在本地选择和执行专家。

传统 Expert Parallel 的通信量依赖每次路由产生的 Top-K 结果。而Head Parallel 的主要通信量由输入表示决定,避免通信规模随激活专家数量线性增长。这一顺序变化为细粒度专家留下了更大空间。模型既可以容纳更多专家,提高路由精度,又能让跨设备流量保持相对稳定。

架构走到这里,只完成了一半。剩下的一半,要靠系统把它真正跑起来。


05
千亿参数背后,是一套自研infra


Multi-Head MoE 对基础设施提出了新的要求,数千个细粒度专家会带来频繁的路由、数据重排和小矩阵计算。直接使用通用 MoE 系统,新增的模型容量很容易被通信和调度开销抵消。

为此,我们围绕 MAGI-2 Preview 开发了 MagiMoE、Head Parallel 和分布式优化器 MagiMuon,覆盖专家计算、跨节点通信和千亿参数模型的稳定训练。

MagiMoE 是我们自研的高性能 MoE kernel 库。它把专家路由、排序和计算等步骤融合执行,减少中间结果与显存搬运,并针对 Multi-Head MoE 中的大量小矩阵计算优化前向和反向过程。它还支持不同 kernel 后端和低精度路径,为后续硬件适配和模型迭代保留空间。




Head Parallel 负责控制跨节点通信。张量并行、上下文并行、专家并行和参数切分,则共同承担主体网络与千亿参数的扩展。多个并行策略需要在同一套系统中配合,任何一个环节长时间等待,都会让大量 GPU 空转。

训练优化上,分布式 MagiMuon 使用 Muon 处理主体矩阵参数,用 AdamW 处理更适合常规更新的参数,并针对海量细粒度专家重新适配参数组织和跨设备计算。这种混合设计可以让不同性质的参数采用相应的更新方式,也能让优化方法从中小规模实验稳定扩展到千亿参数 MoE 训练。

MagiMoE、Head Parallel 和 MagiMuon 共同构成了 Magi-2 Preview 的基础设施。视频模型的 Scaling 从来不是单纯的参数增加,背后更难扩展的是通信效率、计算效率、数值稳定性和训练监控。

Magi-2 Preview的价值在于,它让模型设计与系统能力在同一次规模化训练中得到了验证。


06
从“清洗优先”转向“覆盖优先”,
Scaling 需要重新理解数据


模型规模扩大后,数据管线也要跟着变化。过去,行业常把数据质量理解为层层过滤:删除画质较差、构图不够整齐、动作不够典型的数据,留下一个更干净的数据集。

层层过滤可以降低噪声、提高训练稳定性,却也可能删掉复杂运动、特殊镜头、罕见主体、非典型声音和长尾组合。真实世界的多样性,往往就藏在这些“不够标准”的数据里。

因此,在 MAGI-2 Preview 的训练中,我们更强调数据规模、多样性和分布覆盖。数据工作的重心也从删减转向组织:通过更准确、更细的标注,帮助模型理解主体、动作、场景、镜头、时序,以及声音、画面和文本之间的关系。

预训练尽可能完整地覆盖数据分布,后训练聚焦偏好、安全、可控性和产品适配。基础模型学得越充分,产品端依靠额外模块修补动作一致性、画面细节和音画关系的压力就越小。

对视频模型而言,Scaling 是模型、数据与系统的共同扩展。任何一处失速,参数规模都很难稳定转化成生成能力。

MAGI-2 Preview 验证了一条清晰的技术路线:用统一单流架构共同生成画面与声音,用 Ultra-fine-grained MoE 扩大模型容量,再通过 Head Parallel 和自研基础设施控制通信与计算成本。接下来,我们将继续扩大模型与数据规模,探索更长时长的视频生成,进一步提升生成质量、音画同步和长时一致性,并持续降低单位生成成本。


返回 下一篇