科技 Bestblogs · InfoQ 中文 · 昨天 14:33 · AI 生成
Ming-Flash-Omni:全模态统一大模型的关键技术与实践 蚂蚁集团分享了其全模态统一大模型 Ming-Flash-Omni 的技术架构,核心在于解决模态统一、任务统一和工程优化三大挑战。文章提出多路由器(Multi-Router)和动态专家分配(AnyExperts)方案以处理跨模态融合,并基于 Meta X 架构探索理解与生成任务的统一。适合对多模态大模型前沿技术架构和工程实践有深度了解需求的 AI 从业者与研究者阅读。原文 ↗ 原文 ↗
核心观点
▍ 全模态统一大模型面临模态统一、任务统一和工程优化三大核心挑战,Ming-Flash-Omni 分别提出了多路由器、基于 Meta X 架构的生成式分割以及全模态序列 packing 等解决方案。 01 模态统一方面,采用多路由器(Multi-Router)为不同模态设计独立路由器,避免专家分化;同时使用 AnyExperts 根据 token 重要性动态分配专家数,提升训练效率。 02 任务统一方面,基于 Meta X 架构,冻结理解模型 backbone,引入可学习 query 生成控制条件,实现理解与生成的结合。 03 生成式分割任务通过图像着色方式与编辑任务统一,以此提升模型在图像生成和编辑任务中的细粒度感知能力。 04 工程优化方面,通过全模态序列 packing 统一不同模态的序列长度,并借助跨模态 mask 实现模态隔离;采用灵活并行策略,通过线性规划优化 encoder、decoder 与 MOE 的并行布局,减少计算 bubble。 05 文章指出,理解任务需要去噪并提取高层语义,而生成任务需要还原细节、发散创造,两者的表征需求存在本质冲突。 反方 / 局限
— 文章承认尼尔森十大可用性原则虽然经典,但在面对移动互联网和 AI 交互等新范式时,其适用性边界需要被重新审视。
前置背景 理解与生成任务的表征冲突之源
为什么全模态统一模型里「理解」和「生成」不能简单放在一起?理解任务需要从海量输入中「去噪」、提取高层语义;生成任务需要「还原细节」、保留高频纹理信息。两者在特征空间上的需求本质相反——一个偏好语义压缩,一个偏好细节保真。这种「表征冲突」是 Janus、UniToken、CHEERS 等方案试图解决的统一核心难题,也是理解蚂蚁多路由器与动态专家分配设计动机的关键前置背景。
▸ 2 条关联资料
▼
平行视角 理解与生成融合的四种主流路线
业界为解决统一模型里的表征冲突,分化出四条路线:①分离式架构(如 Janus)为理解与生成各自维护独立视觉编码器,性能强但无法真正共享知识;②融合连续与离散表征(如 UniToken),用统一视觉编码兼顾两种需求;③解耦语义与细节(如 CHEERS),「先构图后润色」;④两末端分离式架构(如 Uni-X),在浅层和深层设置不同分支减少梯度冲突。蚂蚁的 Multi-Router + AnyExperts 属于 MoE 路径下的动态路由方案,与这些路线在本质是互补还是替代,值得追问。
▸ 1 条关联资料
▼
未来推演 全模态序列 packing 的下一站:负载均衡
蚂蚁用序列 packing 统一多模态数据长度,配合跨模态 mask 实现模态隔离,提升训练吞吐。但百度百舸最新发现:传统 packing 只从 Token 数量维度做负载均衡,忽视了 Transformer 注意力二次复杂度——两个节点 Token 数相同,但样本长度分布不同,计算开销可能相差巨大。蚂蚁的灵活并行策略是否已考虑这种「注意力二次复杂度」带来的实际负载不均,将是工程优化从「可用」走向「极致」的下一关键变量。
▸ 2 条关联资料
▼
延伸追问 AnyExperts 的「动态分配」边界在哪
蚂蚁的 AnyExperts 根据 token 重要性动态分配专家数,这比传统 MoE 固定激活 k 个专家更灵活。但「重要性」如何定义?是梯度幅度、困惑度贡献,还是与门控网络的相关性?不同定义直接决定训练稳定性。斯图加特团队提出的 DynaMoE 已证明:动态专家数能指数级扩展任务模式,但也会引入梯度方差增大问题。AnyExperts 是否已解决这个 trade-off,是评估这套方案能否迁移到更大规模模型的关键。
▸ 2 条关联资料
▼