下载

上海人工智能实验室开源 Intern-S2-Mobius,昇腾训推使能Mobius加速

产业开发者

发表于 2026/08/10

摘要:上海 AI 实验室正式开源基于 Mobius 系列架构训练的 Intern-S2-Mobius。该架构通过解耦知识存储与组合推理,探索提升模型推理效率、持续学习、组合泛化的新路径。现有实验显示,在下游任务准确率不低于对照模型的情况下,Mobius 端到端推理效率 Transformer 提升近 4 倍,并在数据压缩率和知识组合泛化任务中展现出进一步潜力。该模型基于昇腾384超节点上实现原生训练和推理,联合昇腾共同优化的Mobius架构,在Xtuner训练与LMDeploy推理框架下的运行表现相对于Transformer 提速明显。在昇腾超节点算力架构的加持下,未来有望激发出 Mobius更大的效率潜力。

伴随着单纯依靠扩大数据量和参数规模所带来的边际收益逐步趋缓,AI 模型研发正处在从规模扩展走向结构创新的关键阶段。如何在“Scaling Law”之外寻找新的能力增长路径,已成为学术界和产业界共同关注的问题。

上海人工智能实验室(以下简称上海 AI 实验室)近日正式开源 Mobius 系列架构,该架构将知识存储与组合推理解耦,旨在拓展模型在持续学习、组合泛化等方向上的能力边界,并以架构层面的能力提升进一步推动训练和推理效率优化。


Github 链接:https://github.com/InternLM/Intern-S2-Mobius

Huggingface 链接:https://huggingface.co/internlm/Intern-S2-Mobius

Arch Space 链接:https://github.com/InternLM/archspace/issues/9


Transformer 的“三重瓶颈”

自 Transformer 问世以来,工业界通过持续扩展数据量和参数规模,以较高的投入产出比推动模型能力快速提升。相关模型在自然语言、代码、数学、视频等任务上取得了前所未有的进展。

但随着基于 Transformer 的模型规模不断扩大、能力持续增强,架构层面的三类局限也日益值得关注:

•学过的知识,难以快速、完整地调用;

•新知识的高效写入与稳固记忆,成本较高;

•未直接学习过的内容,难以通过知识联想与组合进行构建;

在一种常见的解释框架下,前馈神经网络(Feed-Forward Network,FFN)主要承担知识存储功能,注意力机制(Attention)主要负责组合推理。不同层的 FFN 存储不同知识,同一词元(Token)在不同层可能激活不同信息;不同层的 Attention 则完成不同形式的组合,同一组知识输入也可能产生不同的推理结果。由于 Transformer 按层顺序计算,当前层的 Attention 主要处理此前层级产生的表征;借助层间残差连接(Residual Connection),更早层级的信息也可以被传递到后续层。

从这一层次化的记忆与推理机制出发,可以看到三个具体限制:

•在推理过程中,模型需要依次经过各层才能调用分散存储的知识。如果关键知识未在恰当阶段被激活,模型往往需要延长生成过程,以增加后续再次调用相关知识的机会;

•知识分散在不同层中,既可能重叠,也存在耦合。学习新知识时,模型难以对写入位置进行显式管理,通常需要联动更新大量参数;

•不同层之间的信息交互主要依赖残差连接。随着层数加深,较浅层信息可能被逐步稀释,从而限制跨层知识直接组合的效率。

由此可见,分层的记忆与推理机制不仅影响知识读取效率,也增加了知识写入和跨层组合的难度。构建更高效、更灵活的记忆与推理机制,可能成为进一步拓展 AI 模型能力边界的重要方向。

围绕上述问题,国内外头部基础模型团队都在积极探索 Transformer 的架构改进。其中,一类代表性方向是利用稀疏注意力、线性注意力等机制降低计算复杂度,以缓解算力约束、提升训练和推理效率。在资源受限的条件下,这些方案为更大参数规模的训练提供了支撑,也推动国内模型能力逐步接近国外闭源模型。但从长期看,降低复杂度主要解决的是效率问题;这类架构能否同步拓展模型的能力上限,仍需持续观察和验证。


Mobius:解耦知识存储与组合推理

针对上述问题,上海 AI 实验室提出一种新的架构思路:拆解不同层中记忆与推理的耦合关系,将各层知识统一组织为共享记忆池,使每一层的 Attention 都能够访问其中的信息。在这一设计下,上述三类问题有望得到缓解:

在推理层数相同的情况下,共享记忆后的模型能够更多次遍历(Traversal)知识,提高提取关键信息的概率,从而更容易生成有效输出;

知识采用扁平化组织后,新知识的写入位置更加清晰,有助于降低局部更新对整体知识结构的扰动;

每次访问共享记忆库时,所有知识都有机会被同时激活,从而增加不同知识直接交互的机会,并有望带来更好的组合泛化能力。

现有实验显示,在下游任务准确率不低于对照模型的情况下,Mobius 端到端推理效率较 Transformer 提升近 4 倍。此外,Mobius 也在知识写入和组合泛化方面展现出积极信号:使用 60% 的数据,Mobius 即可达到与 Transformer 相近的 MMLU PRO评测分数,体现出更高的数据压缩效率;在部分知识组合泛化任务中,其表现达到 Transformer 的 2 倍效能。

35B 续训练的推理速度
35B 续训练的 CoT 长度
35B 续训练的下游任务得分
7B 从头预训练的 MMLU 分数
Toy Model 的组合泛化验证


原生支持反向残差连接与动态隐空间推理

近期围绕残差连接(Residual Connection)和隐空间推理(Latent Reasoning)的架构改进受到广泛关注。

从这两个视角看,Mobius 的设计可以被理解为原生支持反向残差连接(Backward Residual Connection)和动态隐空间推理(Dynamic Latent Reasoning)。

从早期的 ResNet,到近期的 Hyper-Connection、Attention-Residual,这类机制的共同目标之一,是在前向传播过程中将浅层信息传递至深层。其局限在于,前向信息流仍主要沿层级单向展开,当关键知识未被及时调用,或深层知识构成浅层知识的读取前提时,模型可能需要通过额外生成延长推理过程。

Mobius 将不同层的知识统一组织起来,使后续计算能够重新访问此前层级的知识;从机制上看,这可以理解为引入了一种反向残差连接,有望增强信息传递的灵活性,并改善知识压缩率和推理效率。

相比逐 Token 的显式推理,隐空间推理使用隐状态(Hidden States)连接不同循环,也发挥了类似残差连接的作用。但传统隐空间推理仍存在效率约束:一方面,模型每次循环通常都要经过所有层,即使部分层的知识已不再必要;另一方面,多次迭代往往只用于更新单个 Token 的表征。

相比之下,Mobius 原生支持更为动态的隐空间推理机制。一方面,每一层都有机会访问全部知识,且不预先限定必须激活的知识,因此模型每经过一层都可以被视作完成一次隐空间推理,并通过更灵活的激活选择减少冗余计算。另一方面,Mobius 在每一层迭代的不只是单个 Token 的表征,因此能够形成更高效的迭代过程,以及更连续、可微的优化路径。


面向递归自进化、AI 辅助科学发现与世界模型

递归自进化、AI 辅助科学发现和世界模型,正成为重要且亟待突破的前沿方向:

现阶段的递归自进化研究涵盖数据迭代、参数迭代、架构迭代等多种路径。无论采用何种方式,都需要构建高密度、高灵活性的记忆存储与拓展机制,以支持模型持续成长;

如果说 Coding 主要面向流程性问题,那么 Research 往往是流程、直觉与知识组合泛化的共同作用。要推动科学发现,需要让足以发掘“未知的已知”的关键知识既存储在模型中,又能在同一次推理过程中被有效激活;

语言模型主要建模离散 Token,世界模型则需要建模连续的物理世界。现实世界具有丰富的波段与模态,因此,相较语言模型,世界模型对连续、可微的理解与推理机制提出了更高要求。

Mobius 对知识存储与组合推理进行解耦,回应了递归自进化和科学发现对记忆机制、知识调用与组合泛化的核心需求,因此有望在这两个方向展现出不同于 Transformer 的架构潜力。其原生支持的隐空间推理机制的特性,也可能为世界模型的架构提供新的思路。与此同时,若要更充分地适配世界模型,Attention 机制本身仍可能需要进一步调整,相关方向将在 Mobius 后续版本中持续探索。


为趋近 Mobius 的能力上限,软硬协同设计已经在路上

现阶段,Mobius 已展现出端到端推理效率优势,但这部分收益主要来自更高效的推理路径,以及由此形成的更短思维链(Chain-of-Thought,CoT)。若仅比较单个 Token 的推理效率,Mobius 相较 Transformer 还有一点距离,主要源于Mobius 架构在算法层面对知识与推理解耦的设计,该设计在硬件上表现为存储与计算的分离,对访存与通信提出更高需求,这也成为 Mobius 进一步提升推理效率的主要阻碍。

在训练框架方面,基于上海 AI 实验室自研的 Xtuner 框架,实现了Mobius架构下的显存优化、数值一致性对齐、专家负载均衡以及RL全链路分析等相关优化。在推理优化上,上海 AI 实验室充分发挥自研 LMDeploy 框架的底层优势,从 Kernel 入手,针对 2560 专家(MoE)的稀疏计算模式做了针对性优化。同时,借助 Mobius 短思维链的特点,最终将整体推理效率提升至原来的数倍,大幅降低了延迟与算力成本。

目前,Mobius 已经初步实现了在 昇腾384超节点算力上的原生训练和推理,技术适配模块已完成开源发布。相较于其他GPU算力,昇腾384超节点对于多机通信有着更好的支持,显著契合Mobius架构对于更大通信带宽、更低通信时延的诉求。基于昇腾384超节点,上海AI实验室和昇腾的联创科研团队将进一步优化Mobius架构在Xtuner训练与LMDeploy推理框架下的运行表现,使其更亲和昇腾超节点算力架构,有望在未来激发出 Mobius更大的效率潜力。

昇腾384超节点上的测速结果,Mobius 相对 Transformer 有明显提速

上一篇

代码侦探挑战赛(第三期)开启|补全算子代码赢定制奖品

下一篇

代码侦探挑战赛(第二期)开启|补全算子代码赢定制奖品