月之暗面MoBA架构：长上下文LLM效率革命

同日双星：MoBA与NSA的注意力机制之争

7月X日，国内AI领域迎来两篇重磅论文——DeepSeek的NSA与月之暗面的MoBA架构同日发布。值得注意的是，两家公司的创始人梁文锋与杨植麟均亲自参与研究，引发行业高度关注。与DeepSeek仅发布论文不同，月之暗面同步开源了经过一年验证的代码库，为技术落地提供实证支持。

MoBA（Mixture of Block Attention）的突破性在于首次将混合专家（MoE）原理引入注意力层。传统MoE技术多用于前馈网络，而MoBA通过动态块划分与无参数门控机制，实现三大核心优势：

研究团队通过五步算法重构注意力计算流程：

在Llama 3.1 8B模型的扩展实验中，MoBA展现出三大核心优势：

在RULER基准测试中，MoBA模型以62.5%稀疏度达成0.7818得分，与完全注意力模型（0.7849）差距不足0.5%。实际部署显示：

MoBA的推出标志着长上下文LLM优化进入新阶段。其兼容现有Transformer架构的特性，大幅降低模型改造与训练成本。随着Kimi、DeepSeek-R1等产品的长文本需求激增，该技术或将成为下一代AI基础设施的关键组件。

此文章由OpenAI开源维基百科原创发布，如若转载请注明出处：https://openai.wiki/news-moonshot-moba-release.html