品牌  【直播】  50强   整机  ​【联盟】  机构  【视界】  展会  招聘  云服务          微博   公众号AIrobot518 
【​今日焦点
【行业动态】
NEWS / 新闻中心
降低62% DeepSeek MoE专家激活,越疆论文入选国际顶会EMNLP
来源:越疆 | 作者:越疆 | 发布时间: 今天 | 527 次浏览 | 🔊 点击朗读正文 ❚❚ | 分享到:

近期,越疆联合中国科学院计算技术研究所、中国科学院大学南京学院、南京信息高铁研究院、中国科学院大学、中国科学院大学先进交叉科学学院共同研究发布的《Meta-Learning Where to Allocate Experts:Task-Conditioned Layer-Wise Compression for MoEs》科研论文正式被EMNLP 2026 Findings录用。

EMNLP 2026(The 2026 Conference on Empirical Methods in Natural Language Processing)将于2026年10月24日至29日在匈牙利布达佩斯举行,是计算语言学和自然语言处理领域的顶级国际会议。会议设有主会(Main Conference)、Findings、工业(Industry Track)及特别主题(Special Theme)等多个赛道。其中,Findings赛道以收录具有扎实实验验证与显著技术增量的前沿成果著称,本届EMNLP 2026 Findings赛道的录用率仅为14.3%,创历史新低。在如此严苛的评审标准下获得录用,充分彰显了该研究在技术原创性与实验严谨性上的学术认可度。

现在的 MoE 是怎么工作的?

现在的 MoE 是怎么工作的?

要回答这个问题,我们先来看一个例子:

假设MoE是一家有 64 位专家员工的咨询公司。

不同员工擅长不同事情:

  • 专家1:数学 

  • 专家2:法律 

  • 专家3:医学 

  • 专家4:编程 

  • …… 

  • 专家64:其他领域 

当客户来了以后,公司有一个前台调度员 Router:

“这个问题应该找哪几个专家?”

传统 MoE 的做法比较简单:无论客户是谁,每一层固定叫 6 个专家过来。

这就是论文里 DeepSeek-MoE-16B-Chat 的原生设置:

64个专家 → 每个 token 固定激活6个。

问题来了:

客户A问:

“1+1等于多少?”

可能只需要2个专家。

但 Router还是叫了6个人。

客户B问:

“请分析量子力学与广义相对论之间的关系。”

可能需要8个甚至10个专家。

但是 Router还是只能叫6个人。

很显然,问题简单的时候,浪费算力;问题复杂的时候,又不够用。

于是这篇论文提出一个非常直观的问题:

为什么不让模型自己决定,这一层到底该叫几个专家?

MetaNet的研究切入点正在于此:不重新设计专家体系,而是在已有高性能MoE模型之上,解决"模型训练完成后,面对不同任务,每一层究竟应调用多少专家"这一推理策略问题,为大模型在具身智能等算力受限场景的部署提供了新的技术路径。

MetaNet如何做到“精准调度”?

第一步:先拿几个小样本,认识一下任务。比如现在来了一个“法律问题回答任务”。

先给模型看几个例子:合同纠纷、知识产权、劳动法……

这几个例子就是 Support Set。

模型先通过这几个例子,快速判断:“哦,这是个法律类任务,大概率需要哪几个专家。”

第二步:观察每一层专家的使用情况,再决定压缩多少。模型会去看每一层里,64 个专家的“忙碌程度”分布。

比如第 10 层可能是这样:


说明这一层高度集中在少数几个专家身上。

那这一层就可以少叫几个专家,省点算力。

反过来,如果某一层的分布是这样的:

说明这一层需要很多专家同时参与,那就不能压缩得太狠。

论文主要用三个指标判断:

Routing Entropy:路由熵 

Maximum Expert Probability:最大专家概率 

Top-R Routing Mass:Top-R专家覆盖多少路由概率 

简单理解:

专家选择越集中 → 越容易压缩

专家选择越分散 → 越需要保留更多专家


所以 MetaNet 其实做了两个决策:

预算:这一层到底用几个专家?

优先级:优先选哪几个专家?

它不是把原来的调度员换掉,而是在原来的调度员上面,加了一层“智能排班系统”。

原来的调度员还是主要决策者,MetaNet 只是轻轻地干预一下,告诉它:“这层少叫两个,那层多叫一个。”

实验验证:在严苛条件下验证“按需分配”的有效性

为验证“按需分配”的有效性,实验以DeepSeek-MoE-16B-Chat为主干,全部参数冻结,仅训练MetaNet控制器。评估严格划分训练、验证与测试集,主结果基于192个未见样本,杜绝数据泄露。

结果显示:

激进模式下激活专家减少62%,MMLU准确率仅小幅下降;保守模式下激活减少40%,准确率与原模型相当。固定低预算策略在同等激活量下表现显著更差,证实逐层差异化分配优于全局统一配置。

更重要的是,MMLU上训练的控制器无需调整即可迁移至C-Eval和OLMoE,均实现激活量大幅降低且性能优于同预算基线。这表明MetaNet学到的是可泛化的任务-资源匹配策略,而非对特定数据的记忆,具备实际部署价值。


减少62%的激活专家 ≠ 推理速度提高62%

不过论文也强调:减少62%的激活专家 ≠ 推理速度提高62%。

实验中:专家激活数量减少 62%,但是实际 latency减少的只有约4.9%。

论文测试中 aggressive MetaNet:

542.94ms → 516.52ms

仅降低约4.9%。

为什么?

因为 LLM 推理还有:

Attention

Token dispatch

Permutation

GPU communication

Synchronization

Expert computation

减少专家,只减少其中一部分。

当前大模型的能力提升,很大程度上依赖参数规模的持续扩张。但参数量并非越多越好,在合适的位置增加参数,在冗余的位置减少参数,才是更高效的利用方式。MoE架构的稀疏激活特性,为这一思想提供了天然的技术载体。

MetaNet正是沿着这一思路的探索:在MoE模型中引入任务条件的逐层自适应调度,让专家资源根据实际需求动态流动。实验证明,这种“适得其所”的分配策略,能够在保持性能的前提下显著降低计算开销。

这一研究的价值不仅在于技术指标本身,更在于它所代表的解决思路,面对参数规模的指数级增长,我们不必总是“做加法”。在正确的位置做减法,同样是推动AI系统走向高效、经济、可持续的重要路径。



免责声明:所载内容及图片来源于互联网、微信公众号、企业投稿等公开渠道,本文转载仅供参考、交流。转载的稿件版权归原作者和机构所有,如有侵权,请联系我们及时删除。

​​​​2026“全国移动机器人行业活动”合作商招募中

​报名热线:400-0756-518​​​​、13512726426  微信

活动时间:2025-08-01至08-31

  • 合力宇锋|聚焦冷链行业场景应用、助力产业数智化跃升!
  • 降低62% DeepSeek MoE专家激活,越疆论文入选国际顶会EMNLP
  • 眸视方案|燃气行业巡检机器人解决方案
  • 【顺力智慧物流大讲堂】产线拥堵、轨道利用率低?顺力智能提出RGV一轨双车技术,让运力提升2倍
  • 直击广州中博展|焕智科技携硬核物流装备亮相,展台热闹开聊!
  • 载誉鹭岛 · 出海正当时丨翼菲科技荣获「2026年度出海创新金牛奖」
  • 优艾智合×巨骐信息 | 战略签约共拓智能巡检规模化新局
  • 20余家主流媒体齐聚中惠创智阜阳基地——实地探访无线供电技术产业化成果