实验中:专家激活数量减少 62%,但是实际 latency减少的只有约4.9%。
论文测试中 aggressive MetaNet:
542.94ms → 516.52ms
仅降低约4.9%。
为什么?
因为 LLM 推理还有:
Attention
↓
Token dispatch
↓
Permutation
↓
GPU communication
↓
Synchronization
↓
Expert computation
减少专家,只减少其中一部分。
当前大模型的能力提升,很大程度上依赖参数规模的持续扩张。但参数量并非越多越好,在合适的位置增加参数,在冗余的位置减少参数,才是更高效的利用方式。MoE架构的稀疏激活特性,为这一思想提供了天然的技术载体。
MetaNet正是沿着这一思路的探索:在MoE模型中引入任务条件的逐层自适应调度,让专家资源根据实际需求动态流动。实验证明,这种“适得其所”的分配策略,能够在保持性能的前提下显著降低计算开销。
这一研究的价值不仅在于技术指标本身,更在于它所代表的解决思路,面对参数规模的指数级增长,我们不必总是“做加法”。在正确的位置做减法,同样是推动AI系统走向高效、经济、可持续的重要路径。