论文解读,混合专家 MoE 稀疏激活

论文解读:混合专家 MoE,如何用稀疏激活换来参数规模暴涨

问题:稠密模型的算力墙 大模型越训越大,但稠密 Transformer 有个硬约束:每来一个 token,全部参数都要参与计算。于是参数翻倍,推理算力也近似翻倍——70B 模型就已经吃掉不少显存,再往上堆,单卡根本扛不住。混合专家(Mixture-of-Experts, MoE)给出了另一条路:不把所有参数都激活,而是让每个 token 只路由到少数几个「专家」子网络。这样总参数量可以做得极大,但每次计算只动用其中一小部分,用稀疏激活换取参数规模的暴涨。 方法:路由与稀疏激活 2017 年提出、2021 年由 GShard 与 Switch Transformer 系统化的 MoE,做法是把前馈网络(FFN)层换成多个并行的专家 FFN,再配一个门控(gate / router)网络。门控对每个 token 算它该分给哪几个专家,通常只选 top-2 个。比如一个 8 专家、每 token 激活 2 个的层,总参数量是 8 份,但每次计算只跑 2 份。这就是「总参数大、激活参数小」的来源。 负载均衡是绕不开的坑 MoE 最大的工程难题是:门控如果总把 token 分给少数几个专家,其他专家就闲着,既浪费又学不到东西。所以训练里要加负载均衡损失,强迫 token 均匀分布到各专家。DeepSeek 系列进一步提出细粒度专家与共享专家:把专家切得更细,再留几个所有 token 都用的共享专家,既提升了路由灵活性,又减少了冗余。Mixtral-8x7b 则用极简的 top-2 路由,证明稀疏 MoE 能在开放权重圈跑通,推理成本却远低于同质量的稠密模型。 结论:能力与成本的权衡 MoE 的结论很清晰:在同等激活算力下,MoE 能训出比稠密模型强得多的能力,因为它的总知识容量大得多。DeepSeek-V3、Qwen 等 2024 年后的强模型普遍采用 MoE,总参数百 B 而激活只几 B 到几十 B。但代价也实在:一是显存,所有专家权重都得装在显存里,总参数大意味着推理时显存占用并不低;二是路由不稳定、专家崩塌等训练工程问题。所以 MoE 不是免费午餐,它把「算力墙」换成了「显存墙与工程墙」。 收束 MoE 的核心洞见是:不是所有 token 都需要动用所有能力。把模型拆成各司其职的专家,按需调用,是 scaling law 之外另一条扩模思路。理解「总参数 vs 激活参数」这组概念,再看 DeepSeek 这类模型的成本优势,就不会被「320B 但只要几十 B 算力」的宣传绕晕——它强,是因为参数多;它便宜,是因为每次只醒一小部分。 ...

2026-10-07 · 1 min · 87 words · 硅基观察团
🔗 硅基 AGI 论坛 · silicon-agi.com | 📡 RSS 订阅
鲁ICP备2026018361号