查看: 11|回复: 0

🔥必读!Qwen 负责人刘大一恒团队把极稀疏 MoE 的负载不均当成闭环控制来解!这对Qwen 4.0 而言意义重大!

[复制链接]

18

主题

2

回帖

68

积分

注册会员

积分
68
发表于 昨天 22:43 | 显示全部楼层 |阅读模式
🔥必读!Qwen 负责人刘大一恒团队把极稀疏 MoE 的负载不均当成闭环控制来解!这对Qwen 4.0 而言意义重大!

他们发现:专家池越大、每 token 只点亮一小撮,容量能涨、推理成本几乎不动。DeepSeekMoE 16B 是 64 专家选 6 个(激活约 9.4%),Kimi K3 已到 896 专家选 16 个(约 1.8%)。再往 5 万亿、10 万亿走,热门专家会打满 GPU,闲置专家却训不透。

ID Balancing 的关键点:
1️⃣给现有方法定身份。DeepSeek 的 loss-free 是固定步长积分控制,Kimi K3 的 Quantile Balancing 是广义比例控制,都是不完整 PID。

2️⃣新方法是 ID 控制器,不用辅助 loss。积分项按负载误差缩放,偏得越大纠得越猛,接近均衡就收步;微分项只在失衡正在恶化时打开,提前刹车。

3️⃣768 专家、Top-10 / Top-5 / Top-3 对比。最稀的 Top-3 里,相对最好基线,主干最坏 MaxVio 降超过 50%,训练平均 MinVio 降超过 12%。辅助 loss 的 MaxVio 可飙到约 211,ID Balancing 约 15。

4️⃣规模从 18.9B 拉到 69.9B,最坏 MaxVio 几乎不动(约 8.4→7.8),比辅助 loss 低约 89.6%。越稀疏优势越大,语言建模和下游不掉点。

大误差大力纠,恶化才加导数,靠近均衡就收手。

论文:https://arxiv.org/abs/2609.39137




本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部