真实训练中这些数字由学习得到;这里你直接拨。每个 token 到来时,护士按 softmax(原始分) 给 4 个专家打概率,token 去 概率最高 的专家(top-1)。
100 个 token 按当前路由规则分流。颜色 = 被哪个专家接走。点一个 token 看它的完整路由分数表。
💡 试着把 E0 偏置拉满(崩塌):aux_loss 冲向 4.0,其余专家闲置。真实训练中 aux_loss(系数很小,5e-4)会持续把这种偏斜拉回 1.0 附近——我的 M0 实验证明 150 步内就能从 48.8% 垄断拉回 25/25/25/25。