MoE 与专家并行
混合专家模型把 FFN 替换为多个专家,每个 token 只路由到少数专家。专家并行把专家分布到不同 GPU,引入 all-to-all 通信与负载不均衡问题。本章讨论路由、容量因子、辅助损失与通信优化。
- all-to-all 的性能取决于网络的全互联带宽
- 专家负载不均衡导致部分 GPU 空转
- DeepSeek 式的细粒度专家与共享专家设计
混合专家模型把 FFN 替换为多个专家,每个 token 只路由到少数专家。专家并行把专家分布到不同 GPU,引入 all-to-all 通信与负载不均衡问题。本章讨论路由、容量因子、辅助损失与通信优化。