AI AI工具情报站
国内AI动态 ai-products

面向大规模 MoE 训推的实时负载均衡方案

📰 公众号:小红书技术(dots.llm) 📅 2026-07-20

核心亮点

小红书与北京大学联合提出 UltraEP,首次将“基于精确路由信息的实时负载均衡”引入生产系统。它在每个 microbatch、每一层动态复制热点专家,在 Qwen3-235B 等大模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。这为大规模 MoE 训推提供了一套高效的工程解法。

具体能力或事件经过

MoE(混合专家)模型的核心是“路由”——每个 token 被分配给少数专家计算。问题在于,不同 token 对专家的偏好极不均衡,导致部分专家过载、其余空闲,GPU 算力被白白浪费。传统方案要么静态切分专家,要么靠近似统计做负载均衡,精度有限。UltraEP 的突破在于“精确”:它利用真实的路由概率,提前知道每个专家会被多少 token 命中,于是按 microbatch 和层粒度动态复制热点专家到空闲设备,把负载摊平。

技术细节

动态复制是 UltraEP 的关键。由于 MoE 的路由在每层、每个 microbatch 都不同,固定的专家放置无法应对波动;UltraEP 在每次前向前,依据精确路由信息计算各专家负载,把高负载专家复制到空闲卡上并行处理,低负载专家则合并。这种“按真实流量调度”避免了近似误差,使训练吞吐逼近理论上限。在 Qwen3-235B 这类超大 MoE 上,94.6% 的理想性能意味着几乎消除了负载倾斜带来的浪费。

与竞品对比

对比 Megatron-LM 与 SGLang,UltraEP 的优势来自“精确路由 + 细粒度动态复制”。Megatron-LM 的专家并行较静态,遇到路由倾斜时效率下降明显;SGLang 在推理侧虽快,但 prefill 阶段仍受专家不均衡拖累。UltraEP 把生产环境的真实路由纳入调度,因此在大模型上拿到 42% 与 1.56 倍的实打实增益,而非仅靠微优化。

行业影响或适用场景

说白了,MoE 是当下大模型降本增效的主流架构,但“专家不均衡”一直是落地的隐性成本。UltraEP 让同样的硬件跑出更高吞吐,直接摊薄训练与推理成本,对需要频繁微调、长上下文推理的业务尤为关键。它源自小红书自身的高并发推荐与生成场景,具备工业级验证。若开源或形成标准,将降低整个行业部署超大 MoE 的门槛,让更多团队用得起千亿、万亿参数模型。