LPLB,全称 Linear-Programming-Based Load Balancer,即基于线性规划的负载均衡器。顾名思义,LPLB 是一个并行负载均衡器,它利用线性规划(Linear Programming)算法来优化 MoE(混合专家)模型中的专家并行工作负载分配。具体来说,LPLB 通过以下三个步骤实现动态负载均衡:动态重排序: 基于工作负载统计信息对专家进行重排序(Reordering)。构建副本: 结合静态拓扑结构构建专家副本(Replicas)。求解最优分配: 针对每个批次(Batch)的数据,求解最优的 Token 分配方案。

评论 2
