摘要
大规模 LLM 强化学习采用解耦架构后,rollout 数据从推理侧到训练侧的传输成为瓶颈。Mooncake 针对 Miles 系统中异构、碎片化的 rollout 数据(如 list[np.ndarray] 形式的 tokens、loss_masks、rollout_log_probs),通过批量 I/O 优化实现高效传输,同时满足效率、正确性、可扩展性、灵活性和可预测的交接延迟等要求。
大规模 LLM 强化学习采用解耦架构后,rollout 数据从推理侧到训练侧的传输成为瓶颈。Mooncake 针对 Miles 系统中异构、碎片化的 rollout 数据(如 list[np.ndarray] 形式的 tokens、loss_masks、rollout_log_probs),通过批量 I/O 优化实现高效传输,同时满足效率、正确性、可扩展性、灵活性和可预测的交接延迟等要求。