摘要
Hugging Face 构建了一个约束感知的 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比。在相同硬件和负载下,GPU 利用率最高提升 33 个百分点,优先级加权输出在全部场景中均上升,最高达 105%。分配器将实时推理需求按曲线而非峰值处理,批量任务按优先级跨整个调度周期排序,从而回收了预留闲置容量。
Hugging Face 构建了一个约束感知的 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比。在相同硬件和负载下,GPU 利用率最高提升 33 个百分点,优先级加权输出在全部场景中均上升,最高达 105%。分配器将实时推理需求按曲线而非峰值处理,批量任务按优先级跨整个调度周期排序,从而回收了预留闲置容量。