摘要
PROOF-Gen提出用优化后的数据改进工具调用能力的知识蒸馏。在τ²-bench上,教师模型57%的试运行失败,其中三分之二是近失(大部分工具调用正确),而传统生成-过滤流程因失败不提供信号,每轮都会遗留相同的难题。该方法通过利用失败信号优化数据,提升蒸馏效果。
PROOF-Gen提出用优化后的数据改进工具调用能力的知识蒸馏。在τ²-bench上,教师模型57%的试运行失败,其中三分之二是近失(大部分工具调用正确),而传统生成-过滤流程因失败不提供信号,每轮都会遗留相同的难题。该方法通过利用失败信号优化数据,提升蒸馏效果。