数据约束下的混合预训练缩放定律

苹果机器学习研究团队通过2000余次语言模型训练实验,系统研究了稀缺目标数据与通用数据混合预训练中的权衡问题。研究发现,目标数据占比过低会导致模型对目标领域暴露不足,而占比过高则因重复样本过多引发收益递减乃至过拟合,为数据约束下的混合预训练策略提供了量化依据。

摘要

苹果机器学习研究团队通过2000余次语言模型训练实验,系统研究了稀缺目标数据与通用数据混合预训练中的权衡问题。研究发现,目标数据占比过低会导致模型对目标领域暴露不足,而占比过高则因重复样本过多引发收益递减乃至过拟合,为数据约束下的混合预训练策略提供了量化依据。

原文链接

本站已稳定运行: 计算中... 天 | 博客: 32 篇 | 字数: 26276
使用 Hugo 构建
主题 StackJimmy 设计