众力资讯网

[LG]《Domain-Aware Scaling Laws Uncover D

[LG]《Domain-Aware Scaling Laws Uncover Data Synergy》K Hamidieh, L Mackey, D Alvarez-Melis [MIT & Microsoft Research] (2026)

在大语言模型预训练领域,如何精准预测数据配比对模型性能的影响是一个悬而未决的难题。过去的方法受困于“Token等效”的盲目假设,将不同来源的数据视为无差别的数量堆砌,本质原因是忽视了领域间存在的非线性协同与干扰效应。

本文的核心洞见是:把数据配比重新看作一种可量化的“认知化学反应”。由此,通过在缩放法则中引入一阶领域敏感度与二阶领域耦合系数,将代码、数学等领域共存产生的性能增益转化为可计算的“奖励Token”,从而准确捕捉领域间的互补与冲突。

这项工作真正留下的遗产是将数据混合从“经验炼金”推向了“定量配方”。它为后来者打开的新门是基于协同效应的自动化数据策应工具,但尚未跨过的门槛是观测性数据自带的分布偏差,以及该法则在万亿级参数规模下的外推稳定性。

arxiv.org/abs/2607.11052 机器学习 人工智能 论文 AI创造营