训练数据决定模型上限,但怎么测「LLM 准备数据」的能力一直是空缺。北京大学联合港中文、浙大等机构发布的 DataPrep-Bench 第一次给这件事立了标杆:把数据准备拆成两件并行的事——用 LLM/Agent 从原始语料构造监督数据,以及用一个评估器预测候选数据集的「下游训练价值」,并在 6 个领域、多个基座模型上做端到端联合打分。
论文同时开源两件工具:Data-Construction-Skill 技能导向 Agent,在 Llama-3.1-8B Finance 任务上比仅用 Dolly-15k 的基线高近 20 个绝对点,在知识抽取密集型领域也能和最强 Agent / DataFlow 类方法打平;DAS(Distributional Alignment Score) 用候选集与领域代理之间的 MMD 距离衡量「训练价值」,在 6 个领域中的 4 个拿到跨模型最强相关,并且是唯一同时在 Math、Science、Medical 三个领域都把 r 拉到 0.7 以上的指标,把既有 quality / diversity / heuristic 评估器全部压在身后。
真正的「so what」在于:这条赛道过去拼的是「数据多」,DataPrep-Bench 把评价尺度从「句子像不像」换成了「下游训练涨不涨分」,DAS 把这件事从专家经验变成可计算的分布对齐指标,意味着数据准备第一次进入了「可被系统性比较、可被规模化替代」的状态——对 LLM 工厂而言,数据团队的工程化拐点已经发生。