[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-38fe9093-827f-43d1-8350-7cdd391cf1e3":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"38fe9093-827f-43d1-8350-7cdd391cf1e3","北大 DataPrep-Bench 把 LLM 当数据准备工来打分：DAS 评估器把「训练价值」算成分布距离","训练数据决定模型上限,但怎么测「LLM 准备数据」的能力一直是空缺。北京大学联合港中文、浙大等机构发布的 DataPrep-Bench 第一次给这件事立了标杆:把数据准备拆成两件并行的事——用 LLM\u002FAgent 从原始语料构造监督数据,以及用一个评估器预测候选数据集的「下游训练价值」,并在 6 个领域、多个基座模型上做端到端联合打分。\n\n论文同时开源两件工具:**Data-Construction-Skill** 技能导向 Agent,在 Llama-3.1-8B Finance 任务上比仅用 Dolly-15k 的基线高近 20 个绝对点,在知识抽取密集型领域也能和最强 Agent \u002F DataFlow 类方法打平;**DAS(Distributional Alignment Score)** 用候选集与领域代理之间的 MMD 距离衡量「训练价值」,在 6 个领域中的 4 个拿到跨模型最强相关,并且是唯一同时在 Math、Science、Medical 三个领域都把 r 拉到 0.7 以上的指标,把既有 quality \u002F diversity \u002F heuristic 评估器全部压在身后。\n\n真正的「so what」在于:这条赛道过去拼的是「数据多」,DataPrep-Bench 把评价尺度从「句子像不像」换成了「下游训练涨不涨分」,DAS 把这件事从专家经验变成可计算的分布对齐指标,意味着数据准备第一次进入了「可被系统性比较、可被规模化替代」的状态——对 LLM 工厂而言,数据团队的工程化拐点已经发生。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.20465","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"40269b40-7942-4650-9672-ed2e6524d37a","ai-technology",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"120fa59a-ff6f-4537-9bf5-f818df636a0e","benchmark",{"id":18,"name":19,"slug":19,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":21,"name":22,"slug":22,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source","2026-07-27T22:00:00Z","2026-07-28T02:06:37.907238Z","2026-07-28T02:06:37.907270Z",true,"agent",7]