今天凌晨,上海人工智能实验室把新一代 agentic 模型 Atria Dawn Preview 的权重放上了 Hugging Face 和 ModelScope——MIT 协议,基于 744B 参数的 MoE 基座 GLM-5.2,上下文 256K,同步放出 FP8 量化版。它不做聊天人设,主打一件事:把开放式科研任务推进到"可执行、可验证、可复现"的结果。
把"验证"做进训练循环
Atria 的核心是一条 Verifiable Experience Pipeline:每个训练任务都接真实执行环境,模型观察状态、调用工具、产出中间产物、根据反馈修正;最终结果靠外部信号验证——测试通过、指标、文件状态、几何结构、来源证据。只有同时连着"任务-轨迹-产物-验证证据"的经验,才被吸收为模型的可复用能力。官方把它总结成三分工:模型内化过往经验,harness 管理当下流程,环境决定每个动作的后果。这相当于把"agent 能力靠 prompt 工程外挂"的老路,换成训练期内化。
跑分:Agent 基准多项居首,工程交付仍是短板
官方对照表拉了六个对手:DeepSeek V4 Pro 0813、Kimi K3、Qwen 3.8 Max、GLM 5.3、GPT 5.6 sol、Claude Opus 5。16 项基准里,Atria 在 5 项拿到行内最高:AutomationBench 53.8(次高 49.7)、BFCL v4 77.0、CyberGym 86.5、DeepSearchQA 96.0、BrowseComp 92.5。浏览器式深度检索和网络安全这两类长程 agent 任务,优势最明显。
但同一张表也自曝短板:SWE-bench Pro 59.6,Opus 5 是 74.7;JobBench 50.3 对 68.0;Terminal-Bench 2.1 78.3 对 90.2。科研探索型任务强、工程交付型任务弱,格局非常清楚——官方没有回避,这比通稿式发布可信得多。
一个 demo:从 100GB 气象数据到全球预报系统
官方展示里最硬的一条:禁用联网的环境下,给模型 100GB 以上的全球天气数据,它自己设计出 0.4B 以上参数的 ViT 网络,训练 45,000 步,建模 69 个气象变量的演化,最终系统一分钟内完成未来一周的全球预报,部分预测指标超过 NVIDIA 的经典预报模型 FourCastNet(官方自报)。另有 20 分钟从零搭出 MiniOS 的演示。
所以呢
Preview 阶段、纯文本输入、自报对照表,这些折扣都该打。但两点值得盯:第一,744B MoE 级别的权重 MIT 全量开源,部署文档直接给了 SGLang、vLLM、Codex、Claude Code 四条接入路径;第二,当 agent 竞赛从聊天跑分转向任务交付跑分,验证信号从哪来决定含金量——Atria 把验证做进训练循环,这个方向比榜单数字本身更重要。
参考:Atria 官网 · HF model card