把 GPT-6 Astra、Claude Fable 5.1 和 Fable 5 放上同一套双臂机械臂,只给两个任务:把桌上的红色积木捡起来放进碗里;捏住圆形拼图件中央的旋钮,把它插进板上匹配的圆形凹槽。独立评测机构 Robocurve 9 月 4 日发布的这份报告,给前沿模型的「物理之手」划出了一条少见的清晰能力线,也是他们对 Fable 5 与 5.1 对比测试的后续。

19/20 对 8/20:一边倒的积木任务

每个模型每个任务各跑 20 次,全程共 120 次有效试跑。积木进碗任务上,GPT-6 Astra 完成 19 次,Claude Fable 5.1 完成 8 次,上一代 Fable 5 只成功 1 次。单轮耗时 Astra 约 2.5 分钟,Fable 5.1 要 6.8 分钟;按牌价估算单轮成本 0.94 美元对 2.12 美元,Robocurve 的图表把它标注为「完成率高 2.4 倍、便宜 2.3 倍」。

评分不是非黑即白:人类评分员按「最高到达阶段」打 0 到 4 分,从「没有意图性接近」到「放到目标位置」,失败的试跑也会记录走到了哪一步。积木任务上 Astra 的平均阶段达到 3.95,几乎每次都走到终点;Fable 5.1 是 2.40,Fable 5 只有 1.30。

输出 token 的差距比成功率更夸张

Astra 单轮只输出约 2100 个 token,Fable 5.1 是 1.29 万,Fable 5 高达 1.92 万——用对手约六分之一的输出量,拿到了两倍以上的完成数。拼图任务上同样如此:2700 对 1.05 万,单轮成本 1.36 美元对 2.18 美元。

精细插入:三个模型卡在同一步

真正有意思的是更难的拼图插入:Astra 完成 2/20,Fable 5.1 同样只有 2/20,Fable 5 则一次未成。报告写道,Astra 能到达凹槽上方,然后卡在与 Fable 相同的最后一步。抓取、移动、对位都通过了,卡住的是把件按进去的动作。对一套只靠三个机位摄像头和本体状态做反馈的控制器来说,差的恐怕不是推理,而是纯视觉观测给不了的东西。

这份评测该怎么读

Robocurve 自己列出的局限值得原文引用:Astra 的试跑比 Fable 晚两天进行,没有交错安排;积木任务不在同一台机架上;评分员知道跑的是哪个模型,存在无意识偏袒的可能;Anthropic 的请求未启用 prompt 缓存,而 OpenAI 自动缓存了 Astra 约五分之一的输入且未折价——报告原话是,Astra 的成本「只会被高估」。

所以结论要克制:在视觉抓取加粗放置这类任务上,Astra 拿到了又快、又便宜、又准的全面优势;但在精细插入这类操作上,前沿模型仍然集体不及格。这份评测的价值不在排名,而在它把下一个工程难题定位到了具体的一步:最后一段插入,还轮不到语言模型靠「多想」来解决。

参考:Robocurve《GPT-6 Astra on robotic manipulation》 openai.robocurve.org/gpt-6-astra/