这次 GPT-6 家族扩列,OpenAI 把"前沿智能"按价格拆成两档——Sol 和 Luna。两者都用了与 Astra 相近的训练方法,但 API 价格相比上一代 Sol/Luna 直接砍掉一半。
价格直接砍一半
先把最实在的账单摆出来。GPT-6 Sol 输入价从 5.6 代的 4 美元/百万 token 降到 2 美元,输出从 20 美元降到 10 美元。GPT-6 Luna 更激进,输入从 0.20 美元降到 0.10 美元,输出从 1.20 美元降到 0.50 美元。OpenAI 在官方公告里给出的理由是缓存与推理基础设施的改进,把这些节省直接转嫁给用户。
五项专业工作评测
benchmark 层面,官方选了 AutomationBench、Agents' Last Exam、FrontierCode、DeepSWE 1.1、OSWorld 2.0 offline 五个与"复杂专业工作"挂钩的评测,核心信息是"在显著低于对手的价位上达到接近对手的水平"。
AutomationBench 1.0.6(覆盖销售、市场、运营、客服、财务、HR 等 47 个工具的端到端工作流)上,GPT-6 Sol xhigh effort 拿到 33.2%,每任务成本 0.27 美元;作为对比 Claude Opus 5 max effort 拿 26.9%,成本是 Sol 的 11.1 倍;Claude Fable 5.1 加 Opus 5 fallback 拿到 31.4%,成本是 Sol 的 8.9 倍以上。Agents' Last Exam V1 上,GPT-6 Sol max effort 拿到 56.4%,比 Claude Opus 5 最高分更高,而每任务成本低 60%。
编码方面,FrontierCode 1.1 Main(评估能否产出可合并到真实代码库的改动,不仅看正确性,还看测试质量、范围控制、代码风格等)上,GPT-6 Sol 比 GPT-5.6 Sol 进步明显,并能以更低成本匹配 Claude Fable 5.1 xhigh。DeepSWE 1.1 上,GPT-6 Sol max effort 拿到 68.8%,距离 Claude Fable 5 在该评测中的最高分 69.9% 只差 1.1 个百分点,而每任务成本约为其 20%。GPT-6 Luna max effort 拿到 66.6%,与 Claude Opus 5 和 Fable 5 的 medium effort 表现相当,但成本只有 Opus 5 的 7%、Fable 5 的 4%。OpenAI 在公告里直接点名 DeepSWE 1.1 是"针对真实代码库中的复杂软件工程任务的原创长程任务"。
computer use 方面,OSWorld 2.0 offline 上,GPT-6 Sol xhigh 拿到 60.5%,Claude Opus 5 medium 60.3%,Sol 成本约为 Opus 5 的 20%。GPT-6 Luna max 跑赢 GPT-5.6 Sol medium,成本只有后者的十分之一。
合作风格上,官方说 Sol 和 Luna 也接住了 Astra 的对话风格改进了——更清晰、更少行话、更少模糊的措辞、更少无关细节,总体稍短但不损失信息量。文中给了一个对照示例:同一段把网站改成 bento grid 的请求,GPT-5.6 Sol 直接拍板"不必 React",GPT-6 Sol 则先核对再动手,并明确说明自己查过什么、没查什么。
缓存改进做成产品级特性
更值得开发者关注的是缓存层。OpenAI 同时发布了一篇专门的"GPT-6 缓存改进"文章,核心改动是默认更高的缓存命中率、对缓存输入 token 提供 90% 折扣,并上线 Prompt Caching Dashboard、诊断工具、显式 breakpoint API,允许在不破坏缓存的前提下调整推理强度和工具可用性。GitHub 反馈过去几个月 OpenAI 模型数十亿次请求中"需要全新处理的 prompt token 占比下降超过 50%",Copilot 响应因此更快。
对齐与可用性
对齐方面,官方称 Sol 和 Luna 沿用 Astra 的对齐工作,在内部编码欺骗评估上较 GPT-5.6 系列有所改进,误述自身编码工作的比率更低。
可用性上,GPT-6 Sol 和 Luna 当天进入 ChatGPT Work 与 Codex,覆盖 Plus、Pro、Business、Enterprise、Edu 全档,免费和 Go 用户可以在桌面应用里用到 Luna。OpenAI 计划在一天内逐步放量,API 端以 gpt-6-sol 和 gpt-6-luna 提供。
值得展开的反而是这次发布的"产品哲学":Astra 仍然是旗舰,但 OpenAI 显然想把"接近旗舰的能力"以更便宜的方式铺到日常任务里。AutomationBench 上 Sol 跑赢 Astra low effort,DeepSWE 上 Luna 用 4% 的成本达到 Opus 5 medium effort——这意味着"贵模型 + 高 effort"不再是完成复杂任务的唯一组合,性价比组合已经可以替代不少过去必须上旗舰的负载。对企业来说,这次价格调整直接重置了 Claude Opus / Fable vs GPT-6 的 TCO 算式;对个人开发者,Luna 这档几乎是把门槛再往下降一截。
所以呢:OpenAI 这一轮不是单纯发新模型,而是把 GPT-6 系列的价格曲线整体下移 50%,并把缓存改进做成产品级特性。下一步值得盯着两件事——ChatGPT 端用户能否真切感知到风格与事实性改进(公告里点名"接近 Astra 级事实性但只有一半错误"),以及 Anthropic 是否会用 Opus 5 系列的定价调整做回应。