韩国 AI 公司 Upstage 在 8 月 11 日上线了 Solar Pro 4 闭源商用大模型。这一代不再主打「更大、更强」的通用能力分数,而是把「agent 跑得稳」作为主轴——围绕长文档、终端任务、多轮工具调用,以及拒绝编造这类企业级问题重做了训练和评估。
一组 agent 任务分数
Solar Pro 4 上下文窗口 512K,输出上限 128K,支持英语、韩语、日语三种语言,默认开启推理。Upstage 在官方博客中给出的关键 agent 任务分数,基于 Artificial Analysis 的基准体系:
- Terminal-Bench v2.1(真实 shell 里完成多步任务):57
- τ³-Banking(多轮工具调用找到正确策略):23
- AA-LCR(跨约 10 万 token 长文档做综合推理):71
Upstage 自己对照 Solar Open 2 给的同口径对比是:Terminal-Bench v2.1 +13.8、BrowseComp +11.9、GDPval-AA v2 +7.4、AA-LCR +8.3;在 GPQA Diamond、MMLU-Pro、LiveCodeBench、AIME 2026 等通用知识与数学代码基准上,两个模型差距很小。Artificial Analysis 给出的综合指数是 42 分——Upstage 自己的话是「比 Solar Pro 3 高出三倍多,超过 Nvidia Nemotron 3 Ultra 的 38、Google Gemini 3.5 Flash-Lite 的 37」。
The New Stack 在 8 月 20 日的独立报道里,转述了 Upstage 美国 CEO Kasey Roh 的一句话:「把前沿模型留给前沿问题;我们做的是拉车的马」。她给的成本对照是:300K 输入 + 15K 输出的文档事实核查任务,按列表价算,「前沿模型每任务约 1 美元,Solar Pro 4 约 0.10 美元」。
训练侧的核心:用 OfficeVerse 合成「已完成的工作」
Solar Pro 4 的训练数据由 Upstage 自研的 OfficeVerse 流水线生成——从真实公开数据合成 11 个行业域、12 类任务型办公工作,以最终交付物是否「pass or fail」作为唯一打分标准。Upstage 自己说,Solar Pro 4 的训练和验证用「和真实工作形状一致」的任务。同一套流水线也产出了 Ko-GDPval——一个韩国办公工作基准。
这套思路的对照面是「刷榜式训练」——很多闭源模型在公开基准上冲到很高,但面对真实办公流时会出现「表格拉到第 200 行之后开始糊弄,把单元格用前面行的值模式匹配填上」这种 silent failure。Roh 在 The New Stack 的采访里点名的就是这个失败模式:模型先正常读到 200 行,之后开始略过行、用前面行的模式填充,输出格式还是好的,直到最后对账的人手动核对才被发现。「这是我们专门训练去避免的失败模式」。
「找不到依据就说不」是这一代的核心交付物
Solar Pro 4 在文档问答中显式区分三种判定:grounded(条款存在并给引用)、not-in-document(条款不存在)、mismatch(两份文档中数字不一致,标记为差异)。模型在「无法验证」时直接说「无法验证」,而不是用语言模式生成一个看起来对的答案——博客里那张示例图里,模型只回答了问题里一半能找到的内容,另一半明确告知「文档中没有提供」。
这件事对企业的实际意义大于「又多了一个 SOTA」:在金融、法律、保险、制造业、供应链这些受监管行业里,模型生成一个看起来漂亮但找不到来源的答案,下游的所有工作都会被污染。Solar Pro 4 走的是「找到的依据给引用,找不到就标记」,把可追溯性变成默认行为。
价格与可用性
Solar Pro 4 在 Upstage Console、OpenRouter、Hermes Agent(Nous Research 的 agent 环境)、Upstage Studio 上同时上线,定价是:输入 0.30 美元/百万 token,缓存输入 0.06 美元/百万 token,输出 1.20 美元/百万 token。Upstage 在 8 月 11 日到 9 月 10 日 23:59 UTC 之间给出 9 折列表价的发布促销。
The New Stack 引述 Upstage 提供的数据:Solar Pro 4 在 OpenRouter 上线一周内,token 消耗超过 370B。Upstage 的既有合作伙伴是 AWS 和 AMD;公司 2025 年起在 San Jose 设立美国总部。
一段判断
Solar Pro 4 不是一个「比 Sonnet/GPT 更大」的模型,也不是为了把基准表刷得更亮。它押注的是企业里真正部署 agent 时遇到的那类失败——长文档中段悄悄糊弄、表格数据用前文模式填空、引用生成不存在的条款。把这三类问题从「agent 默认行为」里拆出来,配以更便宜的单价,Upstage 在做的事本质上是「agent 部署的工程化」,而不是「模型能力军备竞赛」的下一轮。对国内外的开发者来说,这都是值得停下来看一眼的方向:在 SWE-Bench、Terminal-Bench、AA-LCR 这些 agent 任务基准刷到顶之后,真正决定能不能在企业里跑起来的,是模型在几百行表格、几十页合同、上百次工具调用里保持「silent failure 接近 0」的能力。