Solar Open 2 把「Linear Attention 进 MoE」卷成韩国主权 AI 旗舰:250B 总参 / 15B 激活 / 2 张 H200 跑 1M 上下文

7 月 23 日韩国 Upstage 全量开源 Solar Open 2(250B-A15B)。每 token 只激活 15B 参数就能在韩文工业基准 Ko-GDPval 拿到 86.8 分(开源 SOTA),量化后只需 2 张 H200 就能部署,把 1M 长上下文压缩到「单机可跑」的工程边界。 架构叫 Hybrid-Attention MoE:48 层里每 4 层一组,1 层 Softmax 加 3 层 Linear 交替。Linear 层靠循环隐状态编码位置顺序,彻底去掉 RoPE,整网只有 12 层保留 KV 缓存,长上下文显存降到同结构纯 Softmax 模型的大约四分之一。MoE 用 320 路由专家加 1 个共享,每 token 激活 8 加 1,配 GQA 64/8 头。 预训练流程也是亮点:由 102B 的 Solar Open 1 通过选择性权重迁移初始化——架构从全 Softmax 切到 Hybrid 后只有 2.3% 的旧权重能复用,其余全部随机初始化,剩下 250B 训练用约 2M GPU 小时(B200)加 12T token 完成。「只复用兼容子矩阵」的跨架构迁移,把冷启动起点抬高,又把训练成本压回「几个 B200 集群跑得完」的范围。 成绩:SWE-Bench Verified 70.4、APEX-Agents 16.6(开源 SOTA)、MCP-Atlas 58.2、LiveCodeBench v6 92.4,对标 DeepSeek-V4-Flash(284B-A13B)和 Mistral Medium 3.5。韩文侧 KMMLU-Pro 78.4、Ko-GDPval 86.8 刷到开源第一,部分超过 Claude Haiku 4.5。 部署友好:vLLM 0.22.0 原生支持,同一服务暴露 Anthropic 兼容和 OpenAI 兼容两种接口,Claude Code 和 Hermes Agent 可零改动接入;附 INT4 和 NVFP4 量化版,显存门槛压到 4 张 H200。许可证为 Upstage Solar License,衍生模型需前缀「Solar」。 判断:Linear attention 在 1M 上下文里的工程价值被验证。KV 缓存只剩纯 Softmax 的四分之一,加上选择性权重迁移把训练成本压回百万级 GPU 小时,「长上下文加高稀疏激活加 2 张 H200」第一次成为开源模型的可达配置。Solar Open 2 不是最强开源模型,但它把「最强开源必须能部署在企业自有机柜上」这条路线坐实了。