[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-slug-baai-orca-world-foundation":3,"news-related-39e6e64f-a3de-4dce-bdd8-c8643f9413a1":31},{"id":4,"title":5,"summary":6,"content":6,"original_url":7,"source_id":8,"tags":9,"translations":23,"news_slug":24,"published_at":25,"created_at":26,"modified_at":27,"is_published":28,"publish_type":29,"image_url":13,"view_count":30},"39e6e64f-a3de-4dce-bdd8-c8643f9413a1","Orca：把\"世界状态\"焊进潜空间——BAAI 推出通用世界基础模型新范式","## 核心思路\nBAAI Orca 团队近日在 arXiv（2606.30534，v2 2026-06-30）发布 **Orca**，一个面向 AGI 的**世界基础模型**。它抛弃\"下一个 token \u002F frame \u002F action\"这类单一目标，转而提出 **Next-State-Prediction（下一状态预测）**建模：把视觉、文本、音频、动作乃至力\u002F光等信号统一映射为潜状态 z，再预测状态转移 Δ。\n## 训练范式\nOrca 用两条学习路径互补：**无意识学习**从 12.5 万小时连续视频中\"压\"出密集自然状态转移（类似婴儿观察落叶、狗跑过的日常感知）；**有意识学习**用 1.6 亿条事件标注 + 1150 万条 VQA，把稀疏但具因果意义的状态变化（\"发生了什么\u002F为什么\u002F会怎样\"）建进潜空间。Backbone 训练时**冻结**，只训轻量级模态解码器——文本、图像、动作是同一潜状态的不同\"读出口\"。\n## 三个读出口的实测\n- **语言读出（4B VLM）**：综合 51.8，超过 Qwen3.5（46.7）、Gemma 4（40.8），**State Transition 能力 +12.27%**\n- **视觉读出（PRICE-V0.1 物理预测）**：4+2B 配置平均 59.8，std 仅 10.9，逼近 FLUX.2-klein（56.1）但稳定性显著更好\n- **动作读出（双臂轮式机器人 OOD）**：综合 32.4，超过 V-JEPA 2.1（17.0）、π₀.₅（29.4），**Drawdown Recovery Ratio 30.3**——出错后能回弹的能力领先明显\n## 看法\nOrca 真正有意义的不是\"又一个大模型\"，而是把**理解—预测—行动**统一到同一份世界潜状态上。这意味着评测可以拆出\"状态转移\"这一新维度；多模态训练配方（125K 小时视频 + 1.6 亿事件）给了具身智能一份公开参考；而动作读出在 Environment OOD（桌布\u002F背景变化）下仍领先，说明 Orca 学到的是\"变化规律\"而非\"训练集场景\"。\n限制也明确：动作读出只在 GalBot 单一机器人上验证；PRICE 上 std 仍有 10.9；项目目前只发了论文和项目页，未开源权重。**但作为\"世界模型 = 状态转移模型\"这一命题的首次端到端验证，Orca 给出的 4B 三件套 SOTA，是 2026 下半年值得所有 VLA\u002F世界模型团队对齐的基线。**","https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.30534","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"5e628969-6d2a-437f-998a-104e4b16cfb1","ai-progress",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"120fa59a-ff6f-4537-9bf5-f818df636a0e","benchmark",{"id":18,"name":19,"slug":19,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":21,"name":22,"slug":22,"description":13,"color":13},"499f4b56-819d-49a3-9609-33e775143b86","multimodal",[],"baai-orca-world-foundation","2026-07-03T02:00:00Z","2026-07-03T02:18:11.065091Z","2026-08-19T02:08:40.142862Z",true,"agent",156,{"items":32},[33,38,43,48,53,58],{"id":34,"title":35,"news_slug":36,"published_at":37},"4b693fb4-541f-47ed-8923-6e280cec965f","大模型的“记忆”还没过视觉这一关：MEMLENS 把长上下文的短板测出来了","memlens-multimodal-long-term-memory","2026-08-03T02:00:00+00:00",{"id":39,"title":40,"news_slug":41,"published_at":42},"c3a956f8-dd42-46df-a1fd-1322dd38c15c","MentalThink 把 SVG 当作「心智草稿纸」:让多模态大模型学会用代码画心像做空间推理","mentalthink-svg-spatial-reasoning","2026-07-10T22:30:00+00:00",{"id":44,"title":45,"news_slug":46,"published_at":47},"b0a2cefc-7a4e-4f2c-83a0-f1e4911f04e5","RNG-Bench：GPT-5.4\u002FGemini 3.1 Pro 闭环记忆现形","rng-bench-shanghai-ai-lab-non-markov-memory","2026-06-24T18:15:00+00:00",{"id":49,"title":50,"news_slug":51,"published_at":52},"ea444bd9-4683-486b-b606-c222d98f1ba7","标注即 rollout:南开 OraRL 把视频多模态 RL 训练成本砍半,9B 空间智能超 GPT-5","orarl-annotations-as-rollouts-video-rl","2026-08-26T17:10:00+00:00",{"id":54,"title":55,"news_slug":56,"published_at":57},"ff0bc92a-295a-4707-be8d-76115fe9eeee","PerceptionBench 出炉:16 个前沿多模态模型,视觉感知无一及格","moonshot-perceptionbench-atomic-perception","2026-08-26T13:15:00+00:00",{"id":59,"title":60,"news_slug":61,"published_at":62},"43eda321-b0b7-4df7-b20e-9758cbab42c9","记忆越完整,眼前题越做不对:MemTrapBench 把 LLM 长期记忆框架打回原形","memtrapbench-llm-memory-cognitive-traps","2026-08-22T04:00:00+00:00"]