视觉大模型有个尴尬的短板:你给它一张照片,它能准确说出画面里有什么——一只猫、一张桌子、一扇窗;但让它重建这张 2D 图像背后的 3D 结构、判断一堆积木从某个方向看过去是什么形状,它经常翻车。这种「看得见、想不清」的能力缺口,学界叫空间智能(spatial intelligence)。KAIST 的三名研究者最近给出一个相当「复古」的解法:让模型玩积木。

1.5 万道积木题,比真人标注便宜太多

论文(作者 Soohyun Ryu、Sohee Kim、Eunho Yang,9 月 7 日提交 arXiv)的核心资产叫 SpatialBlock-15k:15,000 道训练题加 600 道测试题,全部由渲染的 3D 积木结构生成,题型分三类——Q1 问一个结构从指定方向看过去是什么样子(3D 到 2D 投影),Q2 问旋转或移动相机之后视角如何变化(视角变换),Q3 问两个结构拼起来会得到什么(结构组合)。

题目设计里有个细节:数据集引入了受控的颜色调制作为视觉线索,引导模型把推理「锚定」在任务相关的积木块上,而不是在视觉噪声里瞎猜。

对比之下,以往的做法大多用真实场景的空间问答数据集,需要密集的几何标注——论文直接点出这条路的三个问题:贵、耗时、噪声大,而且往往要依赖外部感知模块来生成标签。合成积木题把这几项成本一次性砍掉,还能持续扩展。

两种训法:一个直答,一个先想再答

团队放出了两种训练策略。direct 模型用 TRL + DeepSpeed 做全量微调,单张 GPU 就能跑;reason 模型先用 Unsloth 做 LoRA 初始化,再上 GRPO 强化学习,让它「先思考再作答」。论文报告的结论是:两种策略训出来的模型都显著超过 baseline,而且——这是最关键的一句——只用了小规模合成数据,就能迁移到真实场景的空间基准上。

开源清单也够实在:6 个 checkpoint(基于 Qwen2.5-VL-3B/7B-Instruct 和 Qwen3-VL-4B-Instruct,各有 direct/reason 两版)、SpatialBlock-15k 数据集、全部训练代码,Apache 2.0 协议。9 月 11 日,这篇论文冲上 Hugging Face Daily Papers 日榜第 3,拿到 66 票。

为什么「玩积木」这条路值得认真看

有意思的不是积木本身,而是方法论:受人类认知发展启发的任务设计。小孩子正是通过搭积木这类结构化操作,逐步建立起空间认知;把同一条路径搬给模型,再放进受控的合成环境里规模化,就得到一个低成本、可扩展、可控的空间智能训练场。

这和整个行业的大方向一致:当真实数据标注贵到离谱、几何标注尤其贵的时候,合成数据 + 任务合成正在成为视觉推理的新粮仓。积木只是物理世界最简单的骨架,同一条流水线完全可以换成更复杂的结构化场景——家具布局、建筑构件、机械装配。

对做具身智能和机器人的团队来说,这可能比又一个刷榜模型更有用:空间理解是操作和导航的地基,而地基级的数据供给,正在从「人扛相机扫场景」变成「程序渲染出题」。

所以下次看到模型在空间推理题上翻车,别急着骂参数不够——先看看它小时候玩没玩过积木。

原文:arXiv:2609.07064 · 代码与数据:GitHub - rsoohyun/SpatialBlock