长思维链(Chain-of-Thought)是这两年推理模型涨分的主要手段,但它的代价同样直白:每多想一步,就多烧一段 token,上下文窗口和推理账单同步膨胀。对部署侧来说,一段几百 token 的"思考过程"里,真正对答案有贡献的往往只是少数几步——问题是,哪些步骤可以扔?arXiv 9 月 7 日提交的新论文给出了一个相当几何化的答案。

方法:给推理轨迹装一个"方向罗盘"

论文的核心观察是:CoT 可以被看作隐藏状态空间里的一条轨迹。把问题、每一步推理、最终答案的表示都投影到一个 3D PCA 空间后,就能度量"每一步的局部移动方向"与"从问题指向答案的全局方向"之间的夹角。

夹角小,说明这一步在直奔答案——保留为明文;夹角大,说明这一步在做检查、纠错或分支探索——压缩成连续的隐 token。模型最终输出的是"明文与隐表示交错"的序列,而不是把思考过程整个删掉或整个保留。论文还报告,夹角随时间的变化能反映探索、收敛、精化三个阶段:小夹角对应直接执行与答案形成,大夹角更常涉及检查、纠错和分支探索。

训练:两个 forcing,一个管输入一个管标签

要训动这个显隐交错的架构,论文引入了两个训练技巧:

  • stepwise embedding forcing:把每个冗余步骤池化成单个隐嵌入;
  • label forcing:对这个隐 token 用软的多峰词表分布做监督,而不是 one-hot 硬标签。

论文的表征分析显示,隐状态形成了与文本状态明显区分的紧凑区域,而隐 token 位置更高的熵被认为反映了更宽的软目标,能鼓励更丰富的步骤级特征学习。

数字:回复砍半,平均精度反升

在 Qwen3.5-9B 和 Qwen3.6-27B 两个模型、六项域内加域外基准的实验里,论文报告:

  • 平均精度最高提升 2.6%;
  • 回复长度最多缩短一半;
  • 单位算力精度(Accuracy per Computation Unit)提升 2.29 倍;
  • 预处理时间下降 94.6%,训练时间最多下降 80.3%。

代码开源于 GitHub(AI9Stars/AStar-Thought),论文全文见 arXiv:2609.07821

怎么看

三点判断:

  1. **"该留的留、该压的压"比一刀切聪明。**硬剪枝丢中间信息,全保留烧钱;用方向一致性作为连续压缩的判据,思路干净,而且判据本身可解释——每一步"偏航角"有多大,是能算出来的量。
  2. **训练侧的数字值得注意。**预处理时间降 94.6%,说明数据构造流程在工程上是轻量的,不是只在论文里跑得通的玩具。
  3. **留意"up to"措辞。**2.6% 和"砍半"都是峰值数字,六项基准内部的分布要看论文细节;真要上生产,建议先拿自己的负载压测一遍再定。

对推理成本敏感的团队,这类隐空间压缩方向值得放进观察列表:当模型"想得太多"成为账单主体时,能判断"哪一步不值得明文展开"的模型,就是省钱的模型。