给语言模型看的上下文,长期只有两种压缩方式:写成人类可读的摘要,或渲染成图像再 OCR 回来。两条路都要把信息还原成「文本」,可读它的根本不是人,是模型。康奈尔大学与爱荷华州立大学的 Zhengze Zhou 和 Hejian Sang 提出的 LatentPress 走第三条路:把对话历史和长文档直接写成连续记忆令牌,冻结的解码器通过输入嵌入接口直读,推理时零文本重建(arXiv:2609.01507)。
只训 0.1% 的 adapter
LatentPress 把上下文拆成 WRITE 和 READ 两步:前者把文本映射成紧凑的连续状态,后者直接喂给冻结解码器的嵌入层。真正训练的只有一个与读取器匹配的小写入器,参数 4.2M 到 26.2M,约为解码器的 0.1%,压缩率覆盖 4 到 16 倍。对比以往路线:Gist 要微调整个解码器,ICAE 训 LLM 级编码器还得靠自编码器重建——LatentPress 的卖点是「只训 adapter、不重建、soft token 直读」。
摘要路线近乎灾难
LongMemEval 的 500 道 oracle-evidence 问答上(Llama-3.1-70B-Instruct 判分,Qwen2.5-7B 读取器):未压缩证据 0.490;LatentPress 在 7.70 倍压缩下拿到 0.504,4.62 倍和 6.27 倍分别为 0.476 与 0.478——压得更狠反而更准。对照组惨烈:文本摘要在 12.06 倍压缩只剩 0.184;DeepSeek-OCR 路线从 2.33 倍的 0.426 掉到 9.34 倍的 0.312;ICAE 在 17.28 倍时崩到 0.174。
LongBench-QA 上,领域内训练的写入器在 4 倍压缩全面超过读原文:Qwen2.5-14B 从 47.93 升到 57.99,Qwen2.5-7B 从 43.80 到 49.06,Qwen3-8B 从 30.80 到 39.62。但 16 倍压缩时三个读取器全部跌破原文——压缩红利有边界。
写入 43 毫秒,读取快 5 到 9 倍
写入一段对话仅 43 毫秒(Qwen3-8B,H100 80GB),批量 DeepSeek-OCR 重建约 934 毫秒、文本摘要 407-645 毫秒,都慢一个数量级。读取侧压缩前缀比原文快 5.0 到 9.2 倍:Qwen2.5-14B 读原文 4.14 秒,LatentPress 只要 0.49 秒。
泼冷水的地方
跨骨干泛化是 reader 相关的:UltraChat 训练的写入器 zero-shot 迁到 LongMemEval,Qwen2.5-7B 打平原文,更弱的 Qwen3-1.7B 超过原文,但更强的 Qwen3-8B 上仍低于未压缩基线。仓库目前 2 个 star,未放出模型权重(HF 上引用该论文的模型为 0),复现靠 Docker 脚本在 B200 验证。判分只有单个 judge,偏好值得留意。
所以呢
这篇论文戳的是接口问题:业界默认压缩产物该是「可读文本」,可消费者明明是模型。摘要 0.184 对软令牌 0.504 的差距说明,中间那道「重建给人看」的工序既慢又丢信息;16 倍全线跌破原文也提醒,连续记忆的甜点区在 4 到 8 倍。下一个值得盯的是谁先把 soft token 接口做进生产级 Agent 的记忆层——代码和复现脚本都给了,球在工程侧。