7 月 20 日挂上 arXiv 的一篇新论文,标题就一句话:「Convolution for Large Language Models」。作者来自华为诺亚、北大等机构,核心改动小得让人意外——在 Qwen3 的 Q/K/V 投影之后、attention 之前,塞一个 kernel=3 的 depthwise 卷积。不到 0.01% 的额外参数,7 个下游 benchmark 的平均准确率反而涨了。

为什么这件事值得说?核心有两点。

第一,Self-attention 不编码局部性。 Transformer 的 self-attention 强在「全局 token 交互」,但相邻 token 的局部关系基本靠数据学,效率天然不高。这篇论文相当于在 Q/K/V 之前给 attention 装一个「CNN 鼻子」,让它先闻一下相邻 token 的味道再去做全局匹配。0.01% 的参数、稳定的多档数据预算提升,这意味着它不是某个特定规模的过拟合解,而是一种通用机制。

第二,直接打在 LLM 的「复读机」痛点上。 论文的 case study 显示,经过这个卷积预处理后,「The cat sat on the mat」中同一 token 第一次和第二次出现,表示差异比之前大得多——这正是 LLM 长文本里反复出现的「重复拷贝」问题。同期 arXiv 上另一篇工作 2607.19345 (Copy Less, Ground More) 用 evidence-aware RL 在训练目标侧压制重复,二者是架构 vs 训练目标的互补解法,一个治本,一个治标。

更深一层的信号:过去两年 LLM 架构创新从「scale 路线」悄悄转向「在结构里抠效率」。0.01% 换 N% 提升,这种**「手术刀式」的工程美学**,比把模型做大 10 倍有意思多了。下一个值得蹲的方向:Linear Attention / SSM + 局部卷积,看混合架构能不能再榨出一点性能。

参考: