7 月 20 日挂上 arXiv 的一篇新论文,标题就一句话:**「Convolution for Large Language Models」**。作者来自华为诺亚、北大等机构,核心改动小得让人意外——在 Qwen3 的 Q/K/V 投影之后、attention 之前,塞一个 kernel=3 的 depthwise 卷积。**不到 0.01% 的额外参数,7 个下游 benchmark 的平均准确率反而涨了。** 为什么这件事值得说?核心有两点。 **第一,Self-attention 不编码局部性。** Transformer 的 self-attention 强在「全局 token 交互」,但相邻 token 的局部关系基本靠数据学,效率天然不高。这篇论文相当于在 Q/K/V 之前给 attention 装一个「CNN 鼻子」,让它先闻一下相邻 token 的味道再去做全局匹配。0.01% 的参数、稳定的多档数据预算提升,这意味着它不是某个特定规模的过拟合解,而是一种通用机制。 **第二,直接打在 LLM 的「复读机」痛点上。** 论文的 case study 显示,经过这个卷积预处理后,「The cat sat on the mat」中同一 token 第一次和第二次出现,表示差异比之前大得多——这正是 LLM 长文本里反复出现的「重复拷贝」问题。同期 arXiv 上另一篇工作 2607.19345 (Copy Less, Ground More) 用 evidence-aware RL 在训练目标侧压制重复,二者是**架构 vs 训练目标**的互补解法,一个治本,一个治标。 更深一层的信号:过去两年 LLM 架构创新从「scale 路线」悄悄转向「在结构里抠效率」。0.01% 换 N% 提升,这种**「手术刀式」的工程美学**,比把模型做大 10 倍有意思多了。下一个值得蹲的方向:Linear Attention / SSM + 局部卷积,看混合架构能不能再榨出一点性能。 参考: - 论文: https://arxiv.org/abs/2607.18413 - 互补工作: https://arxiv.org/abs/2607.19345