小鹏 TuringViT 把视觉 Transformer 训练成本砍到一成:注意力+数据+分辨率三板斧重塑 VLM 视觉基座

**一句话**:小鹏 TuringViT 把视觉 Transformer 的注意力、数据、分辨率三个老毛病一起拆——混合线性注意力 + VISTA-Curation 数据治理 + 原生动态分辨率,仅用 SigLIP2 一成的训练数据跑到 SOTA,1536² 分辨率下推理吞吐跑赢主流开源基线 2-3 倍。 视觉编码器正成 VLM/VLA 时代新战场。LLM 把文本端吃干抹净后,所有多模态系统的第一站都是这块"视网膜"——决定端侧能不能跑得动、跨任务能不能统一。 7月21日小鹏发布 TuringViT(arXiv:2606.24253,官网 turingvit.github.io),把视觉编码器从"堆数据的暴力美学"拽回"按效果算账的工程经济学"。 **三板斧** **Turing 线性注意力**:标准 softmax 注意力随视觉 token 二次增长,高分辨率+多视角视频帧顶到成本天花板。TuringViT 提"5 层线性注意力+1 层多头注意力"的混合 Turing Block,让线性注意力负责主要全局聚合,周期性插入少量 MHA 层保住 token 级交互精度,配序列长度感知归一化和输入依赖门控避免细节平滑。 **VISTA-Curation 数据治理**:主流 ViT 靠百亿级图文对,但数据噪声大、对齐度差,堆量收益边际递减。TuringViT 不卷数量、改卷单样本监督价值——多模型多提示词生成候选字幕+统一对比池打分三步筛选。结果只用 0.85B 图文对(SigLIP2-L 训练数据 10%),在 ImageNet-1K 等六项零样本基准拿到 83.6% 平均准确率,超过 10B 数据训练的开源基线。 **原生动态分辨率训练**:MIM 蒸馏初始化→受限动态分辨率(长边 256-512)→原生分辨率放开→图文视频混合训练,配合 2D RoPE,不同尺寸输入无需额外插值。 **关键数字**:1536² 分辨率下 TuringViT-18L 推理吞吐是 Seed1.5-ViT 的 3.04 倍、相比 SigLIP2-ViT-L 提升 2.16 倍——车机、机器人嵌入式算力上能直接吃到的延迟红利。 视觉编码器已经走到 LLM 2026 年的同一个拐点:堆数据边际收益肉眼可见衰减,真正的杠杆是注意力机制的二次方破解+数据治理量级提升+原生多分辨率预训练。TuringViT 不是终点,但它代表视觉编码器从"scaling 竞赛"切到"结构+数据+训练组合拳"的方向。