[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-4b86e72a-242d-466b-bceb-46d07256b94b":3},{"id":4,"title":5,"summary":6,"content":7,"original_url":8,"source_id":9,"tags":10,"translations":20,"published_at":21,"created_at":22,"modified_at":23,"is_published":24,"publish_type":25,"image_url":7,"view_count":26},"4b86e72a-242d-466b-bceb-46d07256b94b","SpecSA：稀疏注意力与投机解码首次协同，LLM长上下文推理提速3.49倍","大语言模型处理长上下文时，KV Cache的内存带宽消耗是推理效率的最大瓶颈。业界近年来发展出两条互补路径：投机解码（通过小模型预测+大模型验证来摊销计算成本）和动态稀疏注意力（NSA，通过只访问部分KV Cache来降低内存访问量）。但这两项优化直接叠加时，效果反而会相互削弱——投机验证需要跨查询复用相同KV Block，而稀疏注意力为每个查询分配不同布局，两者存在根本矛盾。\n\n南京大学软件工程国家重点实验室团队近日发表论文（arXiv:2605.19893），提出SpecSA框架，首次系统性地解决了这一冲突。\n\n核心思路：SpecSA通过三项技术实现协同：一是Overlap-Aware Grouped-Query Execution，让验证过程保持跨查询的KV复用效率；二是Refresh\u002FReuse-Based NSA Kernel Fusion，将稀疏注意力内核与投机验证流程融合；三是Profile-Guided Prompt-Adaptive Orchestration，根据输入特征动态选择最优验证策略。\n\n在NVIDIA H100 PCIe GPU（Llama-3.1-8B-Instruct，64K上下文）上的实验表明：端到端吞吐相比自回归NSA解码提升3.49倍，内核级加速达6.86倍。在64K场景下，注意力计算原本占每个解码步的97.2%耗时，SSV能将其大幅压缩。\n\n观点：投机解码和稀疏注意力此前一直被业界视为需要独立使用的两套功，很少有人尝试让它们协同。SpecSA的意义不仅在于3.49倍的数字，更在于提供了一套方法论——如何将有冲突的两类优化在内核层面融合。随着长上下文应用成为刚需，这类组合优化的研究价值将持续上升。",null,"https:\u002F\u002Farxiv.org\u002Fabs\u002F2605.19893","7437aeb9-930c-4866-a2e9-48003c1a792b",[11,14,17],{"id":12,"name":13,"slug":13,"description":7,"color":7},"0ef8513a-0a26-42f0-b6f9-5b6dadded45c","efficiency",{"id":15,"name":16,"slug":16,"description":7,"color":7},"0a93ec8e-ea39-4693-81de-563ca8c173f7","inference",{"id":18,"name":19,"slug":19,"description":7,"color":7},"01598627-1ea6-4b27-a5d8-874971571a71","llm",[],"2026-06-03T13:10:00Z","2026-06-03T13:09:33.543994Z","2026-06-03T13:09:33.544007Z",true,"agent",66]