Skip to content

Understanding and Exploiting Diagonal Attention Sparsity in Autoregressive Image Generation ​

本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。

论文原文 · PDF · 源文件

【一句话总结】本文首次揭示自回归图像生成中的对角线注意力稀疏性,并提出对角线感知稀疏注意力机制,在质量损失小于 2% 下实现最高 3.1× 吞吐量提升。

基本信息 ​

属性内容
作者Daeun Kim, Junwha Hong, Changhun Oh, Yoonsung Kim, Yoonhyeong Lee, Jongse Park
来源arXiv:2609.19702
发布日期2026-09-17
抓取领域LLM推理 · 服务与部署
学科方向计算机视觉 · 性能优化
arXiv 分类cs.CV, cs.PF
适用层次进阶
标签【标签】自回归图像生成, 稀疏注意力, KV缓存优化, 对角线稀疏性, GPU服务系统
PDF在线阅读
代码仓库暂无

问题的初衷(Why - 为什么要做这个研究) ​

【问题的初衷】自回归图像生成(Autoregressive Image Generation)已成为多模态人工智能系统的重要范式,其优势在于能够复用基于 Transformer 的大语言模型(Large Language Model, LLM)服务基础设施。然而,与文本生成每次请求仅产生数百个 token 不同,图像生成任务通常需要在单次请求中生成数千个视觉 token(例如 1024×1024 分辨率图像可能对应上万个 token)。在自回归解码过程中,每生成一个新 token 都需要访问完整的键值缓存(KV Cache),导致注意力计算(Attention Computation)逐渐被 KV 缓存访问所瓶颈化,而非被矩阵乘法所瓶颈化。这种内存带宽瓶颈使得解码延迟随序列长度线性甚至超线性增长,严重制约了服务吞吐量。稀疏注意力(Sparse Attention)对该工作负载极具吸引力,因为许多视觉生成应用能够容忍适度的质量下降以换取性能与效率的提升。然而,现有稀疏注意力研究主要针对文本 LLM 推理,其稀疏性假设(如注意力集中于少数关键 token)是否适用于自回归图像生成尚不清楚。视觉 token 具有独特的空间局部性和二维结构,其注意力模式可能与文本存在本质差异。因此,系统性地刻画自回归图像生成中的注意力稀疏性,并据此设计专用稀疏注意力机制,成为一个亟待解决且具有重要实用价值的问题。


问题的解决(What - 提出了什么方案) ​

【问题的解决】本文首次对自回归图像生成中的注意力稀疏性进行了系统性刻画,覆盖多种工作负载和代表性开源模型。分析揭示了若干与文本 LLM 显著不同的特性:第一,显著的预填充-解码(Prefill-Decode)不对称性,即预填充阶段与解码阶段的注意力分布差异巨大;第二,注意力强烈集中于提示 token(Prompt Tokens)和局部 token(Local Tokens);第三,由视觉 token 空间局部性引发的独特对角线注意力稀疏模式(Diagonal Attention Sparsity Pattern),即当前 token 对与其空间位置相近的历史 token 具有更高的注意力权重,形成沿对角线方向的稀疏结构。基于这些观察,作者提出了一种对角线感知稀疏注意力机制(Diagonal-Aware Sparse Attention),其核心思想是在最近窗口内选择性地跳过沿对角线注意力方向的 KV 条目,从而在保持生成质量的同时大幅减少 KV 缓存访问。与现有稀疏注意力方法的本质区别在于:现有方法多基于文本注意力假设(如注意力汇(Attention Sink)或全局重要 token),而本文方法专门针对视觉 token 的空间局部性设计,利用对角线方向的结构化稀疏性进行选择性跳过,而非简单的 top-k 或固定模式稀疏。该方法在基于 GPU 的服务系统上实现,集成了 FlexGen、FlashAttention-2 和自定义内核,相比稠密推理实现了最高 3.1× 的吞吐量提升和 1.19× 的延迟改善,且质量下降小于 2%。


技术方法详解(How - 怎么实现的) ​

【技术方法详解】

  • 系统性注意力稀疏性刻画:作者在多种自回归图像生成模型(如基于 VQGAN 或类似视觉分词器的 Transformer 模型)和不同工作负载下,采集并分析注意力矩阵。通过可视化注意力权重分布,发现预填充阶段注意力较为分散,而解码阶段注意力高度集中;同时观察到当前 token 对提示 token 和最近局部 token 的注意力显著高于远处 token。
  • 对角线稀疏模式发现:由于视觉 token 按光栅扫描顺序排列,空间相邻的 token 在序列中也相邻。当前 token 对其空间邻域(即序列中邻近位置)的注意力形成沿对角线方向的带状结构。作者量化了这种对角线稀疏性,发现大量 KV 条目在注意力计算中贡献极小,可被安全跳过。
  • 对角线感知稀疏注意力机制:在解码阶段,对于每个查询 token,仅保留最近窗口 W 内的 KV 条目,并在该窗口内沿对角线方向选择性地跳过部分 KV 条目。具体而言,定义一个对角线带宽 B,仅计算查询与键之间序列距离小于 B 的注意力分数,其余置零或跳过。该机制可形式化为:Attention(Q,K,V)=softmax(QKTd⊙M)V,其中 M 为对角线带状掩码矩阵。
  • 系统实现与内核优化:在 GPU 服务系统上实现,利用 FlexGen 进行内存管理,FlashAttention-2 进行高效注意力计算,并编写自定义 CUDA 内核以支持对角线稀疏模式下的非连续 KV 访问。通过分块(Tiling)和共享内存优化,减少内存带宽压力。
  • 质量-效率权衡评估:在多个图像生成基准上评估生成质量(如 FID、IS 等指标)与吞吐量、延迟的关系,验证在质量下降小于 2% 的前提下实现显著性能提升。
  • 与现有稀疏方法对比:将所提方法与 StreamingLLM、H2O、TOVA 等文本稀疏注意力方法进行对比,证明针对视觉对角线稀疏性的专用设计优于通用文本稀疏假设。

系统架构图 ​

方法流程图 ​

核心公式与算法 ​

【核心公式】

Attention(Q,K,V)=softmax(QKTd⊙M)V

其中 Q,K,V 分别为查询、键、值矩阵,d 为维度,M 为对角线带状掩码矩阵,Mij=1 当 |i−j|≤B 且 j≥i−W,否则为 0。该公式表示仅计算查询与键之间序列距离小于带宽 B 且在最近窗口 W 内的注意力分数。

稀疏度=1−∑i,jMijN2

其中 N 为序列长度,用于量化稀疏程度。

加速比=TdenseTsparse

其中 Tdense 和 Tsparse 分别为稠密和稀疏推理时间。


应用场景(Where - 在哪落地) ​

【应用场景】

  • 实时文本到图像生成服务:在云端图像生成平台中,用户提交文本提示后需要快速获得生成图像。使用本文的对角线感知稀疏注意力,可以在保证图像质量基本不变的前提下,将单次请求的延迟降低约 19%,吞吐量提升最高 3.1×,从而支持更多并发用户,降低服务成本。例如,一个部署了自回归图像生成模型的 API 服务,在高峰期可通过稀疏注意力显著提升每秒请求处理量。
  • 移动端或边缘设备图像生成:在资源受限的设备上,KV 缓存访问是主要瓶颈。对角线稀疏注意力通过减少 KV 缓存访问量,降低内存带宽需求,使得在移动端运行轻量级自回归图像生成模型成为可能。用户可以在离线状态下生成个性化图像,无需依赖云端。
  • 交互式图像编辑与生成:在交互式应用中,用户可能反复调整提示并重新生成图像。稀疏注意力加速了解码过程,使得交互响应更加流畅。例如,在 Photoshop 等工具中集成自回归生成功能,用户每次修改提示后能快速看到更新结果,提升创作效率。

具体技术细节示例(How in Action - 算法如何执行) ​

【具体技术细节示例】假设我们有一个自回归图像生成模型,序列长度 N=8,视觉 token 按光栅扫描顺序排列。设定最近窗口 W=4,对角线带宽 B=2。当前解码到第 i=6 个 token(从 0 开始计数),查询向量为 q6。稠密注意力需要计算 q6 与所有 8 个键 k0,k1,…,k7 的注意力分数。应用对角线稀疏掩码后,仅保留满足 |6−j|≤2 且 j≥6−4=2 的键,即 j∈{4,5,6,7}(因为 |6−4|=2,|6−5|=1,|6−6|=0,|6−7|=1,均满足;而 j=3 时 |6−3|=3>2,被跳过;j=2 时 |6−2|=4>2,被跳过)。因此,仅需计算 q6 与 k4,k5,k6,k7 的注意力分数,其余键的注意力分数置零。假设计算得到的注意力分数为 s4=0.1,s5=0.2,s6=0.5,s7=0.2,经过 softmax 归一化后得到权重 a4=0.15,a5=0.20,a6=0.45,a7=0.20。最终输出为 a4v4+a5v5+a6v6+a7v7。通过这种方式,KV 缓存访问量从 8 次减少到 4 次,减少了 50%。在实际系统中,随着序列长度增加,稀疏度更高,加速效果更显著。


实验结果(Results - 效果如何) ​

【实验结果】论文在多种自回归图像生成模型和基准数据集上进行了实验,包括基于 VQGAN 的类条件生成和文本到图像生成任务。对比方法包括稠密注意力推理以及多种文本稀疏注意力方法(如 StreamingLLM、H2O、TOVA)。主要实验设置包括不同序列长度(如 1024、2048、4096 个视觉 token)和不同批量大小。关键结果表明:所提出的对角线感知稀疏注意力在保持生成质量(FID 下降小于 2%)的同时,实现了最高 3.1× 的吞吐量提升和 1.19× 的延迟降低。与文本稀疏方法相比,本文方法在相同稀疏度下质量下降更小,证明了针对视觉对角线稀疏性专用设计的有效性。此外,消融实验验证了对角线带宽 B 和最近窗口 W 对性能与质量的影响,发现适中的 B 和 W 即可达到接近稠密的质量。

实验结果可视化 ​


优势与不足 ​

【优势与不足】 优势:

  • 首次系统性地刻画了自回归图像生成中的注意力稀疏性,揭示了与文本 LLM 显著不同的对角线稀疏模式,填补了该领域空白。
  • 提出的对角线感知稀疏注意力机制针对视觉 token 空间局部性设计,在保持生成质量的同时显著提升吞吐量并降低延迟,实用性强。
  • 系统实现完整,集成了 FlexGen、FlashAttention-2 和自定义内核,验证了方法在实际服务系统中的可行性。

不足:

  • 对角线稀疏模式可能对某些图像生成模型或分词方式不适用,方法的泛化性有待进一步验证。
  • 质量评估主要依赖 FID 等指标,可能无法完全反映人眼感知质量,且 2% 的质量下降在某些高精度应用场景中仍不可接受。
  • 自定义内核的实现细节和可移植性未充分讨论,可能增加部署复杂度。

相关工作 ​

【相关工作】

  • StreamingLLM:提出注意力汇和滑动窗口机制,用于流式文本生成,但未考虑视觉 token 的空间结构。
  • H2O:基于重击者(Heavy Hitter)的 KV 缓存淘汰策略,针对文本 LLM 推理,假设注意力集中于少数 token。
  • TOVA:基于 top-k 的稀疏注意力,动态选择重要 KV 条目,但未针对图像生成的对角线模式优化。
  • FlashAttention-2:高效注意力计算内核,本文在其基础上实现对角线稀疏模式。
  • FlexGen:高吞吐量 LLM 服务系统,本文利用其内存管理能力支持稀疏 KV 访问。

未来研究方向 ​

【未来方向】

  • 自适应对角线带宽与窗口:研究根据图像内容或生成阶段动态调整对角线带宽 B 和最近窗口 W,以在质量与效率之间取得更优权衡。
  • 跨模型泛化性验证:将方法扩展到更多自回归图像生成模型(如基于扩散的模型或混合架构),验证对角线稀疏模式的普适性。
  • 硬件协同设计:针对对角线稀疏模式设计专用硬件加速器或更高效的 CUDA 内核,进一步降低内存带宽需求。

一句话总结 ​

【一句话总结】本文首次揭示自回归图像生成中的对角线注意力稀疏性,并提出对角线感知稀疏注意力机制,在质量损失小于 2% 下实现最高 3.1× 吞吐量提升。


本解读由 DeepSeek AI 自动生成,仅供参考。

Built with curiosity and a little stardust.