Understanding and Exploiting Diagonal Attention Sparsity in Autoregressive Image Generation
本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。
【一句话总结】本文首次揭示自回归图像生成中的对角线注意力稀疏性,并提出对角线感知稀疏注意力机制,在质量损失小于
下实现最高 吞吐量提升。
基本信息
| 属性 | 内容 |
|---|---|
| 作者 | Daeun Kim, Junwha Hong, Changhun Oh, Yoonsung Kim, Yoonhyeong Lee, Jongse Park |
| 来源 | arXiv:2609.19702 |
| 发布日期 | 2026-09-17 |
| 抓取领域 | LLM推理 · 服务与部署 |
| 学科方向 | 计算机视觉 · 性能优化 |
| arXiv 分类 | cs.CV, cs.PF |
| 适用层次 | 进阶 |
| 标签 | 【标签】自回归图像生成, 稀疏注意力, KV缓存优化, 对角线稀疏性, GPU服务系统 |
| 在线阅读 | |
| 代码仓库 | 暂无 |
问题的初衷(Why - 为什么要做这个研究)
【问题的初衷】自回归图像生成(Autoregressive Image Generation)已成为多模态人工智能系统的重要范式,其优势在于能够复用基于 Transformer 的大语言模型(Large Language Model, LLM)服务基础设施。然而,与文本生成每次请求仅产生数百个 token 不同,图像生成任务通常需要在单次请求中生成数千个视觉 token(例如
问题的解决(What - 提出了什么方案)
【问题的解决】本文首次对自回归图像生成中的注意力稀疏性进行了系统性刻画,覆盖多种工作负载和代表性开源模型。分析揭示了若干与文本 LLM 显著不同的特性:第一,显著的预填充-解码(Prefill-Decode)不对称性,即预填充阶段与解码阶段的注意力分布差异巨大;第二,注意力强烈集中于提示 token(Prompt Tokens)和局部 token(Local Tokens);第三,由视觉 token 空间局部性引发的独特对角线注意力稀疏模式(Diagonal Attention Sparsity Pattern),即当前 token 对与其空间位置相近的历史 token 具有更高的注意力权重,形成沿对角线方向的稀疏结构。基于这些观察,作者提出了一种对角线感知稀疏注意力机制(Diagonal-Aware Sparse Attention),其核心思想是在最近窗口内选择性地跳过沿对角线注意力方向的 KV 条目,从而在保持生成质量的同时大幅减少 KV 缓存访问。与现有稀疏注意力方法的本质区别在于:现有方法多基于文本注意力假设(如注意力汇(Attention Sink)或全局重要 token),而本文方法专门针对视觉 token 的空间局部性设计,利用对角线方向的结构化稀疏性进行选择性跳过,而非简单的 top-
技术方法详解(How - 怎么实现的)
【技术方法详解】
- 系统性注意力稀疏性刻画:作者在多种自回归图像生成模型(如基于 VQGAN 或类似视觉分词器的 Transformer 模型)和不同工作负载下,采集并分析注意力矩阵。通过可视化注意力权重分布,发现预填充阶段注意力较为分散,而解码阶段注意力高度集中;同时观察到当前 token 对提示 token 和最近局部 token 的注意力显著高于远处 token。
- 对角线稀疏模式发现:由于视觉 token 按光栅扫描顺序排列,空间相邻的 token 在序列中也相邻。当前 token 对其空间邻域(即序列中邻近位置)的注意力形成沿对角线方向的带状结构。作者量化了这种对角线稀疏性,发现大量 KV 条目在注意力计算中贡献极小,可被安全跳过。
- 对角线感知稀疏注意力机制:在解码阶段,对于每个查询 token,仅保留最近窗口
内的 KV 条目,并在该窗口内沿对角线方向选择性地跳过部分 KV 条目。具体而言,定义一个对角线带宽 ,仅计算查询与键之间序列距离小于 的注意力分数,其余置零或跳过。该机制可形式化为: ,其中 为对角线带状掩码矩阵。 - 系统实现与内核优化:在 GPU 服务系统上实现,利用 FlexGen 进行内存管理,FlashAttention-2 进行高效注意力计算,并编写自定义 CUDA 内核以支持对角线稀疏模式下的非连续 KV 访问。通过分块(Tiling)和共享内存优化,减少内存带宽压力。
- 质量-效率权衡评估:在多个图像生成基准上评估生成质量(如 FID、IS 等指标)与吞吐量、延迟的关系,验证在质量下降小于
的前提下实现显著性能提升。 - 与现有稀疏方法对比:将所提方法与 StreamingLLM、H2O、TOVA 等文本稀疏注意力方法进行对比,证明针对视觉对角线稀疏性的专用设计优于通用文本稀疏假设。
系统架构图
方法流程图
核心公式与算法
【核心公式】
其中
其中
其中
应用场景(Where - 在哪落地)
【应用场景】
- 实时文本到图像生成服务:在云端图像生成平台中,用户提交文本提示后需要快速获得生成图像。使用本文的对角线感知稀疏注意力,可以在保证图像质量基本不变的前提下,将单次请求的延迟降低约
,吞吐量提升最高 ,从而支持更多并发用户,降低服务成本。例如,一个部署了自回归图像生成模型的 API 服务,在高峰期可通过稀疏注意力显著提升每秒请求处理量。 - 移动端或边缘设备图像生成:在资源受限的设备上,KV 缓存访问是主要瓶颈。对角线稀疏注意力通过减少 KV 缓存访问量,降低内存带宽需求,使得在移动端运行轻量级自回归图像生成模型成为可能。用户可以在离线状态下生成个性化图像,无需依赖云端。
- 交互式图像编辑与生成:在交互式应用中,用户可能反复调整提示并重新生成图像。稀疏注意力加速了解码过程,使得交互响应更加流畅。例如,在 Photoshop 等工具中集成自回归生成功能,用户每次修改提示后能快速看到更新结果,提升创作效率。
具体技术细节示例(How in Action - 算法如何执行)
【具体技术细节示例】假设我们有一个自回归图像生成模型,序列长度
实验结果(Results - 效果如何)
【实验结果】论文在多种自回归图像生成模型和基准数据集上进行了实验,包括基于 VQGAN 的类条件生成和文本到图像生成任务。对比方法包括稠密注意力推理以及多种文本稀疏注意力方法(如 StreamingLLM、H2O、TOVA)。主要实验设置包括不同序列长度(如 1024、2048、4096 个视觉 token)和不同批量大小。关键结果表明:所提出的对角线感知稀疏注意力在保持生成质量(FID 下降小于
实验结果可视化
优势与不足
【优势与不足】 优势:
- 首次系统性地刻画了自回归图像生成中的注意力稀疏性,揭示了与文本 LLM 显著不同的对角线稀疏模式,填补了该领域空白。
- 提出的对角线感知稀疏注意力机制针对视觉 token 空间局部性设计,在保持生成质量的同时显著提升吞吐量并降低延迟,实用性强。
- 系统实现完整,集成了 FlexGen、FlashAttention-2 和自定义内核,验证了方法在实际服务系统中的可行性。
不足:
- 对角线稀疏模式可能对某些图像生成模型或分词方式不适用,方法的泛化性有待进一步验证。
- 质量评估主要依赖 FID 等指标,可能无法完全反映人眼感知质量,且
的质量下降在某些高精度应用场景中仍不可接受。 - 自定义内核的实现细节和可移植性未充分讨论,可能增加部署复杂度。
相关工作
【相关工作】
- StreamingLLM:提出注意力汇和滑动窗口机制,用于流式文本生成,但未考虑视觉 token 的空间结构。
- H2O:基于重击者(Heavy Hitter)的 KV 缓存淘汰策略,针对文本 LLM 推理,假设注意力集中于少数 token。
- TOVA:基于 top-
的稀疏注意力,动态选择重要 KV 条目,但未针对图像生成的对角线模式优化。 - FlashAttention-2:高效注意力计算内核,本文在其基础上实现对角线稀疏模式。
- FlexGen:高吞吐量 LLM 服务系统,本文利用其内存管理能力支持稀疏 KV 访问。
未来研究方向
【未来方向】
- 自适应对角线带宽与窗口:研究根据图像内容或生成阶段动态调整对角线带宽
和最近窗口 ,以在质量与效率之间取得更优权衡。 - 跨模型泛化性验证:将方法扩展到更多自回归图像生成模型(如基于扩散的模型或混合架构),验证对角线稀疏模式的普适性。
- 硬件协同设计:针对对角线稀疏模式设计专用硬件加速器或更高效的 CUDA 内核,进一步降低内存带宽需求。
一句话总结
【一句话总结】本文首次揭示自回归图像生成中的对角线注意力稀疏性,并提出对角线感知稀疏注意力机制,在质量损失小于
下实现最高 吞吐量提升。
本解读由 DeepSeek AI 自动生成,仅供参考。