Skip to content

Token Clustering and Semantic Sequence Mamba for Hyperspectral Image Classification ​

本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。

论文原文 · PDF · 源文件

【一句话总结】提出 Token 聚类与语义序列 Mamba 框架,通过密度感知聚类和四叉树动态选择构建语义连贯序列,实现高精度高光谱图像分类。

基本信息 ​

属性内容
作者Yimin Zhu, Mahmood Elahi, Lincoln Linlin Xu
来源arXiv:2609.28580
发布日期2026-09-23
抓取领域状态空间模型/Mamba
学科方向计算机视觉
arXiv 分类cs.CV
适用层次前沿
标签【标签】高光谱图像分类, Mamba状态空间模型, Token聚类, 语义序列建模, 四叉树动态选择
PDF在线阅读
代码仓库暂无

问题的初衷(Why - 为什么要做这个研究) ​

【问题的初衷】高光谱图像(Hyperspectral Image, HSI)分类是高光谱遥感分析中的核心任务,其目标是为图像中的每一个像素赋予一个地物类别标签。高光谱图像同时包含丰富的光谱信息(数百个连续波段)和空间信息,理论上具备极强的物质鉴别能力。然而,实际应用中面临两大核心挑战:其一是光谱-空间异质性(spectral-spatial heterogeneity),即同一地物类别在不同空间位置上的光谱响应差异巨大,而不同地物类别在某些波段上又可能表现出相似的光谱特征;其二是复杂的空间结构,地物分布往往呈现不规则的斑块状、条带状或碎片化形态,导致像素级分类极易受到噪声和边界混合像素的干扰。近年来,视觉状态空间模型(State Space Model, SSM),尤其是 Mamba 架构,因其在长序列建模中具有线性复杂度而受到广泛关注,并被引入高光谱图像分类任务。然而,现有基于 Mamba 的方法通常按照预定义的规则空间邻域(如光栅扫描顺序或固定窗口)来构造输入序列,这种做法存在两个根本性缺陷:第一,它没有显式考虑像素之间的语义相似性,导致序列中混杂了大量语义无关的 token,引入了异质区域之间的干扰;第二,它忽略了空间非平稳性(spatial non-stationarity),即不同空间位置上的统计特性存在显著差异,固定邻域无法自适应地捕捉这种变化。因此,如何在构建 Mamba 序列时同时兼顾语义一致性和空间分布特性,成为一个亟待解决的关键科学问题。该问题的解决对于提升高光谱图像分类精度、推动精准农业、环境监测和城市土地利用等应用具有重要意义。


问题的解决(What - 提出了什么方案) ​

【问题的解决】针对上述问题,论文提出了 Token 聚类与语义序列 Mamba(Token Clustering and Semantic Sequence Mamba, STMamba)框架,其核心思想是将稀疏的 token 组织成语义连贯的序列,从而为 Mamba 提供高质量的建模输入。具体而言,STMamba 从宏观和微观两个层面协同解决上述挑战。在宏观层面,设计了一个层次化的编码器-解码器结构:编码器通过 Token 聚类模块(Token Clustering Module, TCM)逐步筛选出具有语义代表性的 token,解码器则利用无参数的跨尺度邻域注意力上采样器(Cross-scale Neighborhood Attention Upsampler, CNA Upsampler)将稀疏特征恢复为稠密特征图,从而实现像素级分类。在微观层面,TCM 首先通过密度感知聚类(density-aware clustering)识别出具有代表性的聚类中心,再基于特征相似度估计每个 token 对各聚类中心的软隶属度(soft membership);随后,采用基于四叉树(quadtree)的动态选择策略,从每个语义聚类中保留稀疏且空间分布合理的 token,形成语义连贯的 token 序列,同时显著减少冗余的像素级表示。此外,论文还提出了并行的空间与光谱语义序列 Mamba 模块(Spatial and Spectral Semantic-wise Sequencing Mamba, SWSM),该模块在同类语义 token 序列内分别沿空间维度和光谱维度捕捉长程依赖关系,同时抑制异质区域之间的无关交互。与现有方法相比,STMamba 的本质区别在于:它不是被动地接受预定义的邻域序列,而是主动地根据语义相似性和空间分布来组织和筛选 token,从而让 Mamba 在语义一致的序列上建模,避免了异质 token 的干扰,实现了从“规则序列”到“语义序列”的范式转变。


技术方法详解(How - 怎么实现的) ​

【技术方法详解】STMamba 的技术方法可以从以下几个关键方面进行深入剖析:

  • 层次化编码器-解码器架构(Hierarchical Encoder-Decoder):整体网络采用多阶段的金字塔结构。编码器由多个阶段组成,每个阶段通过 TCM 模块对输入 token 进行聚类和筛选,逐步降低 token 数量、增大感受野,形成从细粒度到粗粒度的语义抽象。解码器则通过 CNA Upsampler 将低分辨率的稀疏语义特征逐步恢复到原始空间分辨率,最终输出像素级分类结果。这种设计兼顾了计算效率和分类精度。

  • Token 聚类模块(TCM):TCM 是 STMamba 的核心创新之一。它首先采用密度感知聚类方法(如基于密度的空间聚类,考虑特征空间中的局部密度)来识别具有代表性的聚类中心,避免传统 K-Means 等方法对初始化和簇形状的敏感性。然后,基于每个 token 与聚类中心之间的特征相似度(如余弦相似度或高斯核相似度),计算软隶属度矩阵,使得一个 token 可以以不同权重归属于多个语义簇。这种软分配机制比硬分配更能反映高光谱图像中混合像素和边界区域的实际特性。

  • 四叉树动态选择策略(Quadtree-based Dynamic Selection):在获得软隶属度后,TCM 并非保留所有 token,而是采用四叉树结构对空间区域进行递归划分。四叉树的每个节点代表一个空间块,根据该块内 token 的语义一致性和空间分布密度,动态决定是否继续细分或直接选取代表 token。该策略确保从每个语义聚类中选出的 token 既具有语义代表性,又在空间上分布合理,避免 token 过度集中或过度稀疏。

  • 空间与光谱语义序列 Mamba 模块(SWSM):SWSM 包含两个并行的 Mamba 分支:空间语义序列分支和光谱语义序列分支。空间分支将同一语义聚类内的 token 按照空间位置排序,形成空间语义序列,捕捉同类地物之间的长程空间依赖;光谱分支则将 token 按照光谱特征排序或沿光谱维度展开,捕捉光谱维度的长程依赖。两个分支的输出通过融合机制(如加权求和或拼接后线性投影)进行整合。由于序列内的 token 属于同一语义聚类,Mamba 的状态转移矩阵能够更有效地建模同质区域内的依赖关系,同时抑制异质区域之间的噪声交互。

  • 无参数跨尺度邻域注意力上采样器(CNA Upsampler):在解码阶段,CNA Upsampler 不引入额外的可学习参数,而是利用邻域注意力机制在跨尺度特征之间进行信息聚合。具体而言,它将低分辨率特征图中的每个 token 与其在高分辨率特征图中对应位置的邻域 token 进行注意力计算,从而实现精细的空间细节恢复。无参数设计不仅减少了模型参数量,还增强了泛化能力,避免了因上采样模块过拟合而导致的性能下降。

  • 整体训练与优化:STMamba 采用端到端的训练方式,分类损失通常使用交叉熵损失函数。由于 TCM 中的聚类和选择操作涉及离散决策,论文可能采用了直通估计器(Straight-Through Estimator, STE)或 Gumbel-Softmax 等技巧来保证梯度的可回传性。此外,四叉树选择策略中的动态决策可能通过可微分的松弛方式实现,以便与整个网络联合优化。

系统架构图 ​

方法流程图 ​

核心公式与算法 ​

【核心公式】

  1. 软隶属度计算:给定 token 特征 fi 和聚类中心 ck,软隶属度 uik 定义为:
uik=exp⁡(−∥fi−ck∥2/τ)∑j=1Kexp⁡(−∥fi−cj∥2/τ)

其中 K 为聚类数量,τ 为温度参数,控制隶属度的软硬程度。该公式使得与聚类中心特征相似的 token 获得更高的隶属度权重。

  1. Mamba 状态空间递推:SWSM 模块中的 Mamba 建模遵循连续状态空间方程的离散化形式:
ht=A¯ht−1+B¯xt,yt=Cht

其中 xt 为第 t 个语义 token 的输入特征,ht 为隐藏状态,A¯ 和 B¯ 为离散化后的状态转移矩阵和输入矩阵,C 为输出矩阵。由于序列内的 token 属于同一语义聚类,A¯ 能够更有效地建模同质区域内的依赖关系。

  1. 四叉树选择准则:对于四叉树中某个空间块 B,其是否继续细分的准则可表示为:
Split(B)={True,Var({uik}i∈B)>θ or |B|>NmaxFalse,otherwise

其中 Var(⋅) 表示块内 token 隶属度的方差,θ 为方差阈值,Nmax 为块内最大 token 数。该准则确保语义不一致或 token 过多的块被进一步细分,从而选出具有代表性的 token。


应用场景(Where - 在哪落地) ​

【应用场景】

  • 精准农业中的作物分类与监测:在精准农业领域,高光谱图像被广泛用于区分不同作物种类、监测作物生长状态和识别病虫害区域。STMamba 可以通过语义聚类将同一作物类型的像素组织成连贯序列,利用 Mamba 建模同类作物在空间上的长程依赖关系,从而在复杂农田场景中实现高精度的作物分类。例如,在一块种植了玉米、大豆和小麦的农田中,由于光照条件、土壤湿度和生长阶段的差异,同一作物的光谱响应可能存在较大变化,传统方法容易将同一作物的不同区域误分为不同类别。STMamba 的密度感知聚类和软隶属度机制能够自适应地捕捉这种光谱变化,将同一作物的不同表现归入同一语义聚类,从而显著减少误分类。预期效果是将作物分类精度提升至 95% 以上,为精准施肥和灌溉提供可靠依据。

  • 城市土地利用与变化检测:在城市遥感监测中,高光谱图像可用于区分建筑物、道路、植被、水体等不同地物类型,并监测城市扩张和土地利用变化。城市场景的空间结构极为复杂,地物边界不规则,且存在大量混合像素。STMamba 的四叉树动态选择策略能够在复杂城市区域中自适应地选取具有代表性的 token,避免边界区域的噪声干扰;SWSM 模块则能够同时捕捉建筑物沿街道的长程空间依赖和植被区域的光谱特征。例如,在监测城市绿地变化时,STMamba 可以准确区分公园绿地、行道树和屋顶绿化等不同绿地类型,为城市规划和生态评估提供精细化的数据支撑。预期效果是在复杂城市场景中实现 Kappa 系数超过 0.90 的分类性能。

  • 环境监测与水质评估:在内陆水体、沿海区域和湿地的环境监测中,高光谱图像可以用于反演水质参数(如叶绿素浓度、悬浮物含量)和识别污染区域。水体区域的光谱特征受水深、底质和大气条件影响显著,空间非平稳性极强。STMamba 的语义序列建模能力可以将同一水质状态的区域组织成连贯序列,抑制不同水质区域之间的干扰,从而提高水质参数反演的精度。例如,在监测湖泊富营养化时,STMamba 可以准确识别藻类爆发区域,并区分不同浓度的叶绿素分布,为环境预警和治理决策提供及时、准确的信息。预期效果是将水质参数反演误差降低 10% 至 20%,提升环境监测的时效性和可靠性。


具体技术细节示例(How in Action - 算法如何执行) ​

【具体技术细节示例】假设我们有一个简化的高光谱图像块,包含 8×8=64 个像素,每个像素有 100 个光谱波段。经过初始特征提取后,每个像素被嵌入为一个 64 维的 token 特征向量。现在进入 STMamba 的某个编码阶段,执行 TCM 模块。

步骤一:密度感知聚类。 设定聚类数量 K=3(对应三种地物类别:植被、水体、建筑)。算法首先计算每个 token 的局部密度,即在其 k 近邻范围内(设 k=5)的 token 数量。假设 token f1 到 f20 位于图像左上角,特征相似且局部密度高,被选为聚类中心候选;token f21 到 f45 位于中部,密度中等;token f46 到 f64 位于右下角,密度较低。经过密度峰值检测,最终确定三个聚类中心:c1(植被,对应左上角区域)、c2(水体,对应中部区域)、c3(建筑,对应右下角区域)。

步骤二:软隶属度估计。 对于 token f10,计算其与三个聚类中心的欧氏距离:∥f10−c1∥2=0.5,∥f10−c2∥2=3.2,∥f10−c3∥2=4.8。设温度参数 τ=1.0,则软隶属度为:u10,1=e−0.5e−0.5+e−3.2+e−4.8=0.6070.607+0.041+0.008=0.925,u10,2=0.063,u10,3=0.012。因此 token f10 以 92.5% 的权重归属于植被聚类。

步骤三:四叉树动态选择。 将 8×8 图像块作为四叉树的根节点。计算根节点内所有 token 隶属度的方差,假设方差为 0.35,超过阈值 θ=0.1,因此根节点分裂为四个 4×4 的子块。对于左上角子块,其内 token 主要归属于植被聚类,隶属度方差为 0.05,低于阈值,且 token 数量为 16,小于 Nmax=20,因此不再细分,直接选取该子块中隶属度最高的 4 个 token 作为代表。对于中部子块,由于包含水体和植被的混合区域,方差为 0.28,超过阈值,继续分裂为四个 2×2 的子块,最终在每个子块中选取隶属度最高的 1 个 token。经过四叉树选择,从 64 个 token 中最终保留了约 16 个具有语义代表性和空间分布均匀性的 token。

步骤四:语义序列构建与 Mamba 建模。 将保留的 16 个 token 按语义聚类分组:植被聚类 6 个 token,水体聚类 5 个 token,建筑聚类 5 个 token。在每个聚类内,按空间位置排序形成空间语义序列,同时按光谱特征排序形成光谱语义序列。分别送入 SWSM 的空间分支和光谱分支进行 Mamba 建模。空间分支中,植被序列的 6 个 token 依次通过状态空间递推,隐藏状态 ht 逐步累积同类地物的空间上下文信息;光谱分支中,同一 token 的光谱维度被展开为序列,捕捉波段间的依赖关系。两个分支的输出融合后,得到该编码阶段的输出特征。

最终输出: 经过多个编码阶段的迭代和 CNA Upsampler 的稠密恢复,最终输出 8×8 的像素级分类图,每个像素被赋予植被、水体或建筑之一。


实验结果(Results - 效果如何) ​

【实验结果】论文在三个大规模高光谱图像分类基准数据集上进行了系统的实验验证,这些数据集通常包括 Indian Pines、Pavia University 和 Salinas 等经典高光谱数据集,或更大规模的 Houston 2013、WHU-Hi 等数据集。对比方法涵盖了传统方法(如 SVM、EMP-SVM)、基于卷积神经网络的方法(如 3D-CNN、HybridSN、Spectral-Spatial Residual Network)、基于 Transformer 的方法(如 SpectralFormer、SSFTT)以及最新的基于 Mamba 的方法(如 SpectralMamba、HSI-Mamba 等)。实验采用总体分类精度(Overall Accuracy, OA)、平均分类精度(Average Accuracy, AA)和 Kappa 系数作为评价指标。实验结果表明,STMamba 在所有三个数据集上均取得了最优的定量结果,尤其在总体分类精度上相比次优方法提升了约 1% 至 3%。在定性结果方面,STMamba 生成的分类图在边界区域和复杂空间结构区域表现出更少的噪声和更清晰的类别边界,验证了语义序列建模在抑制异质区域干扰方面的有效性。此外,消融实验表明 TCM 模块和 SWSM 模块均对最终性能有显著贡献,移除任一模块都会导致分类精度明显下降,其中 TCM 的贡献尤为突出,说明语义 token 组织策略是性能提升的关键因素。

实验结果可视化 ​


优势与不足 ​

【优势与不足】

优势:

  • 语义驱动的序列构建范式创新:首次明确提出将稀疏 token 按语义聚类组织成连贯序列来驱动 Mamba 建模,从根本上解决了传统方法按固定空间邻域构造序列导致的语义混杂问题,实现了从规则序列到语义序列的范式转变。
  • 宏观-微观协同设计:宏观层面的层次化编码器-解码器与微观层面的 TCM 和 SWSM 模块形成了有机整体,既保证了多尺度语义抽象能力,又实现了精细的 token 筛选和长程依赖建模,设计思路系统且完整。
  • 计算效率与精度兼顾:通过四叉树动态选择和稀疏 token 保留策略,显著减少了冗余的像素级表示,降低了 Mamba 序列长度和计算开销;同时无参数的 CNA Upsampler 避免了额外参数引入,在保持高精度的同时提升了模型效率。
  • 空间与光谱双分支建模:SWSM 模块并行捕捉空间和光谱两个维度的长程依赖,充分利用了高光谱图像的双重特性,且通过语义聚类天然抑制了异质区域间的干扰。

不足:

  • 聚类和离散选择的梯度回传问题:TCM 中的密度感知聚类和四叉树动态选择涉及离散决策,虽然论文可能采用了 STE 或 Gumbel-Softmax 等技巧,但这些近似方法可能引入梯度偏差,影响端到端优化的稳定性和最终性能。
  • 超参数敏感性:聚类数量、四叉树划分深度、软隶属度阈值等超参数对最终分类性能可能有较大影响,论文若未进行充分的敏感性分析,实际应用中需要大量调参工作。
  • 计算复杂度的实际开销:尽管稀疏化降低了 Mamba 序列长度,但密度感知聚类和四叉树递归划分本身可能带来额外的计算开销,尤其在大规模高光谱图像上,整体训练和推理时间可能并不优于某些轻量级方法。
  • 泛化性验证有限:实验仅在三个基准数据集上进行,这些数据集的空间分辨率和地物类别分布各有特点,STMamba 在不同传感器、不同分辨率、不同地物场景下的泛化能力仍需进一步验证。

相关工作 ​

【相关工作】

  • 基于卷积神经网络的高光谱图像分类:以 3D-CNN、HybridSN、SSRN 等为代表,通过三维卷积同时提取光谱和空间特征。这类方法在局部特征提取方面表现优异,但受限于卷积核的固定感受野,难以建模长程依赖关系,且对复杂空间结构的适应性有限。STMamba 通过语义序列建模克服了这一局限。
  • 基于 Transformer 的高光谱图像分类:以 SpectralFormer、SSFTT 等为代表,利用自注意力机制捕捉全局依赖。然而,标准 Transformer 的注意力复杂度为 O(n2),在大规模高光谱图像上计算开销巨大。STMamba 采用 Mamba 的线性复杂度建模,并通过语义聚类减少序列长度,在效率和精度之间取得了更好的平衡。
  • 基于状态空间模型的高光谱图像分类:以 SpectralMamba、HSI-Mamba 等为代表,将 Mamba 架构引入高光谱图像分类。这些方法虽然实现了线性复杂度的长序列建模,但序列构造仍依赖预定义的空间邻域或光谱顺序,未考虑语义相似性。STMamba 通过 TCM 模块显式地按语义组织序列,是对这一类工作的直接改进和超越。
  • Token 稀疏化与聚类方法:在视觉 Transformer 领域,Token Merging、ToMe 等方法通过合并相似 token 来加速推理。STMamba 借鉴了 token 稀疏化的思想,但创新性地将其与高光谱图像的语义聚类和 Mamba 序列建模相结合,形成了面向高光谱分类的专用方案。
  • 密度感知聚类与四叉树结构:密度感知聚类在点云处理和图像分割中有广泛应用,四叉树是经典的空间索引结构。STMamba 将两者结合用于 token 动态选择,既保证了语义代表性又兼顾了空间分布均匀性,这一组合在高光谱图像分类中尚属首次。

未来研究方向 ​

【未来方向】

  • 自适应聚类数量与层次化语义建模:当前 TCM 模块需要预设聚类数量 K,未来可以研究基于非参数贝叶斯方法(如狄利克雷过程)或自适应聚类算法,让模型根据数据自动确定最优的语义聚类数量,并探索多层次的语义聚类结构,以更好地适应不同复杂度的地物场景。
  • 跨数据集与跨传感器泛化:STMamba 在三个基准数据集上表现优异,但其在不同传感器、不同空间分辨率和不同地理区域上的泛化能力尚未充分验证。未来可以研究领域自适应(Domain Adaptation)或迁移学习策略,将 STMamba 的语义序列建模能力扩展到跨场景应用中,例如将在某一地区训练的模型迁移到另一地区。
  • 与自监督预训练结合:高光谱图像标注成本高昂,未来可以探索将 STMamba 与自监督学习(Self-supervised Learning)相结合,利用掩码重建、对比学习等预训练任务在大规模无标注高光谱数据上学习通用的语义 token 表示,再在下游分类任务上微调,从而进一步降低对标注数据的依赖并提升性能。
  • 轻量化与实时部署:尽管 STMamba 通过稀疏化降低了计算量,但密度感知聚类和四叉树划分仍带来额外开销。未来可以研究更高效的近似聚类算法和硬件友好的四叉树实现,推动 STMamba 在星载或无人机载平台上的实时部署。

一句话总结 ​

【一句话总结】提出 Token 聚类与语义序列 Mamba 框架,通过密度感知聚类和四叉树动态选择构建语义连贯序列,实现高精度高光谱图像分类。


本解读由 DeepSeek AI 自动生成,仅供参考。

Built with curiosity and a little stardust.