Skip to content

HYDRA: Proactive Android Malware Drift Adaptation via Hierarchical Graph Contrastive Learning ​

本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。

论文原文 · PDF · 源文件

【一句话总结】HYDRA 通过混合图与跨域对比学习实现主动式漂移适应,大幅降低 Android 恶意软件检测的漏报误报并减少标注需求。

基本信息 ​

属性内容
作者Han Chen, Hanchen Wang, Hongmei Chen, Lu Qin, Wenjie Zhang, Ying Zhang
来源arXiv:2609.26352
发布日期2026-09-22
抓取领域图学习/表示学习
学科方向安全加密 · 机器学习
arXiv 分类cs.CR, cs.LG
适用层次进阶
标签【标签】概念漂移, Android恶意软件检测, 图对比学习, 混合图表示, 主动域适应
PDF在线阅读
代码仓库暂无

问题的初衷(Why - 为什么要做这个研究) ​

【问题的初衷】Android 恶意软件(Android Malware)的快速演化导致概念漂移(Concept Drift)问题日益严重,即训练数据分布与部署后遇到的真实数据分布之间出现显著偏移,使得基于机器学习(Machine Learning)的检测器性能随时间大幅下降。这一问题在安全领域尤为关键,因为漏检(False Negative)可能导致用户隐私泄露、财产损失甚至大规模僵尸网络攻击,而误报(False Positive)则会干扰正常用户使用并浪费安全分析员的人力。现有应对策略主要分为两类:一类是反应式(Reactive)适应方法,只有在检测性能已经明显下降后才被动调整模型,并且需要大量人工标注新样本,标注成本极高且响应滞后;另一类是主动式(Proactive)适应方法,试图在性能下降前进行适应,但往往依赖不稳定的对抗训练(Adversarial Training),容易导致训练震荡和模式崩溃,同时仅使用单一层次的图表示(如仅用函数调用图或仅用控制流图),无法全面刻画应用行为。因此,如何在无需大量人工标注的前提下,主动、稳定且全面地学习漂移不变(Drift-Invariant)的表示,成为 Android 恶意软件检测中亟待解决的核心问题。


问题的解决(What - 提出了什么方案) ​

【问题的解决】论文提出 HYDRA(Hybrid Drift Adaptation,混合漂移适应)框架,一种基于分层图对比学习(Hierarchical Graph Contrastive Learning)的主动式漂移适应方法。其核心思路是:首先将 Android 应用建模为混合图结构(Hybrid Graph Structure),同时融合细粒度的控制流图(Control Flow Graph, CFG)和粗粒度的函数调用图(Function Call Graph, FCG),从而捕获从指令级到函数级的多层次行为模式。然后,HYDRA 引入一种新颖的跨域对比学习目标(Cross-Domain Contrastive Learning Objective),通过为未标注的目标域样本生成伪标签(Pseudo-Label),在同一个稳定的优化过程中将历史源域数据与新目标域数据在表示空间中对齐。与现有方法本质不同的是,HYDRA 不需要复杂的对抗目标(Adversarial Objective),而是将特征学习与域对齐统一在一个对比学习框架内,既避免了对抗训练的不稳定性,又克服了单层图表示的片面性。最终,HYDRA 能够在仅使用极少标注样本的情况下,显著降低漏报率和误报率,实现对概念漂移的鲁棒、高效适应。


技术方法详解(How - 怎么实现的) ​

【技术方法详解】

  • 混合图结构建模:HYDRA 将每个 Android 应用表示为混合图 G=(V,E),其中节点 V 包含来自控制流图(CFG)的基本块和来自函数调用图(FCG)的函数节点,边 E 同时包含 CFG 内部的控制流边和 FCG 中的函数调用边。这种分层结构能够同时捕获细粒度指令级行为和粗粒度模块级交互。
  • 分层图神经网络编码:使用图神经网络(Graph Neural Network, GNN)对混合图进行编码,分别对 CFG 层和 FCG 层进行消息传递(Message Passing),再通过层次化聚合得到应用级表示 hi。该表示融合了局部控制流语义和全局函数调用语义。
  • 跨域对比学习目标:定义源域(历史数据)和目标域(新数据)之间的对比损失。对于目标域未标注样本,通过聚类或最近邻策略生成伪标签 y^j,然后将语义相似的样本在表示空间中拉近,无论其来自源域还是目标域。
  • 伪标签生成与稳定优化:伪标签并非一次性生成,而是在训练过程中迭代更新,避免早期错误累积。整个优化过程采用单一阶段的对比学习目标,无需对抗训练中的极小极大博弈,从而保证训练稳定性。
  • 漂移不变表示学习:通过跨域对齐,模型学习到的表示对域偏移不敏感,即对恶意软件演化带来的分布变化具有鲁棒性。最终分类器在目标域上直接推理,无需重新标注大量样本。
  • 端到端训练与推理:HYDRA 将图编码、对比对齐和分类器训练统一在一个端到端框架中,推理时仅需前向传播即可完成恶意软件检测。

系统架构图 ​

方法流程图 ​

核心公式与算法 ​

【核心公式】

Lcont=−∑i∈S∪Tlog⁡exp⁡(sim(hi,hi+)/τ)∑j≠iexp⁡(sim(hi,hj)/τ)

该公式为跨域对比损失,其中 hi 为应用表示,i+ 为与 i 语义相似的正样本(可来自源域或目标域),τ 为温度系数,sim(⋅,⋅) 为余弦相似度。

y^j=arg⁡maxcp(c∣hj),j∈T

该公式为伪标签生成,对目标域样本 j 根据当前分类器预测概率生成伪标签 y^j。

Ltotal=Lcls+λLcont

总损失由分类损失和对比损失加权组成,λ 为平衡超参数。


应用场景(Where - 在哪落地) ​

【应用场景】

  • 移动安全应用商店的恶意软件筛查:应用商店每天上架大量新 APK,恶意软件家族不断演化。HYDRA 可部署在应用商店后端,利用历史标注数据作为源域,对新上架应用作为目标域进行主动适应。通过混合图分析应用的 CFG 和 FCG,结合跨域对比学习,在无需人工标注新样本的情况下自动识别新型恶意软件,降低漏报率,保护用户下载安全。预期效果是将新型恶意软件的漏报率降低 60% 以上,同时保持低误报率,减少对正常应用的误拦截。
  • 企业终端安全防护:企业内员工设备可能安装来源不明的应用,攻击者常通过变种恶意软件绕过传统签名检测。HYDRA 可集成到终端检测与响应(Endpoint Detection and Response, EDR)系统中,持续监控设备上应用的行为图,并利用跨域对比学习适应企业内部特有的应用分布。当检测到与历史恶意模式语义相似但结构不同的新变种时,及时告警。预期效果是提升对零日(Zero-Day)恶意软件的检测能力,并减少安全运营中心的告警疲劳。
  • 威胁情报与恶意软件家族追踪:安全研究机构需要追踪恶意软件家族的演化。HYDRA 的漂移不变表示可用于聚类和关联不同时期的恶意样本,即使代码结构发生较大变化,仍能通过语义相似性将它们归入同一家族。预期效果是帮助分析师快速识别新兴家族及其变种,缩短威胁情报响应时间。

具体技术细节示例(How in Action - 算法如何执行) ​

【具体技术细节示例】假设我们有一个源域历史样本集合 S,包含 1000 个已标注应用,其中 500 个恶意、500 个良性;目标域 T 包含 200 个未标注的新应用。以其中一个目标域应用 x1 为例,HYDRA 的执行过程如下:

  1. 混合图构建:对 x1 进行反编译,提取其控制流图 CFG,假设得到 120 个基本块节点和 300 条控制流边;同时提取函数调用图 FCG,得到 45 个函数节点和 80 条调用边。将两者合并为混合图 G1,共 165 个节点、380 条边。

  2. 分层 GNN 编码:将 G1 输入分层 GNN。第一层在 CFG 子图上进行 2 轮消息传递,得到每个基本块的嵌入;第二层在 FCG 子图上聚合函数节点及其内部基本块表示,进行 2 轮消息传递;最后通过全局池化得到应用级表示 h1∈R128,假设其值为 [0.12,−0.45,0.78,…]。

  3. 伪标签生成:将 h1 输入当前分类器,得到恶意概率 p(malware|h1)=0.82,良性概率 0.18,因此生成伪标签 y^1=malware。

  4. 跨域对比学习:在源域中寻找与 h1 余弦相似度最高的恶意样本 s37,其表示 h37 与 h1 的相似度为 0.91,将其作为正样本;同时随机选取其他样本作为负样本。计算对比损失 Lcont,假设当前批次中 h1 的对比损失为 0.35。

  5. 参数更新:将对比损失与分类损失相加得到总损失,通过反向传播更新 GNN 编码器和分类器参数。经过多轮迭代,h1 逐渐向源域中语义相似的恶意样本靠拢,同时远离良性样本。

  6. 最终输出:训练收敛后,x1 的表示 h1 被分类为恶意,且该表示对域偏移不敏感。即使未来出现类似行为但代码结构不同的变种,模型仍能通过语义相似性将其识别为恶意。


实验结果(Results - 效果如何) ​

【实验结果】论文在大规模、按时间排序的 Android 恶意软件数据集上进行了实验,模拟真实场景中的概念漂移。基准数据集包含多年份的 APK 样本,按时间划分源域和目标域。对比方法包括反应式适应方法、主动式对抗训练方法以及单层图表示方法等当前最先进(State-of-the-Art, SOTA)基线。实验采用漏报率(False Negative Rate, FNR)和误报率(False Positive Rate, FPR)作为主要评价指标。结果表明,HYDRA 在漏报率和误报率上均显著低于所有基线,同时在标注样本需求上最多减少 87.5%,即在仅使用 12.5% 标注数据的情况下仍能达到更优性能。这验证了混合图表示和跨域对比学习在应对概念漂移方面的有效性。

实验结果可视化 ​


优势与不足 ​

【优势与不足】

  • 优势:
    1. 提出混合图结构,同时融合 CFG 和 FCG,克服了单层图表示信息不完整的缺陷,能更全面刻画应用行为。
    2. 采用跨域对比学习替代对抗训练,避免了对抗目标的不稳定性,训练过程更稳定、更易收敛。
    3. 通过伪标签实现主动式漂移适应,大幅减少人工标注需求,实验显示标注样本最多减少 87.5%,具有很高的实际部署价值。
  • 不足:
    1. 伪标签的质量对最终性能影响较大,若目标域与源域差异过大,伪标签可能引入噪声,导致负迁移。
    2. 混合图构建和分层 GNN 编码带来较高的计算开销,在大规模 APK 实时检测场景下可能面临效率瓶颈。
    3. 实验主要基于特定数据集和时间划分,跨平台或跨恶意软件家族的泛化能力仍需进一步验证。

相关工作 ​

【相关工作】

  • 概念漂移适应:研究如何使机器学习模型在数据分布变化时保持性能,包括反应式重训练和主动式域适应方法,本文在此基础上提出主动式对比学习方案。
  • Android 恶意软件检测:基于图神经网络的方法利用 CFG 或 FCG 进行检测,本文将其扩展为混合图结构。
  • 图对比学习:通过对比正负样本学习图表示,本文将其扩展到跨域场景并引入伪标签。
  • 域适应与伪标签:利用未标注目标域数据生成伪标签进行自训练,本文将其与图对比学习结合。
  • 对抗训练鲁棒性:现有主动适应方法常用对抗训练,本文指出其不稳定性并给出替代方案。

未来研究方向 ​

【未来方向】

  • 伪标签噪声鲁棒性提升:研究更可靠的伪标签生成与筛选机制,例如基于不确定性估计或一致性正则化,减少目标域与源域差异过大时的负迁移。
  • 高效图编码与实时检测:探索图剪枝、采样或轻量化 GNN 结构,降低混合图构建与编码的计算开销,使 HYDRA 适用于移动端或实时检测场景。
  • 跨平台与多模态扩展:将混合图对比学习扩展到跨平台(如 iOS、Windows)或多模态(如动态行为日志、网络流量)场景,提升泛化能力和适应范围。

一句话总结 ​

【一句话总结】HYDRA 通过混合图与跨域对比学习实现主动式漂移适应,大幅降低 Android 恶意软件检测的漏报误报并减少标注需求。


本解读由 DeepSeek AI 自动生成,仅供参考。

Built with curiosity and a little stardust.