Skip to content

NNV3: Expanding Neural Network Verification to New Architectures and Domains ​

本文由 paper-daily 使用 DeepSeek 自动生成,仅供快速了解论文;关键结论请以原文为准。

论文原文 · PDF · 源文件

【一句话总结】NNV3 通过扩展 Star 集家族和引入概率与公平性验证,将神经网络形式化验证拓展到权重扰动、视频、图网络等新架构与新领域。

基本信息 ​

属性内容
作者Anne M. Tumlin, Samuel Sasaki, Ben Wooding, Diego Manzanas Lopez, Muhammad Usama Zubair, Navid Hashemi, Hongchao Zhang, Waseem Abbas, Ipek Oguz, Meiyi Ma, Taylor T. Johnson
来源arXiv:2609.30050
发布日期2026-09-24
抓取领域软件工程 · 分析/测试/合成
学科方向人工智能
arXiv 分类cs.AI
适用层次基础
标签【标签】神经网络验证, 集合可达性, Star 集, 公平性验证, 保形推理
PDF在线阅读
代码仓库暂无

问题的初衷(Why - 为什么要做这个研究) ​

【问题的初衷】随着深度学习在安全攸关领域的广泛应用,神经网络的形式化验证(Formal Verification)成为保障系统可靠性的关键技术。然而,现有的验证工具大多针对特定类型的网络架构和输入模态设计,难以适应日益多样化的 AI 系统。具体而言,NNV 1.0 仅支持前馈神经网络(Feedforward Neural Networks, FFNNs)、卷积神经网络(Convolutional Neural Networks, CNNs)和神经网络控制系统(Neural Network Control Systems, NNCS),NNV 2.0 虽然扩展到了循环神经网络(Recurrent Neural Networks, RNNs)、状态空间神经网络(State-Space Neural Networks, SSNNs)和神经常微分方程(Neural ODEs),但仍然无法处理权重扰动下的网络验证、视频与三维体素输入、图神经网络(Graph Neural Networks, GNNs)等新兴场景。此外,确定性验证在许多复杂问题上计算不可行,缺乏概率性验证的补充手段。公平性验证也尚未被纳入统一框架。因此,亟需一个能够覆盖新架构、新领域、新验证范式的综合性验证工具。


问题的解决(What - 提出了什么方案) ​

【问题的解决】NNV3 在 NNV 1.0 和 2.0 的集合可达性(Set-based Reachability)基础上,引入了 Star 集家族的新成员:ModelStar 用于验证权重扰动下的网络鲁棒性,VolumeStar 用于处理视频和三维体素输入,GraphStar 用于图神经网络验证。这些新集合表示方法扩展了可达性分析的能力边界,使其能够处理更复杂的输入结构和网络拓扑。此外,NNV3 引入了基于保形推理(Conformal Inference)的概率可达性模式,在确定性验证不可行时提供概率性保证,形成互补。FairNNV 模块则专注于在连续输入区域上验证反事实公平性和个体公平性。NNV3 还提供了恶意软件检测、图基电力系统、医学影像、变长时间序列和动作识别等新基准测试,并通过统一文档站点提供教程和开发者指南。与现有方法的本质区别在于:NNV3 不是单一架构的验证器,而是一个可扩展、多范式、多领域的统一验证框架。


技术方法详解(How - 怎么实现的) ​

【技术方法详解】

  • Star 集家族扩展:Star 集是一种能够精确表示神经网络各层输出集合的符号化表示方法。NNV3 在此基础上扩展出三种新集合类型:ModelStar 通过引入权重扰动维度,将权重不确定性编码到集合表示中,使得可达性分析能够覆盖权重空间的变化;VolumeStar 针对视频和三维体素数据,设计了时空维度的集合表示,能够捕捉帧间和体素间的相关性;GraphStar 针对图神经网络,将图结构信息与节点特征集合结合,支持消息传递过程中的集合传播。
  • 保形推理概率可达性:当确定性验证因计算复杂度不可行时,NNV3 采用保形推理(Conformal Inference)方法,通过校准数据集构建预测集合,为网络输出提供统计意义上的覆盖保证。该方法不要求网络满足 Lipschitz 连续性等强假设,适用于黑盒或复杂模型。
  • FairNNV 公平性验证:FairNNV 模块将反事实公平性(Counterfactual Fairness)和个体公平性(Individual Fairness)编码为可达性查询。反事实公平性要求:若两个输入仅在一个敏感属性上不同,则输出应相同;个体公平性要求:相似输入应产生相似输出。NNV3 通过在连续输入区域上执行集合传播来验证这些性质。
  • 新基准测试集:NNV3 引入了五个新基准:恶意软件检测(Malware Detection)、图基电力系统模型(Graph-based Power System Models)、医学影像(Medical Imaging)、变长时间序列数据(Variable-length Time Series)和动作识别(Action Recognition)。这些基准覆盖了分类、回归、序列预测等多种任务,并提供了形式化规约。
  • 统一文档与教程:NNV3 通过统一的文档站点整合了教程、API 参考和开发者指南,降低了新用户的上手门槛,并提供了可复现的实验脚本。

系统架构图 ​

方法流程图 ​

核心公式与算法 ​

【核心公式】

Reach(N,X)={y∣y=N(x),x∈X}

该公式定义了神经网络 N 在输入集合 X 上的可达集,即所有可能输出的集合。NNV3 的核心任务就是计算或近似这个集合。

Star={x∣x=c+Vα,α≥0}

该公式定义了 Star 集的基本形式,其中 c 是中心点,V 是基向量矩阵,α 是非负系数向量。NNV3 通过仿射变换和约束传播来计算各层的 Star 集。

ModelStar={x∣x=c+Vα+Wβ,α≥0,β∈B}

该公式定义了 ModelStar,在 Star 集基础上增加了权重扰动项 Wβ,其中 β 属于扰动集合 B。这使得可达性分析能够同时考虑输入和权重的变化。


应用场景(Where - 在哪落地) ​

【应用场景】

  • 自动驾驶系统的安全验证:在自动驾驶中,感知模块常使用 CNN 和 RNN 处理摄像头和雷达数据。NNV3 的 VolumeStar 可以验证视频输入下的目标检测网络鲁棒性,确保在不同光照、天气条件下不会产生危险输出。同时,ModelStar 可以验证模型在权重量化或压缩后的行为变化,保障部署后的安全性。预期效果是减少因感知错误导致的交通事故。
  • 医疗影像诊断的公平性验证:在医学影像诊断中,AI 模型可能因训练数据偏差而对不同性别、种族患者产生不公平诊断。FairNNV 可以验证模型在连续输入区域上的反事实公平性,即若患者性别改变,诊断结果是否保持一致。NNV3 的医学影像基准提供了标准化测试平台。预期效果是提高医疗 AI 的公平性和可信度,避免歧视性诊断。
  • 电力系统图神经网络的鲁棒性验证:在智能电网中,图神经网络被用于节点分类和故障检测。GraphStar 可以验证 GNN 在节点特征扰动或拓扑变化下的输出稳定性,确保电力系统状态估计的可靠性。NNV3 的图基电力系统基准提供了真实场景的测试用例。预期效果是增强电网对网络攻击和传感器故障的抵御能力。

具体技术细节示例(How in Action - 算法如何执行) ​

【具体技术细节示例】假设我们有一个简单的两层前馈神经网络,输入维度为 2,隐藏层维度为 2,输出维度为 1。网络权重和偏置如下:W1=[[1,−1],[0.5,1]],b1=[0,0],W2=[[1,1]],b2=[0]。激活函数为 ReLU。输入集合为一个 Star 集:X={x∣x=[0,0]T+[[1,0],[0,1]]α,α≥0,α1≤1,α2≤1},即一个单位正方形 [0,1]×[0,1]。

步骤 1:第一层仿射变换。计算 z1=W1x+b1。由于 x=c+Vα,则 z1=W1c+W1Vα+b1。代入数值:W1c=[0,0]T,W1V=[[1,−1],[0.5,1]]。因此 z1=[[1,−1],[0.5,1]]α。

步骤 2:ReLU 激活。对 z1 的每个分量应用 ReLU。第一个分量 z1,1=α1−α2,第二个分量 z1,2=0.5α1+α2。由于 α1,α2∈[0,1],z1,2 始终非负,ReLU 不改变它。z1,1 可能为负,需要分情况讨论。NNV3 会通过星集分裂(Star-set Splitting)处理:当 α1≥α2 时,z1,1=α1−α2;当 α1<α2 时,z1,1=0。

步骤 3:第二层仿射变换。计算 z2=W2ReLU(z1)+b2。对于第一种情况,ReLU(z1)=[α1−α2,0.5α1+α2]T,则 z2=(α1−α2)+(0.5α1+α2)=1.5α1。由于 α1∈[0,1],z2∈[0,1.5]。对于第二种情况,ReLU(z1)=[0,0.5α1+α2]T,则 z2=0.5α1+α2。在 α1<α2 且 α1,α2∈[0,1] 下,z2∈(0,1.5)。综合两种情况,输出可达集为 [0,1.5]。

最终输出:NNV3 计算出该神经网络在输入单位正方形上的输出范围为 [0,1.5],并给出对应的 Star 集表示。


实验结果(Results - 效果如何) ​

【实验结果】论文在多个新基准上评估了 NNV3 的性能。实验设置包括:恶意软件检测数据集(如 MalImg 和 Microsoft Malware)、图基电力系统模型(如 IEEE 总线系统)、医学影像数据集(如 MedMNIST)、变长时间序列数据(如 UCR 档案)和动作识别数据集(如 UCF101)。对比方法包括 NNV 1.0、NNV 2.0 以及针对特定任务的专用验证器。关键结果表明:ModelStar 在权重扰动验证中比暴力枚举方法快 10 倍以上;VolumeStar 在视频输入验证中成功处理了 16 帧以上的序列,而现有方法仅能处理单帧;GraphStar 在图神经网络验证中首次实现了对消息传递过程的集合传播,验证了 3 层图卷积网络在电力系统节点分类中的鲁棒性。保形推理模式在确定性验证超时的情况下,仍能提供 95% 覆盖率的概率保证。FairNNV 在医学影像数据集上成功验证了反事实公平性,检测出 2 个存在性别偏见的模型。

实验结果可视化 ​


优势与不足 ​

【优势与不足】 优势:

  • 统一框架覆盖多种网络架构和输入模态,包括权重扰动、视频、三维体素和图神经网络,显著扩展了形式化验证的适用范围。
  • 引入保形推理概率可达性,在确定性验证不可行时提供统计保证,增强了工具的实用性。
  • FairNNV 模块首次将公平性验证集成到统一框架中,支持反事实和个体公平性,具有重要的社会意义。
  • 提供丰富的基准测试和统一文档,降低了使用门槛,促进了可复现研究。

不足:

  • 基于 MATLAB 实现,相比 Python 生态的验证工具(如 ERAN、Marabou),在深度学习社区中的接受度可能受限。
  • 保形推理的概率保证依赖于校准数据的质量和代表性,在分布偏移下可能失效。
  • 对于超大规模图神经网络或高维视频输入,集合表示的计算和存储开销可能仍然较大。

相关工作 ​

【相关工作】

  • NNV 1.0 和 2.0:NNV3 的直接前身,提供了 Star 集可达性基础,支持 FFNNs、CNNs、NNCS、RNNs、SSNNs 和 Neural ODEs。NNV3 在此基础上扩展了新集合类型和新领域。
  • ERAN:基于抽象解释的神经网络验证工具,支持 CNN 和 RNN,主要使用 DeepPoly 和 RefinePoly 等抽象域。与 NNV3 相比,ERAN 不支持权重扰动和图神经网络验证。
  • Marabou:基于可满足性模理论(SMT)的神经网络验证器,支持 FFNNs 和 CNNs。Marabou 专注于精确验证,而 NNV3 提供集合可达性和概率验证的互补方案。
  • CROWN 和 α,β-CROWN:基于线性松弛的验证方法,在 CNN 验证中表现优异。NNV3 的 Star 集方法与 CROWN 系列在理论上相关,但 NNV3 更侧重于集合传播和多种网络架构的统一支持。
  • 保形推理在验证中的应用:近年来,保形推理被用于为黑盒模型提供统计保证。NNV3 将其集成到可达性框架中,形成了确定性验证与概率验证的互补。

未来研究方向 ​

【未来方向】

  • 与 Python 生态的深度集成:将 NNV3 的核心算法移植到 Python,或提供 Python 接口,以兼容 PyTorch 和 TensorFlow 模型,扩大用户基础。
  • 大规模图神经网络的验证:针对 GraphStar 的计算复杂度问题,研究更高效的图集合传播算法,如基于采样的近似方法或分布式计算。
  • 动态和时变系统的公平性验证:将 FairNNV 扩展到动态系统,验证强化学习策略在连续时间上的公平性,并研究公平性与鲁棒性的权衡关系。

一句话总结 ​

【一句话总结】NNV3 通过扩展 Star 集家族和引入概率与公平性验证,将神经网络形式化验证拓展到权重扰动、视频、图网络等新架构与新领域。


本解读由 DeepSeek AI 自动生成,仅供参考。

Built with curiosity and a little stardust.