面向人脸识别系统中伪装与欺骗检测的联合特征框架

发布时间:2026/8/20 13:39:21
面向人脸识别系统中伪装与欺骗检测的联合特征框架 大家读完觉得有帮助记得关注和点赞摘要——人脸识别系统越来越多地部署在门禁、移动和金融应用中但仍然容易受到两类不同的攻击欺骗spoofing即冒名顶替者出示授权用户的照片或视频以及伪装disguise即合法用户因其当前外观由于配饰、胡须、化妆变化、光照或姿态与已登记模板不同而被拒绝。大多数先前工作分别处理这两个问题使用活体检测方法应对欺骗使用遮挡鲁棒识别方法应对伪装。本文提出并实证比较了五种组合特征提取与分类流水线它们在同一个框架内同时针对这两个问题PMPCA与最小欧氏距离MED、LPM局部二值模式LBP结合PCA和MED、HPM方向梯度直方图HOG结合PCA和MED、SM加速稳健特征SURF结合MED和HMHarris角点特征结合MED。每条流水线遵循一个共同的两阶段过程包括预处理、特征提取、特征滤波和分类。这些方法在来自FEI、伪装人脸数据库DFD和NUAA数据库的115名受试者上训练并在六种测试条件下评估涵盖混合外观、正面人脸、暗光照、左转和右转姿态以及照片欺骗尝试。基于HOG的流水线HPM在所有条件下表现最为一致混合外观伪装准确率94.59%姿态和光照变体下81.5%–93.2%欺骗检测准确率91.67%而基于LBP的流水线LPM在五种流水线中欺骗检测准确率位列第二93.2%仅次于PM96.67%但对姿态变化的鲁棒性较弱。这些结果表明在经典特征表示中欺骗敏感性与伪装鲁棒性之间存在可测量的权衡并为结论部分讨论的深度学习与跨数据库扩展提供了动机。索引术语——人脸识别欺骗检测伪装检测活体检测局部二值模式方向梯度直方图加速稳健特征Harris角点检测器主成分分析欧氏距离分类器。I. 引言自动人脸识别现已嵌入手机解锁、电子商务、电子健康、边境管控和移动银行等应用中这主要是因为它在无需物理令牌且无需受试者主动配合的情况下即可远距离操作。然而这种便利性也带来了安全代价人脸模板相对容易在不接触的情况下获取这使得识别系统面临两种相关但不同的故障模式。第一种是欺骗指未授权个体出示授权用户的照片、回放视频或其他伪造肖像以获取该用户的访问权限[1]。针对2D系统最常见的欺骗攻击是通过打印照片和简单的视频回放实现的正是因为这些手段不需要专用设备并且可以利用从社交媒体或公共记录中收集的图像制作。第二种故障模式是伪装指已登记的合法用户因其当前外观无论是通过眼镜、胡须、化妆变化、发型、光照、姿态还是长期衰老与登记参考图像相比发生了变化而被拒绝。这两种故障模式都会降低人脸识别的实际可靠性但它们通常被分开研究和对抗一方面是活体检测和基于纹理的反欺骗方法另一方面是基于遮挡或姿态鲁棒的识别方法。本文并非提出一种新的描述符而是在一个统一的评估框架内同时处理这两个问题。四种成熟的特征提取技术——局部二值模式LBP、方向梯度直方图HOG、加速稳健特征SURF和Harris角点检测器——与两种成熟的滤波策略主成分分析PCA和最强关键点选择以及一个共同的最小欧氏距离MED分类器相结合。由此产生的五条流水线在相同的训练和测试条件下并排评估从而可以直接测量欺骗敏感性与伪装鲁棒性之间的准确率权衡而不是从使用不同协议的独立研究中推断。本文的贡献有三点(i) 一个统一的两阶段流水线将欺骗检测和伪装鲁棒识别视为单一分类决策而非两个独立的子系统(ii) 在六种真实世界测试条件下对五种经典特征提取与分类组合进行系统的、相同协议的比较(iii) 按攻击和变化类型分解的明确准确率标明每种组合的优势和失败之处并在第五节中用于激励后续工作方向。II. 相关工作A. 欺骗攻击与对策基于运动的对策分析潜意识活体线索如眨眼和头部或嘴部运动[4]。由于这些线索以大约0.2–0.5 Hz的生理速率发生这些方法通常需要几秒钟的视频来积累稳定的判断[4]专门的眨眼检测器利用活体受试者大约每两到四秒眨一次眼的事实这一线索难以用静态照片或简单回放令人信服地再现[2]。基于纹理的对策则单帧操作分析活体人脸与翻拍照片或屏幕回放之间的频域或微纹理差异[11]利用了翻拍图像与真实捕获图像之间保留细微但可检测的相似性和差异性这一观察[3]。局部二值模式方差LBPV就是这样一种描述符它联合编码了圆形邻域内采样点的局部纹理模式和对比度信息[12]更广泛地说基于LBP、DoG和HOG的纹理描述符已被证明仅使用单帧即可区分翻拍伪影与真实皮肤纹理[15]。图像质量分析方法进一步推广了这一思路设计对打印或回放引入的质量损失显式敏感的特征并在Idiap REPLAY-ATTACK和CASIA-FASD基准上报告了强健的数据库内性能[16],[5]这些数据集上的公开基准竞赛为进一步的跨方法比较提供了基础[8]。融合额外传感模态的方法如3D深度、红外或场景上下文线索可以实现高鲁棒性但会施加额外的硬件或协议要求并且特定的上下文线索已被证明在欺骗机制已知时可被规避[17]。表I总结了这四大类欺骗对策及其主要优势、局限性和代表性的报告性能。表I综述文献中报告的人脸反欺骗方法类别比较方法类别代表性线索优势局限性基于运动 [4],[2],[13],[14]眨眼、头部/嘴部运动跨采集设备泛化性好对回放运动鲁棒性低响应慢3秒计算成本高基于纹理 [12],[15],[11]LBP/DoG/HOG微纹理响应快1秒计算成本低对采集条件变化敏感跨数据库泛化性较弱其他线索 [17],[7],[6]3D深度、红外、上下文、声音协议内鲁棒性高需要额外传感硬件音频/3D线索响应慢图像质量分析 [16]翻拍引起的质量损失泛化性好响应快成本低通常需要根据不同攻击类型调整分类器B. 人脸识别中的伪装变化伪装鲁棒识别因低质量或非配合捕获、时间外观变化以及配饰造成的故意遮挡而变得复杂。限于眼周区域的特征空间方法“特征眼”已被用于降低对眼部以下遮挡的敏感性在Yale人脸数据库上报告了87.5%的准确率[6],[18]而结合Kinect传感器RGB和深度数据的特征融合方法报告了相对于纯2D基线对姿态和部分遮挡的改进鲁棒性[7]。在AR人脸数据库包含眼镜、表情和光照变化上的基准测试表明即使是专门的遮挡处理算法仍然对具体的配饰和光照组合敏感[1],[10]例如使用皮肤相关特征的最近邻分类器在该基准上仅达到45.8%的准确率。除了配饰遮挡外面部相似性也被证明会随着年龄增长、伪装、光照和姿态而共同退化[9]这强调了伪装鲁棒识别必须同时应对几种混杂的变化类型而非孤立地处理。这部分工作促使我们评估伪装鲁棒性时应跨显式、分离的变化类型进行而不是报告单一的合并准确率——这正是第四节采用的方法。III. 材料与方法A. 数据集使用了三个公开人脸数据库。FEI [21] 提供用于伪装评估的姿态和表情变化伪装人脸数据库DFD提供配饰、胡须和化妆变化NUAA提供照片欺骗尝试。表II总结了每个源数据库的完整构成。训练集结合了115个身份受试者50个来自FEI15个来自NUAA50个来自DFD¹由一个训练好的模型同时用于伪装识别和欺骗检测任务并通过第三节F部分的分类规则进行相同评估。相应的测试集分为六个特定条件的子集混合外观37张图像、正面人脸200张、左转人脸250张、右转人脸250张、暗光照人脸50张和欺骗尝试60张来自NUAA。¹已根据原始项目文件核实纠正了早期论文[24]中按数据库的细分原为15个来自FEI50个来自NUAA。NUAA总共只有15个受试者。报告的准确率结果不受影响。表II用于训练和测试的数据库数据库受试者数图像/人总计FEI200142,800DFD409~62,460NUAA15–10,230注DFD的6幅/人是名义平均值每人数量略有变化。NUAA按成对的真实/冒名捕获会话组织各5,115张而非固定的每人图像数。B. 系统概述所提框架遵循一个共同的两阶段过程训练和测试每个阶段由相同的四个步骤组成预处理、特征提取、特征滤波和分类。通过改变特征提取和滤波阶段从这个共同过程中实例化出五条组合流水线PMPCA MED、LPMLBP PCA MED、HPMHOG PCA MED、SMSURF MED和HMHarris MED。图1说明了整个过程。图1整体两阶段过程。训练阶段的滤波特征PCA特征空间或最强关键点为测试阶段MED分类器使用的参考模型提供依据。C. 预处理输入图像为640×480 RGB彩色图像。每张图像裁剪至固定的280×380区域裁剪原点为(180, 40)然后在特征提取前从RGB转换为灰度图。D. 特征提取LBP、HOG、SURF和Harris角点特征是广泛使用且互补的人脸识别局部描述符[20]。LBP通过将每个像素与其圆形邻域进行比较来表征局部纹理将结果编码为旋转敏感的二进制模式[15]。HOG编码局部边缘方向对均匀亮度变化相对不敏感。SURF是一种尺度和平面内旋转不变的检测器/描述符对使用Hessian矩阵近似和64维Haar小波描述符[19]。Harris–Stephens检测器通过局部自相关函数的方向变化定位角状兴趣点[22]。图2总结了每个描述符响应的内容以及滤波前产生的维度。图2LPM、HPM、SM和HM流水线分别使用的四种特征提取描述符的总结PM使用原始像素强度无描述符。E. 特征滤波对于LPM和HPM对相应的特征向量应用PCA。每张训练图像重塑为列向量xi​平均脸向量为每张图像减去均值ai​xi​−xˉ并组合成A[a1​,...,an​]。不对大的MN×MN协方差矩阵CAAT进行对角化而是计算较小的n×n矩阵LATA的特征向量通过奇异值分解然后从L的特征向量恢复C的特征向量。保留具有最大特征值的特征向量“特征脸”。对于SM和HM不应用PCA而是使用内置的最强点选择保留固定数量的最显著SURF或Harris关键点。F. 分类统一使用MED分类器有两个决策规则。对于PM、LPM、HPM测试图像的投影权重向量wtest​与每个类均值wi​之间的最小欧氏距离为如果dmin​τ则将输入分类为假否则匹配到argmini​∥wtest​−wi​∥2​。对于SM和HM将测试图像与最佳匹配候选之间的匹配关键点数m与τ比较若mτ则匹配否则分类为假见表III。表III组合流水线与决策阈值流水线特征决策依据τPM–最小欧氏距离6.50×1017LPMLBP最小欧氏距离7.60×1017HPMHOG最小欧氏距离3.30×105SMSURF匹配关键点数20HMHarris匹配关键点数4IV. 结果表IV报告了每条流水线在六种测试条件下的识别准确率。HPM在六种条件中的四种上取得了最高准确率——混合外观伪装94.59%、左转91.6%、右转93.2%和暗光照86.0%——并在欺骗检测上达到具有竞争力的91.67%。PM在欺骗检测上取得单项最高准确率96.67%但暗光照准确率最低38.0%。LPM取得第二高的欺骗检测准确率93.2%但在左/右转人脸下降至56.4%/57.2%。SM和HM在欺骗检测86.67%/70.0%和正面人脸78.5%/94.5%上具有竞争力但在姿态变化和暗光照下急剧下降。图3可视化了这些结果使第五节讨论的欺骗与伪装权衡直接可见蓝色和橙色柱PM、LPM在最右侧组欺骗达到峰值但在暗光照组跌至最低而绿色柱HPM在除欺骗外的所有组中保持较高水平。表IV按测试条件划分的识别准确率%流水线混合 (n37)正面 (n200)左转 (n250)右转 (n250)暗光照 (n50)欺骗 (n60)PM (PCAMED)70.2776.5084.4077.6038.0096.67LPM (LBPPCAMED)75.6866.5056.4057.2072.0093.20HPM (HOGPCAMED)94.5981.5091.6093.2086.0091.67SM (SURFMED)81.0878.5036.4037.2026.0086.67HM (HarrisMED)81.0894.5064.8064.8068.0070.00图3五条流水线在六种测试条件下的识别准确率%数据来自表IV。HPM绿色在除欺骗外的大部分条件下表现持续高水准而PM蓝色和LPM橙色在欺骗上领先。V. 讨论从表IV中可以观察到两种模式。首先HPM是最持续强劲的流水线可能是因为HOG的梯度方向编码对光照变化相对不敏感。其次没有哪条在欺骗上强劲的流水线同时在姿态变化上也强劲PM和LPM的全局PCA表示适合检测平面照片回放而HPM的梯度编码适合伪装带来的细微变化基于关键点的流水线SM、HM在姿态和光照上表现不佳因为局部关键点对平面外旋转和低对比度敏感。这些数据是在相同协议下的相对比较不能直接与Idiap REPLAY-ATTACK或CASIA-FASD上的总体HTER/EER指标相比较后者使用不同的数据库和协议。A. 局限性与有效性威胁存在若干局限性。第一决策阈值是从训练集固定的未在保留集上校准。第二训练和测试使用了相同的合并数据库因此结果是协议内而非跨数据库的。第三评估的攻击仅限于2D照片欺骗视频回放和3D面具攻击不在范围内。第四所有流水线均使用手工设计的描述符未与基于CNN或Transformer的基线进行比较尽管基于神经网络的方法自2010年代初就已开始探索[23]。第五训练群体115名受试者按当代标准来说较小。VI. 结论本文评估了五条组合特征提取与分类流水线——PM、LPM、HPM、SM和HM——用于2D人脸识别中伪装鲁棒识别与照片欺骗检测的联合问题。在跨越三个公开数据库和六种显式测试条件的相同协议下HPM在姿态、光照和伪装变化下提供了最一致的性能81.5%–94.59%同时在欺骗检测上保持竞争力91.67%而PM和LPM取得了更高的峰值欺骗准确率96.67%和93.2%但代价是对姿态和光照变化的鲁棒性降低。VII. 未来工作从第五节A部分的局限性出发有四个方向(i) 跨数据库评估(ii) 扩展到视频回放和3D面具欺骗并结合时间活体线索(iii) 在同一协议下与基于CNN或Transformer的基线进行直接比较(iv) 对长期外观变化衰老进行显式建模。