基于数字孪生的车辆动力总成CAN总线系统入侵检测

发布时间:2026/9/1 15:38:28
基于数字孪生的车辆动力总成CAN总线系统入侵检测 大家读完觉得有帮助记得关注和点赞摘要目标现有的针对控制器局域网CAN的汽车入侵检测系统IDS主要关注消息时序、频率或顺序的差异无法检测那些在操纵数据载荷的同时保持这些属性的攻击。数字孪生DT已被用于模拟CAN流量并生成攻击场景以评估IDS但使用DT进行入侵检测仍未被探索。本研究的目的是开发一个基于DT的IDS该IDS通过预测和观测到的动力总成信号行为之间的残差来识别CAN攻击。方法一个共享编码器LSTM DT在来自真实现代/起亚CAN日志的17个解码信号上进行了训练这些信号涵盖了发动机和变速箱消息以在24步窗口内联合预测七个数值信号和两个分类挡位信号。当残差超过校准阈值时标记一个时间步并且一种自适应展开机制保护孪生的输入历史免受持续污染。针对孪生和一个从先前工作改编的范围和合理性基线评估了四种消息级攻击平台攻击、连续漂移攻击、伪装攻击和挡位伪装攻击。结果所提出的DT在所有攻击类型上的表现均优于基线对连续漂移攻击的检测率达到94.6%对伪装攻击的检测率达到89.2%而基线几乎未检测到任何伪造的数据载荷攻击。这些结果表明学习耦合的车辆动力学能够检测那些保持正常CAN通信模式的隐蔽数据载荷操纵。误报率达到39.6%突显了在持续攻击下提高鲁棒性的必要性。新颖性本研究引入了一个基于DT的CAN入侵检测框架该框架学习解码后的车辆信号之间的物理关系并通过预测和观测到的车辆行为之间的偏差来检测隐蔽的数据载荷攻击而不是依赖时序或协议特性。实际应用所提出的基于DT的IDS代表了一种有前景的方法用于检测保持正常通信模式的隐蔽载荷级CAN攻击为互联和自动化车辆提供基于行为的网络安全支持。引言汽车越来越依赖于控制器局域网CAN来连接控制制动、转向、动力总成和其他安全关键功能的电子控制单元ECU。CAN在1980年代作为一种轻量级、实时总线被引入用于连接少数几个组件现在在一辆典型的乘用车中连接着数十个ECU但其核心设计几乎没有改变。尽管随后对CAN生态系统进行了扩展但传统的CAN协议仍然是一个广播通信系统本身不支持消息认证、加密或发送方验证。根据传统CAN协议任何获得总线访问权的节点——无论是物理上通过诊断端口还是远程通过受损的信息娱乐或远程信息处理单元——都可以注入或更改消息而其他所有ECU都会将其视为可信的。Hoppe和Dittman2007在模拟环境中首次演示了有记录的CAN攻击通过重放捕获的消息来操作电动车窗升降器。Koscher等人2010后来通过车辆的OBD-II端口获得物理访问并在伪造仪表盘显示的同时使行驶中的车辆的发动机和制动器失效。后来Valasek和Miller2015在Jeep Cherokee车辆上演示了一次完全远程攻击完全不需要物理访问该攻击使制动和转向失效并最终引发了140万辆车的召回。这些攻击展示了CAN入侵攻击所带来的威胁。一旦攻击者获得车辆内部网络的访问权限入侵检测系统IDS被广泛认为是最实际的防御措施。现有的汽车IDS通常分为基于签名和基于异常的方法Jin et al. 2021; Olufowobi et al. 2020; Halder et al. 2020; Wu et al. 2020。基于签名的方法定义描述合法通信和已知攻击模式的规则每当观测到的网络流量违反这些预期时便发出警报。在CAN总线上此类规则通常来源于消息频率、标识符序列、帧间时序、数据载荷值或其组合。然而CAN流量的异构性和高维性——众多携带不同信号的标识符以不同的速率传输——使得制定能够泛化到各种运行条件的规则变得困难Hanselmann et al. 2020。由于这些系统最终依赖预定义的签名或行为约束它们必须随着新攻击策略的出现而更新。因此它们常常难以检测先前未见或精心设计的攻击Wu et al. 2020。此外老练的攻击者可以通过总线关闭攻击压制合法发送器并同时以受害ECU的身份传输伪造消息从而保持正常的通信模式Cho and Shin 2016a; Bloom 2021。其他攻击利用CAN数据链路层的弱点在保持协议合规的同时操纵数据载荷de Faveri Tron et al. 2022。还有一些利用物理层实现差异带来的漏洞例如ECU采样点配置Mohammed et al. 2022; Yue et al. 2021。这些发展表明仅监控消息时序或顺序通常不足以检测入侵需要进一步的推理。例如检测高级伪装和数据载荷注入攻击最终需要对消息内容本身进行推理。因此最近的基于异常的IDS已将其重点从通信模式转向CAN消息的数据载荷。一类方法使用自编码器重构正常行为并通过重构误差来识别攻击无论是重构原始CAN流量Longari et al. 2021、在多个时间尺度上的解码车辆信号Shahriar, Xiao, et al. 2023还是手动定义的相关信号组Novikova et al. 2020。尽管有效但这些方法从训练数据中学习统计规律而不是显式建模车辆ECU信号之间的物理关系。第二类基于异常的IDS将入侵检测表述为一个预测问题预测下一个观测值并将其与实际消息进行比较无论是基于原始标识符-数据载荷序列Cobilean et al. 2023还是联合标识符-数据载荷表示Q. Liu et al. 2026。由于这些方法直接对CAN通信而非解码后的物理量进行操作它们无法显式利用负责ECU信号数据载荷的底层车辆动力学。Moriano、Bridges和IannaconeMoriano et al. 2022通过检测解码信号间相关结构的破坏来检测伪装攻击从而更接近于考虑车辆动态行为尽管这些关系是通过相关性相似性而非预测模型学习的。另一项基于经典过程监控的工作包括PASADAoudi et al. 2018、其对CAN的改编CASADNowdehi et al. 2019以及Duan等人2023的孤立森林方法通过识别单个信号或数据载荷字节流与学习到的正常行为的偏差而不建模多个信号之间的交互。尽管方法各异但这些方法共享一个共同的局限性即它们都没有学习一个能够描述多个车辆ECU信号耦合物理动力学的预测模型这激发了本研究中基于数字孪生方法的发展。数字孪生DT最初由Grieves在2003年设想为物理系统在整个生命周期中的虚拟表示现已成为网络物理系统中监控、仿真和预测的强大框架。通过将持续观测到的物理资产数据与相应的虚拟模型相结合DT可以估计系统的当前状态并预测其未来行为从而实现故障诊断、预测性维护并越来越多地应用于网络安全领域Grieves and Vickers 2017; M. Liu et al. 2021。面向安全的DT不依赖预定义规则或签名而是通过将观测到的系统行为与虚拟模型预测的行为进行比较来检测异常偏差指示潜在的故障或攻击Eckhart et al. 2019; Dietz et al. 2020。这种预测范式对于CAN入侵检测尤其有吸引力因为底层的车辆动力学在信号之间施加了强物理关系攻击者必须保持这些关系才能不被发现。DT最近已被扩展到汽车CAN网络以模拟ECU交互并生成用于IDS评估的现实攻击场景证明ECU行为和随后的CAN流量可以在虚拟或数字对应物中重现Sharmin et al. 2025。然而这项工作使用DT来评估IDS而不是执行入侵检测本身。学习到的DT是否能通过预测解码后的车辆ECU信号的物理一致性演变来直接识别隐蔽的CAN攻击在很大程度上仍未被探索。因此在本研究中我们提出了一个基于DT的IDS该IDS学习解码后的动力总成信号中存在的不同传感器值的联合物理动力学并通过预测和观测到的车辆行为之间的失配来识别攻击。本研究中开发的DT不是孤立地建模消息时序、协议统计或单个信号而是捕获相关车辆信号之间的物理耦合并使用预测残差来检测那些保持正常CAN流量特性的隐蔽数据载荷操纵。本文开发了一个基于数字孪生的入侵检测框架该框架在单个预测架构内建模解码后的车辆动力总成信号的联合物理动力学通过预测和观测到的车辆行为之间的偏差来检测隐蔽的数据载荷操纵。使用真实驾驶数据针对一系列隐蔽的CAN攻击场景包括已确立的和特定领域的攻击对所开发的框架进行了评估并针对具有代表性的异常检测基线进行了基准测试。这些结果共同证明了基于物理的数字孪生作为检测复杂载荷级CAN攻击这些攻击保持正常通信特性的实用且有效框架的潜力。文献综述从Hoppe和Dittman2007在电动车窗升降器上的初步演示开始随后的研究已证实CAN总线在广泛车辆系统中的脆弱性Koscher et al. 2010包括无需物理访问即可远程利用量产车辆Woo et al. 2015; Valasek and Miller 2015。Hoppe等人2011进一步将CAN攻击分类为拒绝服务、伪造和未经授权的执行等类别。这些演示从模拟测试平台到量产车辆在防御措施开发之前就将CAN安全确立为一个实际问题而非理论问题。早期的检测方法利用CAN总线的协议级模式而非单个消息的数据载荷。物理层指纹识别通过微小的硬件变化而非消息内容来认证消息的源ECU基于时钟偏差的指纹识别估计每个ECU固有的时钟特性以检测发送方冒充报告的假阳性率低于千分之一Cho and Shin 2016b而基于电压的方法类似地测量每个收发器在总线上产生的差分信号Cho and Shin 2017; Kneib and Huth 2018。统计方法则直接建模CAN流级别的规律性。基于熵的检测监控总线流量的信息熵以识别与学习基线的偏差Müter and Asaj 2011。最近的一项工作通过更全面的时间序列和统计特征集扩展了这一想法并应用无监督异常检测来改进对复杂攻击的检测Shahriar, Lou, et al. 2023。ID序列相似性方法则通过基本模式匹配Marchetti and Stabili 2017或动态时间规整用于量化观测序列与典型流量的偏差程度Sun et al. 2022来比较观测到的消息标识符顺序与正常排序模型。基于频率的检测是该问题最早应用的方法之一它标记那些传输频率偏离预期周期的CAN标识符Taylor et al. 2015。Wu等人2020对这一研究领域进行了全面调查涵盖了基于规则、统计和早期机器学习的防御措施。总的来说这些方法快速、轻量且可解释使其非常适合资源受限的车载部署但它们针对的是消息时序、频率或顺序的干扰并且设计上无法检测那些在仅改变消息数据载荷的同时保持所有这三个属性不变的攻击。机器学习和深度学习方法将检测扩展到消息数据载荷但代价是更高的计算开销并且在大多数情况下需要车辆整个运行范围内的代表性训练数据。基于长短期记忆LSTM网络的序列模型已应用于原始CAN流量Hossain et al. 2020; Taylor et al. 2016和直接的字节级数据载荷Kang and Kang 2016而一种相关的基于规范的方法则将单个标识符的时序行为建模为异常检测问题而非纯粹的统计问题Olufowobi et al. 2020。从图像分类改编的卷积架构已被应用于重塑为类图像矩阵的CAN帧Song et al. 2020并且生成对抗网络已在正常CAN流量上训练并用于检测未知攻击类型Seo et al. 2018。最近基于Transformer的注意力网络已被应用于相同的序列分类问题利用自注意力机制建模CAN消息序列内的长程依赖关系Nguyen et al. 2023。基于图的架构将CAN标识符表示为通过传输关系连接的节点。一种方法使用图特征上的阈值分类器Park et al. 2023来检测异常而另一种方法使用图注意力网络学习哪些关系对特定攻击最重要Xiao et al. 2024。结合其中几种架构的混合和集成变体Al-Aql 2024; Javed et al. 2021或直接优化其超参数的变体Ileri et al. 2025也已被提出。然而几乎所有这些文献都是针对诸如Car-Hacking和OTIDS等伪造类基准进行评估的在这些基准中注入的消息会干扰每个ID的时序统计代表性的模型可以学习识别这些干扰。另一类技术采用明确的预测性或重建性框架完全不依赖时序干扰。CANnoloLongari et al. 2021在正常流量上训练单个LSTM自编码器重构CAN流量序列并从重构误差中检测异常。CANShieldShahriar, Xiao, et al. 2023则训练一个卷积自编码器集成每个自编码器将滑动信号值队列重塑为不同时间尺度的类图像矩阵并将它们的重构损失组合成单个集成分数。它与我们孪生的基于残差的检测理念相同并且专注于解码后的信号值而非原始数据载荷字节。但这种方法学习信号之间的统计关系而我们的方法学习信号之间的预测性物理关系。Moriano、Bridges和IannaconeMoriano et al. 2022更直接地针对伪装攻击假设此类攻击会破坏信号间的相关结构。它通过比较测试窗口中信号相关性的聚类相似性与干净基线来检测攻击。这一前提与我们的孪生本身对跨信号物理关系的使用非常吻合尽管在Moriano et al. 2022中它是作为相关性相似性检查而非学习到的预测模型实现的。Novikova等人Novikova et al. 2020通过手动将高度相关的信号分组并为每个子组训练单独的自编码器来研究一个相关的想法。我们的方法与之不同之处在于我们将相关且物理上关联的信号分组到单个编码器中以表示系统状态。Cobilean等人Cobilean et al. 2023使用Transformer预测下一个CAN标识符和数据载荷序列并将预测与实际观测值进行比较。这与本文使用的预测-比较逻辑类似不同之处在于它应用于原始CAN序列而非解码后的物理信号。最近MIDSQ. Liu et al. 2026直接针对伪装场景使用双向状态空间模型重构联合标识符-数据载荷语义并在多个公共基准上报告了强大的泛化能力。Duan等人Duan et al. 2023直接解决了数据篡改检测的相关问题使用了一种改进的孤立森林方法该方法对数据字段中的局部异常敏感而非对整个消息流敏感。在深度学习文献之外PASADAoudi et al. 2018引入了一种基于偏离的工业控制系统异常检测框架使用奇异谱分析。CASADNowdehi et al. 2019随后将这种方法论改编到CAN数据载荷字节流检测与学习到的正常行为的偏离而无需了解编码的车辆信号。与这些系统不同我们的基于孪生的方法在单个预测模型内学习解码后的车辆信号之间的物理耦合。它将Moriano等人示例的跨信号推理与自编码器和基于Transformer的方法所采用的学习自回归预测相结合同时将PASAD和CASAD基于偏离的理念从单个过程或数据载荷字节流扩展到共享的物理意义车辆信号模型。总的来说这些研究证明了基于重构、预测和偏离的异常检测的有效性但没有一个明确建模控制多个解码车辆信号的联合物理动力学。我们的基于DT的方法通过学习这些关系并检测与物理一致性车辆行为的偏离来填补这一空白。方法我们在此研究中提出的入侵检测框架围绕一个DT构建该DT包含一个共享编码器LSTM在无攻击驾驶数据上训练以学习车辆动力总成和变速箱控制子系统的联合动态。在每个时间步孪生从固定长度的历史窗口估计每个监测信号的预期值检测过程基于此预测值与观测到的CAN值在每个时间步的比较。每当残差超过校准阈值或对于分类信号当发生错误分类时便会标记一次违规。第二个机制使用相同的每时间步违规来保护孪生自身的未来预测免受持续攻击的影响而退化。检测系统独立跟踪每个监测信号以确定其近期违规率是否超过特定阈值。如果超过孪生自身的预测将替换该信号的观测值。这种机制称为自适应展开adaptive rollout它防止持续攻击被输入到模型的上下文中并逐渐将其自身的未来预测引向攻击者操纵的值。一个更保守的条件决定恢复正常操作并且一个定期的锚定步骤强制在固定间隔信任观测到的CAN值无论当前状态如何从而限制这种替代随时间偏移的程度。图1总结了这一工作流程。该框架针对应用于驾驶数据的四种攻击场景进行了评估这些场景被选为代表不同的现实欺骗策略并与一个基于范围和合理性的异常检测器Müter et al. 2010进行了比较。数据集、信号解码与信号选择本研究中考虑的数据集是一个真实的现代/起亚CAN日志Seo et al. 2018使用Python cantools库根据两个DBC文件即用于发动机管理消息的 hyundai_kia_generic.dbc 和用于变速箱控制消息的 hyundai_santafe_2007.dbc进行解码。从整个CAN日志中选择了四条消息即用于发动机管理的 EMS11 (0x316)、EMS12 (0x329) 和 EMS14 (0x545)以及用于变速箱控制的 TCU_Data (0x43F)。所有四条消息都是独立广播的并以不同的速率传输因此在联合使用之前需要一个共享的时间基准。每条消息都被解码按时间戳排序并使用 merge_asof 操作对齐到一个共享的50毫秒网格使得每个网格点取每个信号最近观测到的值避免任何超前观察。还应用了前向/后向填充来处理序列开始和结束时的边界情况。50毫秒的间隔是根据初步探索性分析期间在整个CAN流量集中观察到的代表性更新间隔选择的。在模型开发之前对这四条消息中存在的十个数值物理相关信号N、TQI、TQI_ACOR、TQFR、VS、TPS、TEMP_ENG、VB、BAT_Alt_FR_Duty、InputShaftSpeed进行了相关性分析。进行了Pearson相关性分析以评估这些信号之间的关系然后进行了滞后互相关分析以表征是否存在有意义的滞后关系。该分析确立了证明联合建模这些信号是合理的物理耦合。N与InputShaftSpeed强相关Pearson r 0.83与TPSPearson r 0.68、TQIPearson r 0.61和VSPearson r 0.53相关性中等。TQI与TPS强相关Pearson r 0.88是信号集中最强的关系而VS与InputShaftSpeed强相关Pearson r 0.77。N、TQI、TPS、VS和InputShaftSpeed共同构成了一个紧密耦合的物理子系统代表车辆的发动机和变速箱系统。一些信号显示出弱相关性。例如VB和BAT_Alt_FR_Duty都与其他信号表现出弱相关性。在训练期间BAT_Alt_FR_Duty表现出类似继电器行为编码器无法可靠地学习。因此其残差被排除在异常检测机制之外尽管它仍作为回归目标保留用于训练。相比之下VB的弱相关性是由于信号方差低。这些信号被保留因为它们代表了关于子系统状态的独特、适量的信息。TQI_ACOR被发现与TQI几乎冗余Pearson r 0.999并被删除。TQFR不仅与NPearson r ≈ -0.82表现出强烈的、物理上有意义的相关性而且与模型中已有的其他几个核心动力传动系统信号包括InputShaftSpeed (Pearson r ≈ -0.78) 和 VS (Pearson r ≈ -0.67)也如此。这表明其行为在很大程度上与共享编码器已捕获的信息冗余而非反映独立的物理关系。TEMP_ENG没有表现出与任何其他信号同步的快速变化因此仅作为调节输入保留从不作为预测目标。在TCU_Data中还存在三个分类信号CurrentGear、GearSwitch和SelectorPosition。其中SelectorPosition被删除因为它实质上是CurrentGear的冗余代理而CurrentGear和GearSwitch都被保留作为分类目标。CurrentGear和GearSwitch分别进行独热编码以生成7个和2个唯一值。这使得总输入数达到17个包括8个数值输入、2个编码的GearSwitch输入和7个编码的CurrentGear输入。表1总结了最终的信号集。表1 最终CAN信号集信号数据类型角色源消息N数值输入 回归目标EMS11 (0x316)TQI数值输入 回归目标EMS11 (0x316)TQI_ACOR数值因冗余从孪生中排除EMS11 (0x316)TQFR数值因冗余从孪生中排除EMS11 (0x316)VS数值输入 回归目标EMS11 (0x316)TPS数值输入 回归目标EMS12 (0x329)TEMP_ENG数值仅输入调节信号非回归目标EMS12 (0x329)VB数值输入 回归目标EMS14 (0x545)BAT_Alt_FR_Duty数值输入 回归目标残差从检测门控中排除EMS14 (0x545)InputShaftSpeed数值输入 回归目标TCU_Data (0x43F)CurrentGear分类7类独热输入 分类目标TCU_Data (0x43F)GearSwitch分类2类独热输入 分类目标TCU_Data (0x43F)SelectorPosition分类2类已排除CurrentGear的冗余代理TCU_Data (0x43F)数据划分原始日志跨越了一个扩展的车辆操作会话包括车辆挂挡前的一段驾驶前怠速期以及驾驶结束后的一次倒车操作。因此可用的驾驶会话被定义为从第一次持续挂入1挡标记主动驾驶开始到该点之后第一次持续挂入倒挡标记驾驶结束的时间跨度产生了7,777行可用数据。该会话随后被分成10个相邻的块并按60/15/25的比例划分为训练集、校准集和攻击基底集每个划分从所有块中按比例抽取而非来自单个连续区间以避免偏向于会话早期或晚期发生的特定驾驶条件。最终的划分大小为训练集4,660行校准集1,160行攻击基底集1,957行。归一化统计量每个数值信号的均值和标准差仅在训练划分上计算并应用于校准和攻击基底数据防止保留的统计量泄漏到模型拟合中。DT架构此处的孪生是一个共享的LSTM隐藏层大小128在17个特征的24步1.2秒输入窗口上运行具有三个输出头针对七个目标不包括TEMP_ENG的数值回归、CurrentGear分类和GearSwitch分类。在候选信号集上进行的探索性滞后互相关分析发现在50毫秒采样率下没有可靠的跨信号延迟超过几个时间步。因此24步窗口被采纳为一个宽裕的余量舒适地超过任何测量到的短时间尺度耦合同时仍涵盖典型的换挡或油门变化的持续时间。该模型仅使用前一部分定义的归一化统计量在训练划分上进行训练。训练使用了学习率为1e-3、批量大小为64的Adam优化器运行50个epoch。数值回归头使用Huber损失进行训练选择它是为了相比平方误差对偶尔出现的离群读数敏感性更低而CurrentGear头使用标准交叉熵损失GearSwitch头使用类别加权交叉熵损失以应对换挡事件固有的稀有性。所有三个损失以相等权重求和为单个训练目标如公式1所示。用于评估的检查点是在校准划分上总损失最低的epoch的权重而非最终epoch的权重以防止评估过拟合的后期模型。L L_Huber(回归) L_交叉熵(CurrentGear) L_交叉熵,加权(GearSwitch) (1)评估为了评估我们的DT我们基于先前文献设计了三种攻击模型。我们为DT添加了检测逻辑并修改了它以适应不同的攻击类型。我们还包括了一个使用CAN硬件的实时测试以测试其在现实生活中的可行性。以下各节将详细讨论。攻击模型攻击场景的设计旨在与SynCAN数据集Hanselmann et al. 2020引入的合成攻击分类法保持一致该分类法定义了CAN入侵检测评估的几种规范信号级攻击类型。所有攻击都是消息级替换。假设攻击者已压制了合法的发送ECU——这一能力在先前关于CAN总线关闭攻击的研究中已被单独证明Bloom 2021——并取而代之传输伪造值。在攻击基底划分1,957行占可用会话的25%从训练和校准中保留上构建了三种攻击类型平台攻击plateau其中信号在持续时间内被冻结在固定值连续攻击continuous其中信号的值以恒定的每步速率从其真实值逐渐位移以及回放攻击playback其中信号的真实值被替换为来自同一块较早段落的真实值导致一种伪装式的重放攻击。这三种攻击针对N、TQI和VS这三个信号承载在单条发动机消息EMS11 (0x316)中。连续攻击的每步漂移率设置为每个信号的平均绝对步进变化该值在训练划分而非攻击数据本身上计算反映了攻击者可以从历史日志中合理估计的速率。攻击持续时间设置为每个块长度的40%大约78步或在50毫秒网格上约3.9秒从每个块的中点开始选择这个时长是为了刚好低于SynCAN记录的2-4秒Hanselmann et al. 2020攻击间隔范围的上限4秒使攻击持续时间与先前基准相当同时随块长度自然缩放。此外还构建了第四种攻击针对挡位切换信号以探测孪生的离散/分类方面。这种攻击特定于此处评估的挡位信号并且不属于SynCAN最初仅针对连续信号的分类法。它应用了上述相同的回放/伪装构建方法但应用于InputShaftSpeed、CurrentGear和GearSwitch这三个信号都承载在变速箱消息TCU_Data (0x43F)中。该攻击将同一块中较早的真实段落同时替换到所有三个信号中来自相同的源窗口在保持挡位簇信号之间物理一致性的同时使其与车辆的实际状态不一致。所有四种攻击都在全部十个攻击基底块上进行了评估。表2总结了所有四种攻击场景。表2 攻击场景攻击目标信号源消息构建方式平台攻击N, TQI, VSEMS11 (0x316)在块长度的40%时间内冻结在固定值连续攻击漂移N, TQI, VSEMS11 (0x316)在块长度的40%时间内从最后一个正确值以恒定的每时间步速率来自训练划分的平均绝对步进变化位移回放攻击伪装N, TQI, VSEMS11 (0x316)在块长度的40%时间内替换为来自同一块较早段落的真实值挡位簇伪装攻击InputShaftSpeed, CurrentGear, GearSwitchTCU_Data (0x43F)在块长度的40%时间内替换为来自同一块较早段落的真实值范围和合理性基线作为一个轻量级的、非学习型基线我们实现了Müter、Groll和FreilingMüter et al. 2010提出的八个异常检测传感器中的两个即范围传感器Range Sensor和合理性传感器Plausibility Sensor。范围传感器在信号值超出车辆自身DBC信号定义中指定的范围时例如N: 0-16383.75 rpm, VS: 0-254 km/h标记该信号遵循该研究对传感器的分类基于规范。合理性传感器在信号的每步变化超过该信号在训练划分上观测到的最大步进变化时标记该信号。这将该研究的合理性检查适应于没有记录物理速率限制的环境。两个传感器都按信号运行与孪生自身的监控范围相匹配。原始论文Müter et al. 2010中描述的其余六个传感器未予实现。形式Formality和频率Frequency传感器因构造原因不适用因为我们的攻击模型保留了有效的帧结构和消息时序。位置Location、相关性Correlation、协议Protocol和一致性Consistency传感器需要多个总线系统或真正冗余的传感器源而我们的数据集中不存在这些。两个传感器独立评估每个新观测的样本使比较直接与孪生自身的检测指标对齐。攻击检测与自适应展开机制IDS在每个时间步的基础上分析信号。在每个时间步信号的残差预测值减观测值与特定于信号的阈值进行比较。残差根据公式2确定ŷ_t是预测输出y_t是实际观测值。残差阈值在校准划分上校准独立于训练和攻击构建。对于六个有资格进行检测的数值信号除BAT_Alt_FR_Duty外的所有数值回归目标如果绝对残差K超过该信号在校准数据上观测到的绝对残差标准差的3倍则标记该时间步。然而CurrentGear和GearSwitch使用固定的错误分类阈值。对于这两个分类信号每当预测类别与观测类别不同时便标记一个时间步。r_t |ŷ_t - y_t| (2)另一个独立机制自适应展开adaptive rollout保护孪生自身的自回归输入窗口。由于孪生的每个预测都依赖于其自身的近期输入历史持续的攻击存在污染该历史并降低孪生后续预测的风险。自适应展开是一个每信号的被动/闭环状态机。如果在滑动窗口20个时间步内点违规率超过拒绝率阈值60%则受影响的信号进入闭环模式在该模式下孪生将该信号替换为其自身先前的预测而非观测值。一旦在滑动重新获取窗口40个时间步上的违规率降至或低于重新获取率上限10%信号将返回被动模式。对于任何当前处于闭环模式的信号此覆盖会被定期暂停一个共享的、基于时间的锚定窗口每200个时间步中重新接纳原始传感器数据10个时间步与哪个信号处于闭环模式或当时是否存在攻击无关。这防止了闭环信号无限期地偏离实际车辆状态代价是偶尔会重新引入损坏的数据。自适应展开参数在表3中给出它们由初步实验确定并在所有场景中保持不变。实时硬件测试平台为了在更现实的环境中评估该框架的可行性将基于孪生的IDS部署在了一个小型硬件在环测试平台上。Arduino节点被配置为以其原始记录时序广播来自攻击基底划分的EMS11、EMS12、EMS14和TCU_Data消息重现与离线测试相同的流内容、消息时序和频率。Arduinos使用MCP2515接口连接并配置为通过CAN总线使用mcp_can库发送CAN消息。分配一个Arduino节点用于发送3条EMS消息代表发动机控制ECU分配一个节点用于发送TCU_Data消息代表变速箱控制ECU。第三个Arduino节点被配置为代表发送伪造消息的攻击者节点。合法的发动机和变速箱节点被配置为在攻击持续期间停止广播以反映攻击者已控制它们。一台运行基于孪生的IDS的台式计算机通过USB-CAN FD接口连接到CAN总线。通过实时运行IDS来执行检测。传入消息被解码并对齐到50毫秒网格并在到达时传入24步输入窗口。离线版本使用的相同检测过程也在此处使用。我们使用四种攻击场景中各一个代表性块在此实时设置中评估了我们的IDS。表3 自适应展开参数参数值拒绝窗口20拒绝率60%重新获取窗口40重新获取率10%锚定间隔200锚定持续时间10评估指标为了评估我们的IDS的性能我们选择了几个指标来确定其在离线与实时配置中的有效性。检测率和假阳性率是选择用于评估IDS在十个块上的离线性能的主要指标。它们的定义如公式3和公式4所示检测率 真阳性 / (真阳性 假阴性) (3)假阳性率 假阳性 / (假阳性 真阴性) (4)由于这些指标在块与块之间存在显著差异结果以10个攻击基底块上的平均值±标准差而非仅平均值报告。此外对于硬件在环测试还选择了其他几个指标来评估此IDS在实时攻击条件下的可行性。为此目的选择了三个指标即检测延迟和每消息处理时间。检测延迟是伪造消息通过网络被接收到和IDS将其标记为伪造之间的时间。它衡量攻击发生和警报响起之间的时间。结果与讨论表4展示了我们的基于孪生的方法和所比较的基线在所有10个块上、跨4种攻击场景的总体性能。本研究中提出的基于DT的异常检测器在所有评估的攻击类型上都以较大优势优于基线。基线性能不佳可归因于所有四种攻击都是精心设计的以确保伪造值在CAN流中观察到的典型范围内。因此所有攻击场景数据很可能都在典型范围内并且两步之间的变化也可能在正常范围内。对于我们的基于孪生的检测器我们可以观察到它在漂移攻击上表现最佳其次是伪装和平台攻击其中挡位伪装攻击性能最差。标准差表明我们的基于孪生的检测器可以可靠地检测漂移攻击但伪装攻击的一致性下降。在平台攻击和挡位伪装攻击的情况下高标准差表明检测器在不同块上的性能不均匀有些块表现不佳。在漂移攻击的情况下信号可能以不再保持其内部关系的方式发散。因此孪生可以可靠且准确地检测到它。图2展示了连续漂移和平台攻击的图而图3展示了伪装和挡位伪装攻击的图每个图都显示了代表性攻击基底块的真实、攻击和孪生预测轨迹。图4展示了基于孪生的检测器的聚合混淆矩阵总结了所有四种攻击类型在块上的平均真阳性、假阳性、假阴性和真阴性计数。在图3中关于伪装攻击孪生的性能下降不多但可靠性显著下降。这可能是由于伪装攻击的行为更像真实信号并且在某些情况下接近无攻击值。我们可以在图3的图中看到这一点其中伪装信号与无攻击信号相交并且该区域的检测下降。图4还表明基于孪生的检测在漂移和伪装攻击方面具有相似的聚合性能。在平台攻击的情况下检测率的下降可能是由于CAN信号流包含信号值相对恒定的时期。这些无攻击的近恒定段可以在图2和图3的图中观察到。孪生在攻击开始时不可避免地会摄入一些损坏的数据。即使触发了自适应展开初始的损坏数据也可能将孪生的状态拉入一个信号相对恒定的状态。孪生可能错误地假设这是一个合法的近恒定段而不是平台攻击。这也可以在图4中观察到孪生在检测平台攻击的阴性方面几乎与伪装和漂移攻击一样好但在阳性方面表现不佳。图2还显示了一些平台攻击接近无攻击信号或与其相交的情况。挡位伪装攻击表现最差具有最低的平均检测率和接近该率的标准差。孪生在挡位攻击上的差劲表现可归因于车辆通常在长时间内保持同一挡位。这导致了一个效果即伪装攻击的拼接段有时与其替换的正常数据相同。图2展示了挡位2的这种效果。一个突出的观察结果是整体的假阳性率相对较高范围从17.5%到39.6%。必须强调的是孪生并非真实车辆子系统的完美对应物如果残差过高它可能会错误地标记正常的CAN数据载荷这需要进一步调查。此外孪生倾向于即使在通过攻击区域后仍保持在闭环模式。这可以在图2和图3中观察到。自适应展开的设计使得重新获得对信号的信任比失去它更难。这导致了孪生具有高总体FPR的不幸情况。表5展示了我们的IDS在我们的CAN测试平台上的实时性能。可以观察到平均检测延迟低于一毫秒。标准差表明检测延迟在消息之间变化很大。所有攻击的最大检测延迟为4.5毫秒低于这些消息EMS11、EMS12、EMS14和TCU_Data观察到的最短时间间隔5.046毫秒。这证实了IDS的计算速度足够快可以捕获任何伪造的帧。平均模型推理时间也低于1毫秒。观察到的最大模型推理时间上升到4.40毫秒。该值仍低于我们之前建立的50毫秒时间网格。这表明模型不太可能被伪造消息淹没。模型推理时间表明IDS可以安全地以比所使用的数据速率高得多的速率运行并且更接近这些消息时间间隔的下限。表4 按攻击类型划分的检测性能攻击类型平均孪生检测率 %平均孪生 FPR %基线检测率 %基线 FPR %平台攻击61.8 ± 36.333.0 ± 27.10.0 ± 0.00.1 ± 0.3连续攻击漂移94.6 ± 4.839.6 ± 24.80.0 ± 0.00.3 ± 0.4伪装攻击89.2 ± 21.534.5 ± 28.30.0 ± 0.00.1 ± 0.3挡位伪装攻击44.7 ± 37.317.5 ± 16.70.0 ± 0.00.1 ± 0.3图2连续漂移左和平台右攻击代表性块的真实、攻击和孪生预测轨迹图3伪装左和挡位伪装右攻击代表性块的真实、攻击和孪生预测轨迹图4基于孪生的检测器的聚合混淆矩阵所有四种攻击类型的块平均计数表5 按攻击类型划分的实时IDS性能攻击类型平均检测延迟 ± 标准差 (ms)最大检测延迟 (ms)平均模型推理时间 ± 标准差 (ms)最大模型推理时间 (ms)平台攻击0.86 ± 0.593.820.78 ± 0.573.72连续攻击漂移0.68 ± 0.524.570.61 ± 0.464.40伪装攻击0.68 ± 0.433.410.61 ± 0.423.21挡位伪装攻击0.81 ± 0.492.880.68 ± 0.402.72结论本研究提出了一个基于DT的车辆动力总成CAN网络IDS该IDS通过比较预测的车辆行为与观测到的CAN信号来检测攻击。使用真实的现代/起亚驾驶数据进行训练所开发的数字孪生在评估的攻击场景中始终优于基线方法特别是在针对连续漂移和伪装攻击时表现尤为强劲这些攻击违反了学习到的动力总成信号之间的物理关系。对于平台攻击和挡位伪装攻击检测性能不太一致在这些攻击中被操纵的值尽管是恶意的但在局部仍然看似合理这突显了在物理约束系统上运行的基于预测的异常检测器所面临的内在挑战。这些结果突显了在物理约束的网络物理系统中运行的基于预测的检测器所面临的内在挑战。总体而言研究结果表明建模解码后的车辆信号之间的耦合动态为检测隐蔽的数据载荷操纵提供了一种有效方法而无需依赖消息时序特性或协议级特征。未来的工作将把本文提出的数字孪生扩展到其他车辆子系统并研究先进的时间建模方法以提高对密切模仿正常车辆行为的攻击的鲁棒性。此外未来的研究将侧重于将基于DT的IDS方法推广到更广泛的复杂和新出现的网络攻击场景。