论文阅读 CVPR 2026 Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak

发布时间:2026/7/30 23:45:22
论文阅读 CVPR 2026 Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak 总目录 大模型安全研究论文整理 2026年版https://blog.csdn.net/WhiffeYF/article/details/159047894Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attackshttps://openaccess.thecvf.com/content/CVPR2026/papers/Cong_Anchoring_the_Mind_of_Multimodal_Reasoners_Cognitive_Bias_as_a_CVPR_2026_paper.pdfCVPR | LLM锚定效应越狱攻击 论文信息该论文题为《Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks》作者Linhua Cong、Bingrui Sima和Kun He来自华中科技大学。该论文研究模型的认知安全模型识别出危险意图后仍可能用“教育用途”等理由将其合理化。 发现痛点以往研究常从图像扰动、文字隐藏或推理链劫持入手。该论文发现更深层的风险是模型“看出危险却被开头带偏”。这类似心理学中的锚定效应第一条信息会成为后续判断的参照。️ 提出方案该论文提出RA-Attack。方法先输入结构化跨模态安全锚点包括安全思维导图以及要求模型在教育场景下解读导图的文字。随后危险意图被写成前述分析的自然延伸使模型沿着已建立的“安全轨道”继续推理。 例子这像检查员先看到一份专业的安全培训材料便认定任务合规。材料末尾再加入不合规要求却写成培训案例的下一步。若检查员过度依赖最初印象就可能把后续风险也误判为合理。RA-Attack利用的正是这种“先入为主”。 实验发现该论文在AdvBench和Hades上测试七个闭源与开源模型。第一RA-Attack在AdvBench上对Gemini-2.5-Pro和GPT-4o的攻击成功率达到92%和82%。第二在o4-mini上该方法仍达到44%其他基线最高不超过12%。第三三个代表模型的成功攻击回答中超过95%会先合理化危险意图再输出不安全内容。️ 防御与启示该论文提出Anchor Debiasing Prompt要求模型独立检查请求各部分。它将GPT-4o上的攻击成功率从82%降至8%将Gemini-2.5-Pro从92%降至28%且未损害MM-Vet通用能力。 一句话总结该论文表明LLM安全不仅要审查输入和答案也要防止推理过程被认知偏差牵引。