Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Mo...

发布时间:2026/9/3 8:31:00
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Mo... 论文《Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models》总结与翻译一、文章主要内容该论文聚焦大型语言模型(LLMs)面临的越狱攻击问题,提出了一种名为“检索增强防御(RAD)”的新型防御框架,旨在解决现有防御系统在适应性和安全-效用权衡控制方面的不足,具体内容如下:1. 研究背景与问题越狱攻击威胁:LLMs虽在多任务中表现出色,但易受越狱攻击,攻击者通过巧妙修改输入隐藏恶意意图,诱导模型生成有害响应,且攻击策略不断演变、形式多样。现有防御缺陷:现有防御方法存在两大核心问题。一是适应性差,面对新出现的攻击策略,需通过昂贵的重新训练才能更新防御系统;二是难以平衡安全与效用,过度严格的防御可能误拒合法请求,且不同应用场景对安全和效用的需求不同,缺乏灵活的权衡机制。2. RAD框架设计核心思路:整合已知攻击示例数据库与检索增强生成(RAG)技术,通过检索相似攻击示例推断用户查询的恶意意图及所用越狱策略,无需重新训练