The Dark Side of LLMs: Agent-based Attacks for Complete Computer Takeover

发布时间:2026/10/7 16:19:42
The Dark Side of LLMs: Agent-based Attacks for Complete Computer Takeover 文章主要内容总结本文聚焦大型语言模型(LLMs)驱动的代理及多代理系统的安全漏洞,通过实验评估了18个主流LLM(包括GPT-4、Claude-4、Gemini-2.5等)在三种攻击场景下的脆弱性,揭示了LLM代理可被用作攻击向量以实现对计算机的完全接管。具体内容如下:攻击场景设计:研究了三种攻击表面及对应的信任边界直接提示注入(Direct Prompt Injection):攻击者直接在用户输入中嵌入恶意指令,诱导LLM代理执行。RAG后门攻击(RAG Backdoor):通过篡改检索增强生成(RAG)知识库中的文档,隐藏恶意指令,使代理在正常检索时触发攻击。代理间信任利用(Inter-Agent Trust Exploitation):在多代理系统中,利用代理对 peer 代理的固有信任,使原本能抵抗直接或RAG攻击的LLM执行恶意指令。实验结果:94.4%的LLM易受直接提示注入攻击;83.3%的LLM易受RAG后门攻击,且攻击具有高度隐蔽性(执行恶意操作时仍能正常响应用户请求);100%的LLM在多代理系统中会因代理间信任而执行恶意指令,即使它们能抵抗前两种攻击。核心发现: