揭秘SingGuard-NSFA-4B增强Llama Guard 3的秘密:F1提升17.6个点的分类头架构

发布时间:2026/8/18 16:10:22
揭秘SingGuard-NSFA-4B增强Llama Guard 3的秘密:F1提升17.6个点的分类头架构 揭秘SingGuard-NSFA-4B增强Llama Guard 3的秘密F1提升17.6个点的分类头架构【免费下载链接】SingGuard-NSFA-4B项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-4BSingGuard-NSFA-4B 是蚂蚁集团 SingGuard 团队开源的一款面向 Agent 场景的大模型安全护栏guardrail它最让人惊艳的成就是仅靠一套分类头架构就能让 Llama Guard 3 这类成熟护栏的检测 F1 直接提升 17.6 个百分点一跃登顶所有外部护栏模型。本文面向新手与普通用户为你拆解这套架构的底层秘密NSFA 风险分类法如何组织 185 种威胁变体、7 个即取即用的分类头文件怎么用以及它为什么能做到约 50 毫秒的实时拦截。为什么 Agent 应用急需一套安全护栏当大模型从聊天机器人升级为能调用工具、操作系统的Agent时风险边界也随之扩大攻击者可以注入恶意指令、诱导越狱、诱导模型生成恶意代码、窃取敏感信息甚至滥用工具或耗尽计算资源。这些威胁属于操作型风险——不是模型说了什么而是模型做了什么。传统的内容安全模型管不住这类风险这正是 Agent 安全护栏存在的意义。NSFA 风险分类法185 种威胁变体如何被组织SingGuard-NSFA-4B 基于 NSFANot Secure For Agents分类法构建这套分类法以 CIA 三元组机密性、完整性、可用性为根基交叉验证了 3 份 OWASP 指南最终梳理出185 个风险变体并支持133 种语言。它把风险分为查询侧输入护栏与响应侧输出护栏两大类检测侧风险域对应分类头文件查询侧输入Prompt 注入与越狱nsfa_heads/NSFA-Prompt_Injection_and_Jailbreak_head.pth查询侧输入恶意代码与网络攻击nsfa_heads/NSFA-Malicious_Code_and_Cyberattack_head.pth查询侧输入敏感信息窃取nsfa_heads/NSFA-Sensitive_Information_Stealing_head.pth查询侧输入危险操作与工具滥用nsfa_heads/NSFA-Dangerous_Operations_Tool_Abuse_head.pth查询侧输入资源滥用nsfa_heads/NSFA-Resource_Abuse_head.pth响应侧输出危险行动生成nsfa_heads/NSFA-Hazardous_Action_Generation_head.pth响应侧输出敏感信息泄露nsfa_heads/NSFA-Sensitive_Information_Leakage_head.pth其中查询侧 5 大域细分为 160 个变体响应侧 2 大域细分为 25 个变体。每个风险域都对应一个独立的分类头各管一摊互不干扰。分类头架构的秘密为什么 F1 能提升 17.6 个点这是全文的核心。传统护栏模型通常是一个模型干所有事而 SingGuard-NSFA-4B 采用了冻结主干 挂载分类头的可扩展架构主干只做表征微调后的模型主干被完全冻结输入文本经过处理后取出最后一层 token 的 embedding作为统一特征每个头专精一个风险域这个 embedding 被喂给各风险域专属的轻量 MLP 分类头结构简单Linear → LayerNorm → 激活 → Dropout → 输出层只需输出有风险 / 无风险的概率分数增强即插即用这套分类头架构可以训练在任意冻结的护栏主干之上包括 Llama Guard 3。实验表明给 Llama Guard 3 挂上 NSFA 分类头后查询侧检测 F1 提升了17.6 个百分点直接跃升为最强外部护栏新增风险零成本以后遇到新风险类型只需在冻结主干上多训一个轻量头无需重训主干也不会影响已有检测能力。比如团队在 9B 主干上新增的内容安全头在内容审核基准上就达到了接近 SOTA 的水平。一句话总结它把检测能力做成了可插拔的模块用极小的成本补上了 Llama Guard 3 对 Agent 操作型风险的盲区这就是 17.6 个点提升的来源。七个分类头文件随模型即取即用在仓库根目录的nsfa_heads/文件夹下你可以直接找到上表中的 7 个.pth分类头文件每个文件内部包含head_state_dict头权重、head_config头配置、taskquery / response、sub_task_name子任务名等字段。加载时系统会自动读取这些信息无需手工配置。双模式推理50 毫秒实时拦截 可解释离线审计SingGuard-NSFA-4B 提供两种互补的推理模式满足不同场景实时分类模式在线拦截主干以 vLLM 的 embedding 模式加载7 个分类头通过torch.vmap并行推理单次前向传播仅约 50 毫秒A100 上实测 45–57ms适合高吞吐的在线流量运营者还可以按风险域独立设置置信度阈值生成式推理模式离线审计模型用边界标签untrusted_input查询与untrusted_output响应包裹输入自动生成一段思维链风险分析 结构化风险判断全程可解释适合合规审计与人工复核。性能表现四个尺寸在多个基准全面领先官方在三个多语言基准上做了严格评测全部使用独立的提示模板、七模型多数投票标注并用 MinHashLSH 去重切断训练与评测边界基准样本数正负比风险域NSFA_Query_Multilingual63,43129,474 : 33,9575 个域、160 个变体NSFA_Response_Multilingual29,97214,314 : 15,6582 个域、25 个变体NSFA_CrossSource_Query_Multilingual3,4352,315 : 1,1205 个域跨来源结果同样亮眼0.8B / 2B / 4B / 9B 四个尺寸全部达到 94% 以上的 F1且全面超越最强竞品 6–12 个绝对 F1 点。其中 0.8B 版本在保持 94% F1 的同时非常适合资源受限的边缘设备部署。新手快速上手三步把护栏装进你的 Agent第一步克隆仓库并准备模型文件git clone https://gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-4B第二步确认目录结构完整model.safetensors主干权重、config.json、tokenizer_config.json、chat_template.jinja以及nsfa_heads/下的 7 个分类头文件缺一不可第三步参考 README 中的示例代码先加载 tokenizer 与 vLLM 主干embedding 模式再用load_heads()载入nsfa_heads目录下所有分类头最后调用infer()即可得到每个风险域的风险概率风险概率大于 0.5 即判定为 unsafe。小结SingGuard-NSFA-4B 用一套优雅的分类头架构回答了护栏如何持续进化的问题主干冻结、风险域解耦、检测能力即插即用。它既能让 Llama Guard 3 的 F1 提升 17.6 个点也能在 50 毫秒内完成实时拦截还能以 133 种语言覆盖全球用户——这正是它被称为可扩展 Agent 护栏的原因。如果你正在为自己的 Agent 应用寻找安全防线不妨从这套架构入手把风险拦截在工具执行之前。【免费下载链接】SingGuard-NSFA-4B项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考