驯服LLM严重度通胀:Mantis-calibrate风险评分矩阵全解析,让最危险的风险浮出水面

发布时间:2026/10/7 7:56:39
驯服LLM严重度通胀:Mantis-calibrate风险评分矩阵全解析,让最危险的风险浮出水面 驯服LLM严重度通胀Mantis-calibrate风险评分矩阵全解析让最危险的风险浮出水面【免费下载链接】mantisA modular, stack-agnostic toolkit for AI coding agents to autonomously find, reproduce, and patch vulnerabilities.项目地址: https://gitcode.com/gh_mirrors/mantis17/mantis在AI安全扫描中LLM严重度通胀severity inflation是个老大难问题大模型总倾向把每个漏洞都标成CRITICAL淹没真正致命的问题。MantisGitHub 加速计划 / mantis17 / mantis是一个面向 AI 编码智能体的模块化漏洞挖掘工具包其中的/mantis-calibrate风险校准器专门用一套影响 × 可能性 × 上下文的风险评分矩阵为每个发现打分1-10把最危险的风险浮出水面而不是喷涌出几千条危急。本文完整拆解这套校准机制的设计思路 。为什么需要风险校准器当 AI 智能体自主扫描代码库时典型困境是虚高报告模型对代码脆弱性理论风险也给出高危评级注意力稀释安全专家面对数百条CRITICAL真正 0-click RCE 被埋没⚖️标准不一同一漏洞换个描述方式评分就漂移Mantis 在 README.md 中明确把校准列为核心能力Calibrate all findings based on an established rubric tocombat LLM inflation of severity(surfacing the most critical risks to humans instead of spewing thousands of criticals)校准器在整条流水线中位于第 12 阶段Calibrate由mantis-calibrate子代理执行读取workspace/findings/下所有已完成复现、修复验证的发现文件结合威胁模型为每条发现追加最终风险分供后续报告阶段使用。流水线全貌可参考 README_AGENTS.md 中的阶段图。评分矩阵Hazard (Impact Likelihood) × Multiplier完整规则定义在 mantis-calibrate/SKILL.md核心公式只有三块积木1️⃣ Impact影响1-5 分用 CIA 三元组 爆炸半径分值含义5系统性机密性/完整性崩塌如未授权 RCE、根密钥泄露4大范围数据暴露或主要服务全面中断3部分数据暴露、临时性中断2轻微泄露只影响单一用户自己数据的漏洞封顶 2 分1纯外观/卫生问题代码脆弱类发现强制为 1两条关键的升降级规则安全控制绕过升档直接绕过认证、鉴权、签名验证等核心安全控制的Impact 至少抬到 4权限天花板需要高权限admin→super-admin或仅是内网横向移动的Impact 封顶 2普通已认证用户利用的封顶 3。2️⃣ Likelihood可能性1-5 分看实证而非理论评分锚定的是已被证明的可行性在野利用或智能体写出了可武器化的 exploit 记 5 分有公开 PoC 记 4 分纯理论无已知利用路径记 1 分。若利用路径依赖罕见的 API、非默认配置或不常见的数据格式还要额外扣 1-2 分Reachability-in-Practice 修正。3️⃣ Context Multiplier上下文乘数0.1-1.0暴露面决定生死这是矩阵最有工程味道的部分——同一漏洞放在不同的信任边界里风险天差地别暴露面乘数说明EXPOSED对外接口1.0不受信输入直接可达INTERNAL内部组件0.8接收半可信的已解析数据PRIVILEGED特权区0.5深嵌在受信任区域内在此之上还会叠加一系列连乘修正死代码运行路径永远不会调用→ 乘数直接压到0.2需要用户交互CSRF、点击型攻击→ 再乘0.7仅样本/测试代码可触发 → 乘0.4通常只能落在 MEDIUM仅非默认配置可触发 → 乘0.7纯 DoS 且组件可用性等级为 LOW_CRITICALITY → 乘0.5例内部组件(0.8) 需要用户点击(0.7) 0.56 —— 这样的发现天然被压在 CRITICAL 门槛之下。最终Hazard (Impact Likelihood) × Multiplier封顶 10.0。此外还要求模型在推理中讨论Risk Hazard Outrage舆情/声誉风险但舆情只写评语outrage_commentary不许混进数字分——防止吓唬人抬高分数。27 条理智分诊规则给分数踩刹车 打完分还有第二道闸门Critical Sanity Triage。核心原则是边际能力Marginal Capability——漏洞给攻击者带来的新增能力有多大如果攻击者本来就已经拥有同等控制力发现就必须降档。完整目录收录在 calibration_rules.md按刹车力度分三类️ 强制降为 LOW封顶 2.0——11 条典型触发场景repro_failure复现失败或未尝试复现unreachable_inputs输入无法从信任边界触达prerequisite_shell攻击者已拥有同等或更高权限的本地 shell你已经是 root还打什么 root 提权漏洞physical_long_term需要长期物理接触设备故障注入、拆芯片standard_host_attacks宿主系统打 guest——设计如此零边际能力️ 强制封顶 HIGH7.9——8 条static_confirmation仅静态确认、未实证复现 → Likelihood 封顶 3、乘 0.8禁止 CRITICAL有 ASan/崩溃日志等实证痕迹可豁免strict_xss所有 XSS 默认 MEDIUM/LOW仅管理员零点击存储型 XSS 可触及 HIGHprobabilistic_llm依赖提示注入等概率性 LLM 行为的攻击supply_chain_prerequisites/non_default_config入口门槛极高的攻击 强制封顶 MEDIUM5.9——8 条local_attack_vector需本地 shell 的提权类self_contained_blast爆炸半径完全锁在触发者自己租户/容器内equivalent_primitives管理员利用 bug 下载了自己本来就能下载的文件physical_temporaryUSB 插入、evil maid 等临时物理接触优先级映射CRITICAL 8.0-10.0且必须是无特权攻击者 零点击这条是绝对规则HIGH 6.0-7.9MEDIUM 3.0-5.9LOW 0.1-2.9。多条规则同时命中时最严的一票通过Force-LOW cap-MEDIUM cap-HIGH。可审计每条规则都要留下判决记录这套机制的精髓之一是可审计性。校准完成后每条发现的 JSON 里会追加一整套字段impact_score、likelihood_score、inferred_exposure、attacker_position、mantis_risk_score、priority等其中最值得称道的是calibration_checklist27 条规则逐一给出结论APPLIES/DOES_NOT_APPLY/UNKNOWN命中规则必须附理由sanity_triage_applied按最严优先顺序列出触发规则形如Local Attack Vector; Internal/Nested规则状态不明UNKNOWN时不降分保持分数保守但会标记Incomplete Calibration提醒人工复核这种评分 完整检查单的设计让人类安全专家几分钟内就能判断 AI 的打分是否讲道理而不是只能盲信一个数字。防陈旧证据STALE-EVIDENCE 守卫在启用快照snapshot同步模式时代码可能在两轮扫描之间漂移。此时如果拿旧代码上的崩溃日志当复现成功就会错误地给分。SKILL.md 中专门设计了STALE-EVIDENCE 守卫发现与当前快照不匹配时禁用死代码降权、禁止用旧堆栈日志提升 Likelihood、复现失败不强制 LOW而是保持保守分数并打上STALE_EVIDENCE标记。宁可分数偏高一点走人工复核也不允许过期证据污染评分。有基准、有验证评分不是玄学项目为校准器配备了专门的评测集 reference/evals/calibrate_dataset.json覆盖典型三档未认证 RCE有可用 PoC、零前置→ 期望 9.0-10.0P0_CRITICAL跨租户 IDOR 数据外泄已认证普通用户→ 期望 6.5-8.5P1_HIGH微秒级计时偏差无实际影响→ 期望 1.0-3.5P3_LOW对应的工具实现见 reference/tools/research_tools.py 中的score_risk与calibrate_finding——它们对输入做硬校验风险分 0.1-10.0、影响/可能性 1-5、优先级枚举从工程层面杜绝模型打出一个 64 分的 CRITICAL。工作流定义中校准节点可参考 reference/workflow.json 的calibrator配置。快速上手把校准器跑起来Mantis 提供mantis-configure/mantis-launch自动化配置与启动工具。安装并运行完整流水线内含 calibrate 阶段cd reference ./install.sh python3 scripts/configure.py --auto ./run.sh path/to/code如果你想在自己的项目里复用这套思路建议先阅读 mantis-calibrate/SKILL.md 中的 Impact/Likelihood/Multiplier 三段定义它是可直接移植的评分 rubric把 calibration_rules.md 的 27 条规则按你的威胁模型增删Mantis 官方也建议在威胁模型中声明Calibration Overrides来抬升/收紧特定场景的天花板仿照评测数据集构造 3-5 条期望分数区间用例持续回归你的校准器。小结Mantis 的/mantis-calibrate用一个朴素但严格的公式——(影响 可能性) × 上下文乘数 27 条理智刹车——把 LLM 安全扫描从CRITICAL 大爆炸驯化成了可排序、可审计、可复核的风险清单。它的启示很简单对抗 AI 幻觉与评分通胀靠的不是更强的提示词而是把评分变成一套有天花板、有例外条款、且每一步都留痕的矩阵。当最危险的 3 个问题稳定地排在报告最上面时这套机制就赢了 ✅。【免费下载链接】mantisA modular, stack-agnostic toolkit for AI coding agents to autonomously find, reproduce, and patch vulnerabilities.项目地址: https://gitcode.com/gh_mirrors/mantis17/mantis创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考