四篇文章、247 篇论文、几个带着实测成功率的点名漏洞利用之后,是时候动手了。这次不是又一篇研究综述,而是一份打分清单,让你在别人替你打分之前,先给自己的智能体打个分。
系列此前的四篇文章各自交付了一块拼图。下面是每一块的简短回顾,紧接着是对应的评分项。
四句话讲完这个系列
1. 攻击面。2026 年,智能体自身成为了攻击面:它可能被诱骗,反过来用自己的能力对付你,从老旧的 shell 引号技巧,到被当作指令读取的 Bug 报告。AI 智能体成为攻击面的这一年 →
2. 致命三要素。98% 的生产环境智能体同时集齐私有数据、不可信内容和对外通信,只有 11% 能通过影响范围评估。你无法靠提示词脱身,只能靠架构脱身。致命三要素:为何 98% 的 AI 智能体束手待毙 →
3. 生命周期。247 篇论文提炼出一个发现:单点防御各自有效却无法叠加,而大多数基准测试衡量的都是错误的东西。智能体安全是一门以 LLM 为核心的系统工程学科。读完 247 篇论文之后:智能体安全是一个系统问题 →
4. 防御手段。面向智能体的零信任、把内部智能体当作内部威胁对待、针对记忆投毒的可证明防御。共同的直觉是:别信任模型,缩小你必须信任的范围。AI 智能体的防御手册终于成形 →
自评量表
四个部分,对应上面每一篇文章。请针对你实际在生产环境中运行的智能体如实作答,而不是你希望它成为的样子。最后把分数加起来。
1 // 三要素得分(满分 3)
| 问题 | 计分条件 |
|---|---|
| 你的智能体能访问私有数据吗(文件、数据库、密钥)? | 答「否」得 1 分 |
| 它会处理不可信内容吗(网页、邮件、文档、工单)? | 答「否」得 1 分 |
| 它能对外通信吗(发邮件、调用 API、访问 URL)? | 答「否」得 1 分 |
三要素得分:___ / 3。得分低并不自动等于安全,它只是意味着你同时具备的「腿」更少。如果三条腿都占齐了,你就属于那 98% 的多数派,接下来三个部分要格外严格。
2 // 生命周期得分(满分 5)
| 问题 | 计分条件 |
|---|---|
| 输入在被处理之前,是否经过校验或与系统指令分离? | 答「是」得 1 分 |
| 规划阶段是否有明确的信任边界(智能体知道什么是可信的吗)? | 答「是」得 1 分 |
| 工具执行是否按每个动作的最小权限运行,而非全局授权? | 答「是」得 1 分 |
| 记忆/状态是否有来源追踪(你知道每条存储信息从哪来吗)? | 答「是」得 1 分 |
| 如果是多智能体系统:智能体之间能默认信任对方说的话,是否有边界限制? | 答「是」得 1 分(若非多智能体则不适用) |
生命周期得分:___ / 5。每一个没有控制手段的阶段,都是一次提示注入可以在你毫无察觉的情况下兑现的阶段。
3 // 防御得分(满分 4)
| 问题 | 计分条件 |
|---|---|
| 你是否把自己的智能体当作不可信主体来对待(零信任),而不是默认信任它? | 答「是」得 1 分 |
| 即便智能体做出违背你利益的事,你的控制手段是否依然成立(而不仅仅是它「想」的时候才成立)? | 答「是」得 1 分 |
| 新写入的记忆在被当作可信上下文之前,是否会经过审计? | 答「是」得 1 分 |
| 与安全相关的策略是否存放在系统配置里,而不是可编辑的对话记忆里? | 答「是」得 1 分 |
防御得分:___ / 4。这是大多数团队得分最低的部分,因为它要求的是架构工作,而非提示词工作。
4 // 攻击模式得分(满分 4)
| 问题 | 计分条件 |
|---|---|
| 你的命令防护是否针对老旧的 shell 引号技巧加固过(而不只是防住明显的模式)? | 答「是」得 1 分 |
| 你的智能体在浏览时是否无法访问内部/localhost 目标(具备 SSRF 防护)? | 答「是」得 1 分 |
| 运行时拉取的代码(依赖、脚本)是否经过检查或锁定版本,而不是盲目执行? | 答「是」得 1 分 |
| 面对来自用户可控渠道(工单、Bug 报告、评论)的未经验证的紧急或权威声明,你的智能体是否保持怀疑? | 答「是」得 1 分 |
攻击模式得分:___ / 4。这四种模式并非假设,它们都有名字,也有实测的成功率(见第一篇)。
总分与定位
把生命周期、防御和攻击模式三项得分加起来(满分 13),三要素得分作为背景参考放在一旁,它不直接计入总分,因为它衡量的是攻击面,而非加固程度。总体定位由这 13 分的加固得分决定:
| 得分(满分 13) | 定位 |
|---|---|
| 0–4 | 严重暴露。大多数已知攻击模式很可能原样奏效。 |
| 5–7 | 能用但可被利用。单点控制存在,但没有能相互支撑的信任边界。 |
| 8–10 | 已加固,仍有缺口。你属于真正能通过影响范围评估的少数派。 |
| 11–13 | 基线扎实。继续测试,没有任何控制手段是终点,参见第四篇里的可证明防御。 |
如果你的三要素得分是 3/3(三条腿全部具备),而加固得分低于 8,你就属于第二篇研究里最该警惕的那类:攻击面拉满,防御不完整。
这份自评里没有任何新东西。每一个问题都直接来自此前四篇文章中的某一篇。重点不是学到新知识,而是把已经学到的东西,用到你真正负责的那一个智能体身上。你无法靠提示词脱离致命三要素,只能靠架构脱身,而这份分数会告诉你该从哪里开始。