◄ 所有文章
AI Security

智能体安全审计:一份自评量表

NW Nils Weiser 28 JUL 2026

四篇文章、247 篇论文、几个带着实测成功率的点名漏洞利用之后,是时候动手了。这次不是又一篇研究综述,而是一份打分清单,让你在别人替你打分之前,先给自己的智能体打个分。

系列此前的四篇文章各自交付了一块拼图。下面是每一块的简短回顾,紧接着是对应的评分项。

四句话讲完这个系列

1. 攻击面。2026 年,智能体自身成为了攻击面:它可能被诱骗,反过来用自己的能力对付你,从老旧的 shell 引号技巧,到被当作指令读取的 Bug 报告。AI 智能体成为攻击面的这一年 →

2. 致命三要素。98% 的生产环境智能体同时集齐私有数据、不可信内容和对外通信,只有 11% 能通过影响范围评估。你无法靠提示词脱身,只能靠架构脱身。致命三要素:为何 98% 的 AI 智能体束手待毙 →

3. 生命周期。247 篇论文提炼出一个发现:单点防御各自有效却无法叠加,而大多数基准测试衡量的都是错误的东西。智能体安全是一门以 LLM 为核心的系统工程学科。读完 247 篇论文之后:智能体安全是一个系统问题 →

4. 防御手段。面向智能体的零信任、把内部智能体当作内部威胁对待、针对记忆投毒的可证明防御。共同的直觉是:别信任模型,缩小你必须信任的范围。AI 智能体的防御手册终于成形 →

自评量表

四个部分,对应上面每一篇文章。请针对你实际在生产环境中运行的智能体如实作答,而不是你希望它成为的样子。最后把分数加起来。

1 // 三要素得分(满分 3)

问题 计分条件
你的智能体能访问私有数据吗(文件、数据库、密钥)? 答「否」得 1 分
它会处理不可信内容吗(网页、邮件、文档、工单)? 答「否」得 1 分
它能对外通信吗(发邮件、调用 API、访问 URL)? 答「否」得 1 分

三要素得分:___ / 3。得分低并不自动等于安全,它只是意味着你同时具备的「腿」更少。如果三条腿都占齐了,你就属于那 98% 的多数派,接下来三个部分要格外严格。

2 // 生命周期得分(满分 5)

问题 计分条件
输入在被处理之前,是否经过校验或与系统指令分离? 答「是」得 1 分
规划阶段是否有明确的信任边界(智能体知道什么是可信的吗)? 答「是」得 1 分
工具执行是否按每个动作的最小权限运行,而非全局授权? 答「是」得 1 分
记忆/状态是否有来源追踪(你知道每条存储信息从哪来吗)? 答「是」得 1 分
如果是多智能体系统:智能体之间能默认信任对方说的话,是否有边界限制? 答「是」得 1 分(若非多智能体则不适用)

生命周期得分:___ / 5。每一个没有控制手段的阶段,都是一次提示注入可以在你毫无察觉的情况下兑现的阶段。

3 // 防御得分(满分 4)

问题 计分条件
你是否把自己的智能体当作不可信主体来对待(零信任),而不是默认信任它? 答「是」得 1 分
即便智能体做出违背你利益的事,你的控制手段是否依然成立(而不仅仅是它「想」的时候才成立)? 答「是」得 1 分
新写入的记忆在被当作可信上下文之前,是否会经过审计? 答「是」得 1 分
与安全相关的策略是否存放在系统配置里,而不是可编辑的对话记忆里? 答「是」得 1 分

防御得分:___ / 4。这是大多数团队得分最低的部分,因为它要求的是架构工作,而非提示词工作。

4 // 攻击模式得分(满分 4)

问题 计分条件
你的命令防护是否针对老旧的 shell 引号技巧加固过(而不只是防住明显的模式)? 答「是」得 1 分
你的智能体在浏览时是否无法访问内部/localhost 目标(具备 SSRF 防护)? 答「是」得 1 分
运行时拉取的代码(依赖、脚本)是否经过检查或锁定版本,而不是盲目执行? 答「是」得 1 分
面对来自用户可控渠道(工单、Bug 报告、评论)的未经验证的紧急或权威声明,你的智能体是否保持怀疑? 答「是」得 1 分

攻击模式得分:___ / 4。这四种模式并非假设,它们都有名字,也有实测的成功率(见第一篇)。

总分与定位

把生命周期、防御和攻击模式三项得分加起来(满分 13),三要素得分作为背景参考放在一旁,它不直接计入总分,因为它衡量的是攻击面,而非加固程度。总体定位由这 13 分的加固得分决定:

得分(满分 13) 定位
0–4 严重暴露。大多数已知攻击模式很可能原样奏效。
5–7 能用但可被利用。单点控制存在,但没有能相互支撑的信任边界。
8–10 已加固,仍有缺口。你属于真正能通过影响范围评估的少数派。
11–13 基线扎实。继续测试,没有任何控制手段是终点,参见第四篇里的可证明防御。

如果你的三要素得分是 3/3(三条腿全部具备),而加固得分低于 8,你就属于第二篇研究里最该警惕的那类:攻击面拉满,防御不完整。

这份自评里没有任何新东西。每一个问题都直接来自此前四篇文章中的某一篇。重点不是学到新知识,而是把已经学到的东西,用到你真正负责的那一个智能体身上。你无法靠提示词脱离致命三要素,只能靠架构脱身,而这份分数会告诉你该从哪里开始。

NW
Nils WeiserAI 智能体专家 · 博登湖地区
与我合作 ▸

更多现场笔记

所有文章 ▸