每隔几个月,某个研究领域就会产出一篇论文——它与其说是一个新结果,不如说是一张新地图:一篇后退一步、读遍一切、然后告诉你整片疆域究竟长什么样的综述。对于 AI 智能体安全而言,那篇论文在 2026 年到来了:一篇「知识系统化」(Systematization of Knowledge,SoK),它消化了 2023 到 2026 年间发表的 247 篇论文。
如果你只打算读一样东西来在这个领域里找到方向,我会说那就该是它。它的核心论断简单得有些出人意料,而我一直反复回味:
一旦一个语言模型被接入一个会规划、会调用工具、会保留记忆、会对外部世界采取行动的循环,安全就不再关乎不安全的文本,而变成了一个软件与系统层面的问题。
这句话不动声色地重构了整个领域。多年来,「AI 安全」占主导地位的心智模型都是围绕输出的——模型会不会说出有害的话?而这篇 SoK 论证道:一旦你部署了一个智能体,那套框架就成了一个范畴错误。真正有意思的失败并不在模型说了什么;它们藏在这些地方——不可信信息如何变成一个控制决策,那个决策又如何撞上被委派出去的权限,以及持久状态如何随着时间的推移改变了整个系统的安全性质。
看的是生命周期,而不是那一次事故
这篇综述最有用的贡献在于,它不再孤立地为攻击编目录,而是把它们映射到智能体生命周期上——那是可能出岔子的八个阶段:
- 输入处理
- 规划
- 决策
- 工具执行
- 输出生成
- 记忆与状态
- 监控
- 多智能体协调
这之所以重要,是因为它改变了你所提的那个问题。你不再问「这个输出安全吗?」,而是问「不可信输入究竟在哪个阶段获得了足以造成危害的权限?」一次提示注入并不是一个单一事件;它是一条链——始于输入处理,熬过规划,最终在工具执行环节兑现。对整个生命周期进行威胁建模,会让你看清一道边界原本可以在哪里把它拦下来。
那个该让防御者担忧的发现
下面这一部分,我认为最值得关注。这篇综述审视了整个领域已经产出的那些防御手段——护栏、权限控制、隔离、来源追踪——发现它们单独拿出来,大多是奏效的。问题出在组合上:它们「无法干净利落地叠加成整体」。每一种防御都假设了一套不同的信任模型,而当你把它们堆在一起时,这些假设并不会对齐成一个自洽的整体。你可以把四种看似合理的防御拼装到一起,却依然给攻击者留下一道能长驱直入的接缝。
这是一个真正重要的洞见,而它恰恰是只有综述才能揭示出来的那类东西——因为你站在任何一篇单独的论文内部,都看不见它。每一种单点防御看上去都没毛病。缺口,就藏在它们彼此之间的空隙里。
我们衡量的也是错误的东西
第二个令人不适的发现,关乎基准测试。大多数智能体安全评估衡量的都是单轮、有边界的成功率——攻击成功了吗,是或否,一击定胜负。但真实的智能体会长时间运行,会跨会话携带状态,还会与其他智能体协同。
那些被低估衡量的风险
这篇综述论证道:我们正在系统性地低估恰恰在部署中最要紧的那些风险——长时程行为、有状态的记忆被污染,以及多智能体间的传播。而且几乎没有人会把安全性和效用、延迟、成本放在一起联合衡量——正是这样,你才会造出一堆没人真正上线的「安全」设计,因为它们要么太慢,要么太没用。
这个领域该往哪里走
这篇综述最终落在四根支柱上,用以构建那种从设计之初就安全、而非靠打补丁才安全的智能体:
// 显式的信任边界
清楚地知道可信权限在哪里终结、不可信输入从哪里开始——并从结构上强制执行这条界线。
// 有原则的最小权限
按「每个动作」而非「每个智能体」来界定权限范围。别把一个智能体能碰到的一切都一股脑交给它。
// 可追溯来源的状态
清楚地知道每一份记忆来自何处,这样被投毒的状态就无法「洗白」进可信的上下文里。
// 贴近部署实况的评估
去衡量长时程、有状态、多智能体的行为——并把安全性和效用、延迟、成本放在一起衡量。
如果你出身于系统安全,这四点没有一个会让你感到意外——而这恰恰就是重点。247 篇论文提炼出来的讯息是:智能体安全是一门恰好以语言模型为核心的系统工程学科,而这个领域越早这样看待它,就越能更快地取得真正的进展。
我喜欢像这样的综述论文,是因为它们是一种廉价地买到全局视角的方式。读一篇 SoK 并不会把你变成研究者,但它会让你对这个领域里最常见的两种错误产生免疫:以为模型就是问题的全部,以及以为某个单一而精巧的防御就是解法的全部。
来源:Toward Secure LLM Agents — a 247-paper SoK;A Systematic Survey of Security Threats and Defenses in LLM-Based AI Agents (arXiv 2604.23338);Data Agents Under Attack (arXiv 2606.08661)。