◄ 所有文章
Research

读完 247 篇论文之后:智能体安全是一个系统问题,而非文本问题

NW Nils Weiser 22 JUL 2026

每隔几个月,某个研究领域就会产出一篇论文——它与其说是一个新结果,不如说是一张新地图:一篇后退一步、读遍一切、然后告诉你整片疆域究竟长什么样的综述。对于 AI 智能体安全而言,那篇论文在 2026 年到来了:一篇「知识系统化」(Systematization of Knowledge,SoK),它消化了 2023 到 2026 年间发表的 247 篇论文

如果你只打算读一样东西来在这个领域里找到方向,我会说那就该是它。它的核心论断简单得有些出人意料,而我一直反复回味:

一旦一个语言模型被接入一个会规划、会调用工具、会保留记忆、会对外部世界采取行动的循环,安全就不再关乎不安全的文本,而变成了一个软件与系统层面的问题。

这句话不动声色地重构了整个领域。多年来,「AI 安全」占主导地位的心智模型都是围绕输出的——模型会不会说出有害的话?而这篇 SoK 论证道:一旦你部署了一个智能体,那套框架就成了一个范畴错误。真正有意思的失败并不在模型说了什么;它们藏在这些地方——不可信信息如何变成一个控制决策,那个决策又如何撞上被委派出去的权限,以及持久状态如何随着时间的推移改变了整个系统的安全性质。

看的是生命周期,而不是那一次事故

这篇综述最有用的贡献在于,它不再孤立地为攻击编目录,而是把它们映射到智能体生命周期上——那是可能出岔子的八个阶段:

这之所以重要,是因为它改变了你所提的那个问题。你不再问「这个输出安全吗?」,而是问「不可信输入究竟在哪个阶段获得了足以造成危害的权限?」一次提示注入并不是一个单一事件;它是一条链——始于输入处理,熬过规划,最终在工具执行环节兑现。对整个生命周期进行威胁建模,会让你看清一道边界原本可以在哪里把它拦下来。

那个该让防御者担忧的发现

下面这一部分,我认为最值得关注。这篇综述审视了整个领域已经产出的那些防御手段——护栏、权限控制、隔离、来源追踪——发现它们单独拿出来,大多是奏效的。问题出在组合上:它们「无法干净利落地叠加成整体」。每一种防御都假设了一套不同的信任模型,而当你把它们堆在一起时,这些假设并不会对齐成一个自洽的整体。你可以把四种看似合理的防御拼装到一起,却依然给攻击者留下一道能长驱直入的接缝。

这是一个真正重要的洞见,而它恰恰是只有综述才能揭示出来的那类东西——因为你站在任何一篇单独的论文内部,都看不见它。每一种单点防御看上去都没毛病。缺口,就藏在它们彼此之间的空隙里。

我们衡量的也是错误的东西

第二个令人不适的发现,关乎基准测试。大多数智能体安全评估衡量的都是单轮、有边界的成功率——攻击成功了吗,是或否,一击定胜负。但真实的智能体会长时间运行,会跨会话携带状态,还会与其他智能体协同。

那些被低估衡量的风险

这篇综述论证道:我们正在系统性地低估恰恰在部署中最要紧的那些风险——长时程行为、有状态的记忆被污染,以及多智能体间的传播。而且几乎没有人会把安全性和效用、延迟、成本放在一起联合衡量——正是这样,你才会造出一堆没人真正上线的「安全」设计,因为它们要么太慢,要么太没用。

这个领域该往哪里走

这篇综述最终落在四根支柱上,用以构建那种从设计之初就安全、而非靠打补丁才安全的智能体:

// 显式的信任边界

清楚地知道可信权限在哪里终结、不可信输入从哪里开始——并从结构上强制执行这条界线。

// 有原则的最小权限

按「每个动作」而非「每个智能体」来界定权限范围。别把一个智能体能碰到的一切都一股脑交给它。

// 可追溯来源的状态

清楚地知道每一份记忆来自何处,这样被投毒的状态就无法「洗白」进可信的上下文里。

// 贴近部署实况的评估

去衡量长时程、有状态、多智能体的行为——并把安全性和效用、延迟、成本放在一起衡量。

如果你出身于系统安全,这四点没有一个会让你感到意外——而这恰恰就是重点。247 篇论文提炼出来的讯息是:智能体安全是一门恰好以语言模型为核心的系统工程学科,而这个领域越早这样看待它,就越能更快地取得真正的进展。

我喜欢像这样的综述论文,是因为它们是一种廉价地买到全局视角的方式。读一篇 SoK 并不会把你变成研究者,但它会让你对这个领域里最常见的两种错误产生免疫:以为模型就是问题的全部,以及以为某个单一而精巧的防御就是解法的全部。


来源:Toward Secure LLM Agents — a 247-paper SoKA Systematic Survey of Security Threats and Defenses in LLM-Based AI Agents (arXiv 2604.23338)Data Agents Under Attack (arXiv 2606.08661)

NW
Nils WeiserAI 智能体专家 · 博登湖地区
与我合作 ▸

更多现场笔记

所有文章 ▸