◄ 所有文章
AI Security

致命三要素:为什么 98% 的 AI 智能体都是活靶子

NW Nils Weiser 23 JUL 2026

有一个安全概念,已经悄然成为思考 AI 智能体时最有用的那副透镜——如果你手里正跑着一个智能体,你应该记得它的名字。Simon Willison 把它称为致命三要素(lethal trifecta)——而 2026 年的研究,一次又一次地证明了他是对的。

这个概念简单到一句话就能讲清。当一个 AI 智能体同时集齐三种能力时,它就变得危险了:

1 // 访问私有数据

你的文件、你的邮件、你的数据库、你的机密。

2 // 接触不可信内容

一个网页、一份文档、一封邮件、一份漏洞报告——任何攻击者能够施加影响的东西。

3 // 对外通信

发一封邮件、发起一次 API 调用、请求一个 URL、写入一个共享位置。

三者单独存在时,都没什么问题。一个能读你私有数据、却无法与外界通信的智能体,泄不出去。一个能读不可信网页、却没有任何机密可偷的智能体,是无害的。可一旦你把三者凑到一起,你就造出了一台机器:攻击者可以通过那些不可信内容对它下达指令——让它把你的私有数据取出来,再送出门去。而智能体会心甘情愿地照做,因为它无法可靠地把你的指令和攻击者的指令区分开。

那个该让你停下来的数字

而下面这一点,才让它不再只是一个思想实验。云安全联盟(Cloud Security Alliance)近来的一份研究简报评估了生产环境中的 AI 智能体,结果发现其中 98% 同时集齐了三要素的全部三条腿。这不是冒险的少数派。是几乎全部。

98%
受评估的生产环境智能体同时集齐三要素的全部三条腿(CSA)
11%
100 个生产环境智能体中通过 AI 风险象限评估的比例

而情况还要更糟,因为另一套独立的评估方法——AI 风险象限(AI Risk Quadrant)——针对 100 个生产环境智能体的攻击面和影响范围进行了打分,结果发现只有 11% 通过了评估。按评估者的标准,其余 89% 都被部署在这样一种状态里:一次成功的注入就能造成实实在在的破坏。

把这两项发现摆在一起,画面就变得触目惊心:眼下运行在生产环境中的绝大多数智能体,恰恰具备了那种能让提示注入变得灾难性的能力组合,而其中的绝大多数,又都没有做好把爆炸控制住的功课。

为什么它如此难以避免

令人沮丧的地方在于,三要素并不是人们出于粗心才犯下的错误。它就是「好用」这件事本来的样子。

你希望你的智能体拿到你的数据——否则你部署它干什么?你希望它去读真实世界里的内容——那就是它的活儿。你希望它能采取行动——一个只会想、永远不会做的智能体,不过是一个极其昂贵的自动补全。制造出漏洞的那三种能力,恰恰就是创造出价值的那三种能力。这也正是为什么研究者们反复指出:在实践中,能力与安全性是负相关的——你放手让智能体做的越多,攻击者能借它做的也就越多。

这是一个货真价实、令人不适的取舍,而我觉得业界有相当一部分人正暗自指望某个更好的模型能让它自行消失。它不会。只要模型仍然把指令和数据当作同一种文本来读,那么无论模型变得多有本事,三要素都将始终致命。

打破这个三角

唯一持久的解法,是针对任何一项给定任务去掉三要素中的其中一条腿——而不是试图把模型变聪明到足以抵抗攻击。落到实处,这意味着架构上的边界,而不是更漂亮的提示词:

切断对外通信

用于那些会触及敏感数据的智能体。如果它什么都发不出去,那么即便被彻底劫持,它也无法把数据外泄出去。

切断私有数据访问

用于那些必须读取不可信内容的智能体。让负责网页浏览的智能体去浏览就好;只是别把钥匙交到它手上。

切断不可信内容

在任何来自信任边界之外的东西被那个握有真实权限的智能体看到之前,先对它进行校验、沙箱化或隔离检疫。

这些手段没有一个是稀奇古怪的。它们就是最小权限、网络分段和信任边界——安全领域里最古老的那些理念,只不过被应用到了一种新型的组件上。2026 年真正把智能体安全做对的团队,靠的不是最精巧的提示词。而是那些真正端详了自己的智能体、数清了三要素有几条腿、然后有意砍掉其中一条的人。

如果今年所有的智能体安全研究里,你只带走一样东西,那就让它是这句:你无法靠调提示词逃出致命三要素。你只能靠架构逃出去。


来源:Simon Willison — The lethal trifecta for AI agentsAdversa AI — Top Agentic AI Security Resources, July 2026(CSA 致命三要素简报与 AI 风险象限数据)。

NW
Nils WeiserAI 智能体专家 · 博登湖地区
与我合作 ▸

更多现场笔记

所有文章 ▸