◄ 所有文章
Ambient AI

环境 AI:为什么下一代 AI 不回答,而是留意

NW Nils Weiser May 21, 2026

只要我们还按请求为 AI 付费,就只会造出它的一种形态:对投币做出反应的自动售货机。而真正有意思的形态,是那个会自己留意到哪里不对劲的看门人。当算力的计费单位翻转时,会发生什么变化。

今天的 AI 是一台自动售货机:你投进一枚硬币(提示词),拿到一杯咖啡(回应)。按杯计费。下一代则是一个看门人:他四处巡视、逐项检查,只有在发现哪里不对劲时才开口。按 token 计费的经济模式无法表达第二种形态——而这恰恰是今天几乎没人去做它的原因。

有十一天,一个语言模型一直运行在一台配了单块 NVIDIA L4 GPU 的 GCP 虚拟机上——它当下并不做任何我临时吩咐的事。06:00 UTC,它抓取三家竞争对手;07:00 UTC,它用我们的品牌语气写一篇博客草稿;每周两次,它把我的产品组合聚成主题世界并发布出去。晚上,它给我发一份 Telegram 报告。它每月花费 约 €220–255——一笔可预测的固定费用,而不是一个 token 计数器。它让我意识到,过去两年我一直在构建错误的那一类 AI。

这篇文章想为正确的那一类命名——并解释为什么 2026 年正是它变得划算的一年。

看不见的束身衣

每一个认真用过 OpenAI API 的开发者都熟悉这个瞬间:你想到一个能持续做点什么的智能体——每五分钟查看几条日志,每小时过一遍几个信息源,简单判断一封进来的邮件是否要紧。你在草稿纸上算了算每天的 token 成本,然后得出结论:在经济上不划算。这个智能体从来没被造出来。这个用例烟消云散。它不会出现在任何统计里,因为它从未存在过。

这是按 token 计费的经济模式最隐蔽、也最重要的后果:不是我们造出来的东西太贵——而是一整类东西从一开始就压根没被想到。我们把这层心理过滤器内化得太深,以至于「常开」(Always-On)架构根本不会在我们脑中冒出来。

具体来说,用 GPT-4o 的标价(输入 $2.50/1M,输出 $10/1M)、外加一个每次调用 500 输入 + 100 输出 token 的观察器来算:

Per call:      500 × $2.50/1M + 100 × $10/1M  =  $0.00225  (~0.2 ¢)
Per hour:      1,000 calls × $0.00225          =  $2.25
Per month:     720,000 calls × $0.00225        =  $1,620   ≈ €1,380

Five watchers: 5 × €1,380                      ≈ €6,900 / month

每个观察器将近 €1,400,五个组件约 €7,000——而这还是在智能体产出任何有用东西之前。每个开发者都会在脑子里把这笔账算一遍,看到这个数字,然后用例就地夭折。

做些工程优化,这个数字会降下来。批处理(每次调用 100 条而不是一条)、提示词缓存(固定前缀便宜 90%)、一个能过滤掉 95% 无关内容的前置筛选器、用 GPT-4o-mini 而不是 4o——同一个观察器现在落在 €30–80/月,五个组件 €200–500。已经能和你自己的 GPU 一较高下。但你为此花了一周做优化,得到的是一条横跨三个模型加一层缓存的脆弱流水线,而且每个新点子都得先在 token 预算面前为自己辩护。

这才是真正的关键:不在于绝对价格。关键在于成本这个问题彻底消失了。有了固定费用,没人会在加一个新 cron 任务之前问「这值得吗?」——就像没人会在加一条新的 cron 条目或者再挂一个 Prometheus 采集目标之前发问一样。那种心理上的无摩擦感才是真正的资产,而不是利润率。

这种自我审查是个新东西。在经典软件里我们没有它。没人会问自己每五分钟跑一个 cron 任务去检查磁盘用量「值不值」。cron 任务是免费的。免费到整整一代基础设施工具都建立在这样一个前提之上:持续观察不花钱。Prometheus、Datadog、Sentry,过去 15 年里的每一条日志流水线。想象一下,如果每次 Prometheus 采集都要花 €0.003,那就根本不会有监控这回事。

这正是今天 AI 所处的状态。

只有在「常开」下才成立的三类产品

只有当 AI 以固定费用、而不是按请求运行时,以下三类应用才在经济上、也在心理上变得可行:

1
观察器(Watchers)

持续观察外部信息源、只有在特定事件发生时才做出反应的智能体。一个盯着竞争对手价格变动的观察器。一个盯着小众市场监管更新的观察器。一个盯着出现某种特定语气的评价的观察器。今天人们用关键词过滤和正则来做这些事,因为每次检查都做语义理解太贵了。一旦理解变得免费,观察器就会比它所通知的那个人更聪明。

2
漂移检测器(Drift Detectors)

盯着你自己的数据,当某些东西发生了无法由代码改动解释的变化时就发出提示。一个每晚随机读 100 段客户对话、并在投诉模式发生位移时报告的智能体。一个每周走查你自己网站上的 SEO 文案、指出哪些说法已不再属实的智能体。一个盯着你代码库、在架构假设被逐渐侵蚀时发出提示的智能体。按 token 算贵得离谱,但效果是颠覆性的——因为它能在问题变成工单之前就把它找出来。

3
自主流水线(Autonomous Pipelines)

最激进的形态:在产品中你能接受容错的那一部分,让智能体无需人工审批就直接干活。我自己的机器人就是这么做的。每周两次,它把产品组合归成主题世界,生成描述、元数据、标签,挑一张主图,然后直接发布到生产数据库。状态:live。没有人工审核。万一出了岔子,一个生命周期任务反正会在两天后把这个世界归档掉。它之所以行得通,不是因为模型完美——而是因为成本结构让它能足够频繁地运行,使得错误能够自我修复。

把这三类串在一起的,是这一点:它们并不是「比今天的 AI 更好」。它们是另一种 AI。它不回答,它留意。它不被调用,它自己运行。它产出的不是每份输入对应一份输出,而是每一次世界状态的变化对应一份输出。这就是呼叫中心和看门人之间的区别。

我把这一类称为环境 AI——类比自 Mark Weiser 的普适计算(Ubiquitous Computing)(Xerox PARC,1988/1991),也就是计算机应该退到背景里、而不是在前台索取注意力这一理念。要点是一样的:当技术不再时时刻刻提醒你它的存在时,它反而更有用。

为什么是 2026——而不是早在 2024

要让环境 AI 变得划算,有三件事必须同时到位。这三件事都发生在过去十二个月里,而这个时间点并非巧合。

第一:消费级 GPU 上的混合专家(Mixture-of-Experts)。直到 2025 年初,「本地 LLM」要么意味着「明显不如 GPT-4」,要么意味着「需要一块你没有的 H100」。Gemma 4 26B-A4B 改变了这一点:总参数 260 亿,但得益于 MoE 架构,每次前向传播只激活约 38 亿。这个模型用起来像一个 4B 稠密模型——回答的质量却接近一个大得多的模型。用 Q4 量化后,它能塞进一块 NVIDIA L4 的 24 GB 里——而这块 GPU 在每一家超大规模云上,每小时不到一欧元就能用上。这是硬件门槛。

第二:带 MCP 的智能体运行时。直到 2025 年中,任何构建智能体的人都得自己解决那些连线工作:工具调用、对话状态、重试逻辑、鉴权、日志。有了 Model Context Protocol(Anthropic,2024 年末),以及像 OpenClaw 这类原生支持 MCP 的运行时,过去一个周末项目量级的活儿,如今几个小时就能搞定。你注册你的工具,用一份 JSON schema 描述它,智能体就能使用它。这是工程门槛。

第三:成本曲线已经打开。在一块利用率适中的 L4 上,Gemma 4 26B-A4B 的有效推理成本落在每百万 token 个位数低位美分的区间。通过 OpenRouter,同一个模型的价格大约是每百万输入 token $0.06、每百万输出 token $0.33。关键不在于相对于一条优化过的 API 流水线的绝对价格优势——取决于你优化得多狠,这个差距其实并不大。关键在于计费逻辑:从 GPU 已经在烧着的那一刻起,每一个额外请求都是免费的。不用调批处理,不用加缓存层,不用做分级路由。这是经济门槛——重点不在利润率,而在摩擦。

这三道门槛都在 2026 年、同时被跨过。在此之前,环境 AI 是一个想法。如今,它是一个配置细节。

来自机房的存在性证明

来一个我自己搭建的具体例子,因为抽象的论证什么都证明不了:

这里描述的这套系统,是与 Codify.ch 合作搭建的——一家瑞士的 GCP 咨询公司,他们提供了 GPU 硬件并搭好了云这一侧。要不是他们能拿到 L4 产能(尤其是在 2026 年 5 月那次全欧断货期间),要在十一天里把这个机器人推上生产是不可能的。

实际的硬件:

Machine Type   g2-standard-16  (16 vCPU, 64 GB RAM)
GPU            1× NVIDIA L4    (24 GB VRAM)
Disk           200 GB balanced persistent disk
OS             Ubuntu 22.04 LTS
Zone           us-east4-a   (fallback after EU-wide L4 stockout 2026-05-12)
Driver / CUDA  550.127.08 / 12.4.1
llama.cpp      master @ d13540be… (built with CUDA)
Model          gemma-4-26B-A4B-it-Q4_K_M.gguf  (26B total / 3.8B active)
Source         ggml-org/gemma-4-26B-A4B-it-GGUF  (official llama.cpp conversion)
Context        32k  (capped; model supports 256k natively, VRAM limit)
Runtime        OpenClaw v2026.5.7

说得更精确些:这是 Google 的原始模型,采用由 llama.cpp 社区维护的 GGUF 转换、并做了 Q4_K_M 量化——约 16 GB 而不是 BF16 的约 52 GB,在德语文本和工具调用上的表现完全一致,只有在纯数学上有一处可测量但很小的质量下降。没有这道量化,Gemma 4 26B-A4B 根本塞不进单块 24 GB 的 L4。

成本全貌(通过 Codify 叠加 SUD/CUD 折扣):

方案 € / 月
GCP g2-standard-16 + L4,Spot(europe-west4) ~220
GCP 按需,含 SUD + 1 年 CUD(通过 Codify) ~255
GCP 按需标价(最坏情况,无折扣) ~770

€255 这个数字并不是纯按需标价——没有持续使用折扣(Sustained-Use Discount)和承诺使用折扣(Committed-Use Discount),你会落在每月约 €770。这里 Codify 的费率起了作用,而这一点该摆到台面上说。

作个对比:一台专用的 Hetzner GPU 主机(GEX44),配一块 RTX 4000 SFF Ada(20 GB 显存),每月 约 €184——外加首月一次性约 €310 的安装费。对 Gemma 4 26B-A4B Q4_K_M 来说,20 GB 是勉强够用的边缘;上满 32k 上下文就会吃紧,在负载下有可能 OOM。如果你想要数据留在欧盟境内、又有余量的硬件,一台放在欧盟主机商的专用 L4 或 RTX-A5000 主机(约 24 GB)落在 约 €250–350/月 的区间。

诚实地算这笔账:一旦 GCP 在没有折扣的情况下运行,纯价格优势就消失了。优化过的 API 流水线(€200–500/月)和各种自托管方案(Hetzner 摊到 12 个月约 €210,一直到 GCP 标价约 €770)都落在同一个走廊里。自托管的卖点不靠利润率撑起来——它靠的是下一节要讲的东西:token 记账消失了。

最上面跑着 OpenClaw 作为智能体运行时,绑定到一个 Telegram 机器人 token。旁边跑着一个用 Python 写的自定义 MCP 服务器,向智能体暴露九个带类型的工具——所有工具都与我的 Firestore 数据库对话。属于真实用户的数据在离开 MCP 进程之前就会被假名化(SHA-256,取前 8 位,对每个用户稳定不变)。智能体永远看不到真实的鉴权 UID,但仍然能就「用户 A vs. 用户 B」进行推理。

剩下的活儿由三个 systemd 定时器完成:

06:00 UTC  →  scraper pulls 3 competitor feeds           [Watcher]
07:00 UTC  →  blog draft in house voice, status: 'draft' [Pipeline + Approval]
Mon + Thu 07:30 UTC  →  cluster portfolio into 5–10     [Pipeline, no review]
                         themed worlds, SEO metadata,
                         hero image, publish → Firestore

真正值得注意的不是这条流水线。真正值得注意的是,自 5 月 12 日切换区域以来,它一直无需进一步干预地运行着——而这让我在心理上得以问一个以前问不出口的问题:我的机器人接下来到底该做什么?一旦答案不再是「每尝试一次都要花钱」,而是「也许花一小时做工程,之后就免费运行」,整个局面就变了。过去一周我一直在琢磨那些我原本压根不会考虑的任务:每小时读一遍我的收件箱、把垃圾邮件信号分类。每晚检查一下我产品所依赖的开源库里新的 pull request 看起来是否容易引入回归。每个周日从 git 提交里替我起草每周站会。

这些任务没有一个是创新的。放在按 token 计费的账单上,这三件事都很荒谬。而作为一个环境 AI 功能,它们都不值一提。

说句实话,哪些没跑通,因为我不想给人留下这一切都顺风顺水的印象:

自托管并非没有摩擦。它是一种不一样的摩擦——是驱动而不是 token 预算,是 OOM 而不是速率限制,是区域故障切换而不是 API 宕机。任何声称这玩意儿免维护的人,都还没在生产里真正跑过它。

这对那些仍在按请求思考的公司意味着什么

今天一家公司在规划 AI 集成时,答案几乎总是同一套:一个聊天小组件、一个 copilot、一个搜索。全都是请求-响应。全都按请求扩展。全都困在那种站在前台、等着被注意的 AI 里。

我一直向客户抛出的那个让人不太舒服的问题:如果 AI 不再是每次请求花 €0.01,而是每月约 €250 的固定包月费——无论它运行多频繁——你的产品会去做什么?我得到的回答,从来不是又一个聊天功能。它们永远是那些人们盼了好多年、却从未真正规划的东西,因为在经济上说不通:

这些都不是什么高深的火箭科学。但没有一个在缺少「常开」架构的前提下是划算的。而且今天没有一个会被真正造出来,因为主流厂商的定价模型在概念阶段就把用例扼杀了。

这一周你就能造出来的东西

如果这个念头开始让你手痒,这里有一份诚实的 80/20 建议:

  1. 在任意一家超大规模云上租一块 L4 或 L40S 用一周。花的钱比一顿像样的晚餐还少。装好带 CUDA 的 llama.cpp,拉下 gemma-4-26b-a4b-q4_k_m,启动服务器。一小时的活儿。
  2. 在它旁边放一个智能体运行时(OpenClaw,或者你自己带 MCP 客户端的 Python 脚本)。把它绑到 Telegram、Slack 或 Signal。两小时。
  3. 写一个 cron 任务,让它每小时检查一件有意思的事,只有在有发现时才给你发消息。一小时。
  4. 观察你自己。不出两周,你就会丢掉那个按请求去思考 AI 的反射。这才是真正的改变。

环境 AI 不是一项技术。技术本身已经变得微不足道。环境 AI 是一种思维方式,而当经济壁垒倒下的那一刻,它就变得触手可及。那道壁垒在 2026 年倒下了。谁早一步用上它,谁就在构建那种「感觉会替你思考」、而不是干等着你发问的产品上,抢先了两年。


合作方与来源:

Codify.ch – GCP 搭建与硬件 Google – Gemma 4 文档 Google – Gemma 4 26B-A4B(原始模型) ggml-org – Gemma 4 26B-A4B GGUF Anthropic – MCP 规范 GCP – GPU 定价 Hetzner GEX44(RTX 4000 SFF Ada) OpenAI – API 定价 Mark Weiser – 普适计算

想知道对你的产品来说,「一个还不错的 cron 任务」和「一个真正有用的常开智能体」之间的界线落在哪里——以及一个诚实的工作量估算长什么样?我们聊聊。我帮人搭建能在真实项目里跑起来、而不只是做 demo 的环境 AI 系统。

NW
Nils WeiserAI 智能体专家 · 博登湖地区
与我合作 ▸

更多现场笔记

所有文章 ▸