Xinwei Xiong · 2026 年 7 月 15 日
10 分钟 · 4637 字 · | EN

当 AI Agent 开始反过来提示你,真正改变了什么

主动式 AI Agent 正从等待指令走向在合适时机提出建议。本文以持久记忆、隔离运行时与事件触发三块底座,拆解过夜工作流、打扰阈值和反馈指标,并区分主动提示与自主决策,说明高风险动作为何仍需人工确认。适合设计 Agent 产品、自动化流程或工作系统的人阅读,结论是:真正的护城河不是更敢开口,而是知道何时保持沉默。

当 AI Agent 开始反过来提示你,真正改变了什么

一个反直觉的信号:它开始反过来提示你

假设有一天,你打开工作台,Agent 没有等你输入下一条命令,而是先说:

我注意到昨天那份方案的第三节还没有收尾。我按你上周的口径起了一个草稿,现在要看吗?

你会觉得贴心,还是被冒犯?

过去半年,我在跟踪 Agent 产品、论文和一手发布时,反复看见同一个方向:一些产品开始尝试让 Agent 不必等待下一条指令。它读取用户许可范围内的上下文,估计什么值得处理,然后把建议送到人面前。

我的判断是,这不只是通知功能换了一层皮,而是一次值得认真观察的交互迁移:谁先开口,谁就在影响注意力流向。 但这仍是一项正在形成的产品能力,而不是已经被普遍解决的问题。

从“你命令它”到“它提示你”

我把 Agent 的交互方式压成三段:

命令行式              对话式                 主动式
   │                    │                      │
你给精确指令        你用自然语言表达意图      它读取授权上下文
   │                    │                      │
人负责全部判断      人给方向,机器补细节      它先提出判断
机器负责执行        仍由人发起                人接受或否决

命令行式要求人把意图翻译成机器语言。控制感很强,翻译成本也很高。

对话式把自然语言变成接口。门槛降低了,但 Agent 仍在等待你开口;你想不起调用它,它的能力就没有进入工作流。

主动式进一步移动了边界。它开始回答一个更上游的问题:此刻有什么事值得占用你的注意力?

命令行式对话式主动式
谁发起Agent
人的主要工作翻译意图、判断给出意图、验收授权、校准、否决
机器承担的判断几乎没有细节层什么可能值得现在处理
典型失败命令报错回答跑偏无谓打扰
失败何时结算立即立即持续且可能滞后

前两代产品在你不用时大多保持沉默。主动式系统即使在你没有打开对话框时,也可能继续观察事件、运行任务、决定要不要通知你。它的价值和风险由此同时出现:它节省注意力,也可能侵占注意力。

主动式成立,需要三块底座

每天固定时间问一句“今天有什么可以帮你的吗”,不是情境感知,只是闹钟。真正的主动式系统至少需要三块底座。

一、持久记忆:知道什么与你有关

只活在单次会话里的 Agent,不知道你昨天卡在哪里,也不知道哪些事已经被你明确放弃。它没有足够上下文判断今天什么值得提醒。

持久记忆不是简单保存聊天记录,而是让系统能在权限范围内保留目标、偏好、未决事项与反馈。记忆也必须能被纠正和遗忘,否则旧判断会变成新的噪声。关于个人情报系统的结构,我在超级个体的情报系统 里做过更完整的拆解。

二、Agent 运行时:在你离开后仍能安全工作

主动意味着 Agent 可能在你没有盯着它时运行。它需要隔离、持久、可观察的运行环境:代码和文件不能任意越界,任务关闭页面后不能随意丢失,失败必须留下可追踪的状态。

运行时的价值不是让 Agent “永不下线”,而是把后台工作放进一个有边界、有日志、能中止的容器。没有这层工程约束,所谓主动只是在放大无人看守时的风险。

三、事件触发:知道什么时候值得重新判断

邮件到达、PR 合并、日历临近、指标越界,这些事件可以唤醒 Agent。但有事件不等于该开口。完整链路至少包含四段:

事件发生 → 判断相关性 → 判断时机 → 提示或保持沉默

事件本身通常不难获取。更难的是相关性和时机:这件事是否与当前目标有关?即使有关,现在打断用户是否合适?

日历显示空闲,不代表一个人没有处在深度工作中。键盘活动、历史响应时间、日程状态可以提供线索,却都不等于真实心境。因此,主动式产品不能把 webhook 直接接到通知栏;中间那层“是否值得现在说”,才是产品的判断力。

三块底座是相乘关系。没有记忆,系统只能凭薄弱信号猜;没有运行时,它只能在对话框打开时存在;没有触发,它只剩轮询和定时提醒。任何一块缺失,完整的主动回路都站不起来。

截至 2026 年 7 月,产品真正验证了什么

公开的一手资料已经证明,定时与监测式工作流正在进入主流产品:

  • ChatGPT 的 Scheduled Tasks 支持一次性或周期性任务,也可以对特定变化进行检查并通知用户。
  • Codex Automations 可以按计划运行代码类工作流,并把结果放进供人审阅的队列。
  • Codex app 的公开说明同样展示了后台定时执行与完成后审阅的工作方式。

这些能力验证的是“任务可以在后台按条件运行,并把结果交还给人”。它们没有自动证明产品已经同时解决长期个性化记忆、对当前专注状态的准确判断,以及克制的打扰策略。

所以我不会把今天的定时任务包装成完整的主动式伙伴。更准确的说法是:底层零件已经开始产品化,真正困难的组合题仍在答题中。

它重写的是分工,不只是界面

对话式 Agent 帮你处理那些你已经决定要处理的信息。主动式 Agent 试图再往上游走一步:帮你判断哪些信息值得处理。

我一直相信,信息本身越来越不值钱,真正稀缺的是处理信息的能力。主动式产品若能过滤掉无关信号、排出正确顺序、提前完成可逆的准备工作,它节省的就不只是手上的操作,而是脑中的切换。

可问题也在这里。对话式产品答错一次,通常只毁掉一轮对话;主动式产品判断错一次,可能把一个本来完整的思考过程切断。主动权越往机器一侧移动,对“不开口”的要求就越高。

用过夜 Agent 当一个活体案例

我常用“过夜 Agent”来区分自动执行和主动判断。

传统做法是:睡前交代一批任务,第二天早上收到完成清单。Agent 把执行移到了夜里,但主动权仍在人这一侧,因为任务和优先级都是人先给出的。

理想的主动式做法是:Agent 从许可范围内的目标和未决事项中判断今天值得处理什么,夜里完成低风险准备,早上只交付一份短清单,并附上已经起好的草稿。

两者差别不在于谁更勤快。前者交付执行结果,后者试图交付“判断加半成品”,把人的工作压缩为验收、修改和否决。

但必须诚实:这个理想状态目前并不稳定。

Agent 可能读错上下文,也可能把优先级排反。每增加一个自动判断环节,误差就多一次累积机会。我在信息自动化的边界 里拆过这种复合误差:上游筛选稍微偏一点,下游总结再偏一点,最后得到的答案可能已经背离原问题。

主动式还面临冷启动。刚接入工作流的 Agent 对你了解很少,此时最应该克制,却往往最想通过频繁提示证明自己有用。它若在形成有效反馈前就被用户静音,后续再聪明也没有机会抵达用户。

打扰阈值:只保留一个可以校准的模型

把一次有用提示带来的收益记作 G,一次错误打扰造成的成本记作 C,把提示事后确实有用的概率记作 p。一次开口的期望价值可以写成:

E = p × G − (1 − p) × C

E > 0 时,提示才有正的期望价值。整理后,最小开口阈值是:

p* = C / (G + C)

这个式子比任何固定置信度都诚实。C 越高,Agent 越应该沉默;G 越高,它才有理由更积极。

举一个仅代表我个人工作习惯的假设:如果一条有用提示对我的主观价值记为 20,一次在深度工作中发生的错误打扰成本记为 40,那么阈值是:

p* = 40 / (20 + 40) = 2 / 3

这里的数值不是行业基准,更不是产品可以直接照抄的默认配置。换一个人、一个场景或一个通知渠道,GC 都会变化。团队需要用真实行为去估算:

  • 接受率:提示后,用户是否采纳建议或继续执行;
  • 静音率:用户是否关闭这个 Agent 或这个通知渠道;
  • 误报成本:用户把无用提示判定、关闭并重新进入原任务所付出的代价;
  • 时机反馈:这条提示是“没价值”,还是“有价值但时机不对”。

模型输出的 confidence 不能直接当成 p。真正可用的是事后校准过的命中率:它说该提醒的事情,有多少后来被用户证明值得提醒。阈值也不应该一次写死,而应按任务风险、用户状态和反馈持续校准。

信任还有非线性的一面。几次没有价值的打扰,可能让用户直接静音;一旦通道被关闭,后续提示再准确也无法产生价值。因此,主动式产品应把“保住沟通通道”放在“增加通知次数”之前。

我的下半年预测:标签先热,留存再给答案

下面两点是我的预测,不是已经发生的产品事实。

第一,我预计“主动式 Agent”会成为更拥挤的产品叙事。定时和监测功能已经可见,给一个普通通知系统换上 proactive 的名字并不困难。

第二,我预计留存数据会淘汰一批低估打扰成本的产品。它们把“能先开口”当作能力,却没有解决“是否应该现在开口”。

这项预测应该接受指标检验,而不是靠声量自证:

  • 用户是否持续保留通知权限,还是很快静音;
  • 提示的接受率是否随着使用时间上升;
  • 同类误报的成本是否下降;
  • 用户标记“时机不对”后,系统是否真的学会换一个时刻;
  • 低价值通知减少时,任务完成率是否仍能保持。

如果这些指标没有改善,所谓主动只是更会制造信息瀑布。我的判断是:主动式的护城河不在于敢不敢说,而在于能不能靠记忆、触发策略、时机信号和反馈回路,挣到打扰用户的资格。

主动提示不等于自主决策

主动和自主是两个维度。主动讨论的是“谁先发起”,自主讨论的是“谁作最终决定”。一个系统可以积极地扫描、分析和起草,同时在真正执行前保持克制。

下面是我用于个人和团队工作流的安全策略,不是行业统一定律:

风险级别例子默认策略
低风险、可撤销整理资料、生成草稿、建立待办可自动执行,保留日志与撤销能力
中风险、影响他人创建会议邀请草稿、准备发布内容、修改共享文档先预览,明确确认后执行
高风险或不可逆发出邮件、转账、删除记录、修改生产配置必须经过 HITL 人工确认,并设置权限边界

这里的核心不是给所有动作贴一张永恒不变的标签,而是根据可逆性、影响范围和补救成本分级。对高风险动作,我选择让系统停在门前:Agent 可以收集证据、提出选项、生成草稿,但最后一步必须由人打开。

这就是我常说的:安全长在 harness 里,而不是长在模型的自觉里。 约束需要由权限、审批、隔离、日志和回滚共同实现,而不是寄希望于模型每次都“知道分寸”。关于无人看守 Agent 如何逐层建立信任,我在如何信任无人看守的 AI Agent 里有更完整的讨论。

落地时,我会检查这七件事

如果要设计或选择一个主动式 Agent,我会按顺序检查:

  1. 默认保持沉默。 信号先进入过滤器,只有满足明确条件时才升级为提示。
  2. 记录事后命中率。 不把模型自报的置信度当真,用用户是否采纳来校准 p
  3. 从保守阈值开始。 初始值只是产品假设,根据真实的 GC 和反馈调整。
  4. 把“现在能否被打断”设为一等信号。 日程、活动状态和历史响应模式都只能辅助,不能被当成确定答案。
  5. 按紧急程度分层。 可批量汇总的进入摘要,需要及时处理的才提示,真正紧急的才允许强打断。
  6. 让反馈足够便宜。 至少区分“没价值”和“有价值但不是现在”,分别校准相关性与时机。
  7. 按风险决定人工门禁。 低风险动作允许自动化,高风险或不可逆动作必须停在 HITL 之前。

反过来看,一个产品若只是定时问候、把 webhook 原样转发、在不了解用户时频繁建议、只追求通知数量,或者把“主动”偷换成“未经确认就执行”,它都没有解决真正的问题。

判断标准可以压成一句话:看团队有没有认真做过“让系统闭嘴”的工程。

结语:从等你说话,到理解你没有说出口的部分

命令行、对话、主动式,像是一条机器逐渐理解人的曲线。最初,它只能理解你精确写下的命令;后来,它可以理解自然语言表达的意图;到了主动式,它还要尝试理解你没有说出口、却可能正在影响工作的那部分。

这既令人期待,也值得警惕。系统越了解你,它正确判断时越能节省注意力;判断偏斜时,也越可能把偏差送到离你更近的地方。

所以我对主动式 Agent 的态度是乐观,但保留距离。产品会越来越会说,真正稀缺的能力仍是知道什么时候不说。对用户而言,最后一道护城河也不是 Agent 替你生成了多少判断,而是你仍然能够决定:这一次,我是否应该相信它。

Sources

产品信息核对日期为 2026-07-31。文中的交互范式、打扰模型、安全分级与下半年预测均为作者分析,不代表上述来源的结论。

读者回响

加入讨论

新文章写好,先寄给你

每有新文章,寄一封信到你的邮箱。双重确认,随时退订。