一个反直觉的信号:它开始反过来提示你
假设有一天,你打开工作台,Agent 没有等你输入下一条命令,而是先说:
我注意到昨天那份方案的第三节还没有收尾。我按你上周的口径起了一个草稿,现在要看吗?
你会觉得贴心,还是被冒犯?
过去半年,我在跟踪 Agent 产品、论文和一手发布时,反复看见同一个方向:一些产品开始尝试让 Agent 不必等待下一条指令。它读取用户许可范围内的上下文,估计什么值得处理,然后把建议送到人面前。
我的判断是,这不只是通知功能换了一层皮,而是一次值得认真观察的交互迁移:谁先开口,谁就在影响注意力流向。 但这仍是一项正在形成的产品能力,而不是已经被普遍解决的问题。
从“你命令它”到“它提示你”
我把 Agent 的交互方式压成三段:
命令行式 对话式 主动式
│ │ │
你给精确指令 你用自然语言表达意图 它读取授权上下文
│ │ │
人负责全部判断 人给方向,机器补细节 它先提出判断
机器负责执行 仍由人发起 人接受或否决
命令行式要求人把意图翻译成机器语言。控制感很强,翻译成本也很高。
对话式把自然语言变成接口。门槛降低了,但 Agent 仍在等待你开口;你想不起调用它,它的能力就没有进入工作流。
主动式进一步移动了边界。它开始回答一个更上游的问题:此刻有什么事值得占用你的注意力?
| 命令行式 | 对话式 | 主动式 | |
|---|---|---|---|
| 谁发起 | 人 | 人 | Agent |
| 人的主要工作 | 翻译意图、判断 | 给出意图、验收 | 授权、校准、否决 |
| 机器承担的判断 | 几乎没有 | 细节层 | 什么可能值得现在处理 |
| 典型失败 | 命令报错 | 回答跑偏 | 无谓打扰 |
| 失败何时结算 | 立即 | 立即 | 持续且可能滞后 |
前两代产品在你不用时大多保持沉默。主动式系统即使在你没有打开对话框时,也可能继续观察事件、运行任务、决定要不要通知你。它的价值和风险由此同时出现:它节省注意力,也可能侵占注意力。
主动式成立,需要三块底座
每天固定时间问一句“今天有什么可以帮你的吗”,不是情境感知,只是闹钟。真正的主动式系统至少需要三块底座。
一、持久记忆:知道什么与你有关
只活在单次会话里的 Agent,不知道你昨天卡在哪里,也不知道哪些事已经被你明确放弃。它没有足够上下文判断今天什么值得提醒。
持久记忆不是简单保存聊天记录,而是让系统能在权限范围内保留目标、偏好、未决事项与反馈。记忆也必须能被纠正和遗忘,否则旧判断会变成新的噪声。关于个人情报系统的结构,我在超级个体的情报系统 里做过更完整的拆解。
二、Agent 运行时:在你离开后仍能安全工作
主动意味着 Agent 可能在你没有盯着它时运行。它需要隔离、持久、可观察的运行环境:代码和文件不能任意越界,任务关闭页面后不能随意丢失,失败必须留下可追踪的状态。
运行时的价值不是让 Agent “永不下线”,而是把后台工作放进一个有边界、有日志、能中止的容器。没有这层工程约束,所谓主动只是在放大无人看守时的风险。
三、事件触发:知道什么时候值得重新判断
邮件到达、PR 合并、日历临近、指标越界,这些事件可以唤醒 Agent。但有事件不等于该开口。完整链路至少包含四段:
事件发生 → 判断相关性 → 判断时机 → 提示或保持沉默
事件本身通常不难获取。更难的是相关性和时机:这件事是否与当前目标有关?即使有关,现在打断用户是否合适?
日历显示空闲,不代表一个人没有处在深度工作中。键盘活动、历史响应时间、日程状态可以提供线索,却都不等于真实心境。因此,主动式产品不能把 webhook 直接接到通知栏;中间那层“是否值得现在说”,才是产品的判断力。
三块底座是相乘关系。没有记忆,系统只能凭薄弱信号猜;没有运行时,它只能在对话框打开时存在;没有触发,它只剩轮询和定时提醒。任何一块缺失,完整的主动回路都站不起来。
截至 2026 年 7 月,产品真正验证了什么
公开的一手资料已经证明,定时与监测式工作流正在进入主流产品:
- ChatGPT 的 Scheduled Tasks 支持一次性或周期性任务,也可以对特定变化进行检查并通知用户。
- Codex Automations 可以按计划运行代码类工作流,并把结果放进供人审阅的队列。
- Codex app 的公开说明同样展示了后台定时执行与完成后审阅的工作方式。
这些能力验证的是“任务可以在后台按条件运行,并把结果交还给人”。它们没有自动证明产品已经同时解决长期个性化记忆、对当前专注状态的准确判断,以及克制的打扰策略。
所以我不会把今天的定时任务包装成完整的主动式伙伴。更准确的说法是:底层零件已经开始产品化,真正困难的组合题仍在答题中。
它重写的是分工,不只是界面
对话式 Agent 帮你处理那些你已经决定要处理的信息。主动式 Agent 试图再往上游走一步:帮你判断哪些信息值得处理。
我一直相信,信息本身越来越不值钱,真正稀缺的是处理信息的能力。主动式产品若能过滤掉无关信号、排出正确顺序、提前完成可逆的准备工作,它节省的就不只是手上的操作,而是脑中的切换。
可问题也在这里。对话式产品答错一次,通常只毁掉一轮对话;主动式产品判断错一次,可能把一个本来完整的思考过程切断。主动权越往机器一侧移动,对“不开口”的要求就越高。
用过夜 Agent 当一个活体案例
我常用“过夜 Agent”来区分自动执行和主动判断。
传统做法是:睡前交代一批任务,第二天早上收到完成清单。Agent 把执行移到了夜里,但主动权仍在人这一侧,因为任务和优先级都是人先给出的。
理想的主动式做法是:Agent 从许可范围内的目标和未决事项中判断今天值得处理什么,夜里完成低风险准备,早上只交付一份短清单,并附上已经起好的草稿。
两者差别不在于谁更勤快。前者交付执行结果,后者试图交付“判断加半成品”,把人的工作压缩为验收、修改和否决。
但必须诚实:这个理想状态目前并不稳定。
Agent 可能读错上下文,也可能把优先级排反。每增加一个自动判断环节,误差就多一次累积机会。我在信息自动化的边界 里拆过这种复合误差:上游筛选稍微偏一点,下游总结再偏一点,最后得到的答案可能已经背离原问题。
主动式还面临冷启动。刚接入工作流的 Agent 对你了解很少,此时最应该克制,却往往最想通过频繁提示证明自己有用。它若在形成有效反馈前就被用户静音,后续再聪明也没有机会抵达用户。
打扰阈值:只保留一个可以校准的模型
把一次有用提示带来的收益记作 G,一次错误打扰造成的成本记作 C,把提示事后确实有用的概率记作 p。一次开口的期望价值可以写成:
E = p × G − (1 − p) × C
当 E > 0 时,提示才有正的期望价值。整理后,最小开口阈值是:
p* = C / (G + C)
这个式子比任何固定置信度都诚实。C 越高,Agent 越应该沉默;G 越高,它才有理由更积极。
举一个仅代表我个人工作习惯的假设:如果一条有用提示对我的主观价值记为 20,一次在深度工作中发生的错误打扰成本记为 40,那么阈值是:
p* = 40 / (20 + 40) = 2 / 3
这里的数值不是行业基准,更不是产品可以直接照抄的默认配置。换一个人、一个场景或一个通知渠道,G 和 C 都会变化。团队需要用真实行为去估算:
- 接受率:提示后,用户是否采纳建议或继续执行;
- 静音率:用户是否关闭这个 Agent 或这个通知渠道;
- 误报成本:用户把无用提示判定、关闭并重新进入原任务所付出的代价;
- 时机反馈:这条提示是“没价值”,还是“有价值但时机不对”。
模型输出的 confidence 不能直接当成 p。真正可用的是事后校准过的命中率:它说该提醒的事情,有多少后来被用户证明值得提醒。阈值也不应该一次写死,而应按任务风险、用户状态和反馈持续校准。
信任还有非线性的一面。几次没有价值的打扰,可能让用户直接静音;一旦通道被关闭,后续提示再准确也无法产生价值。因此,主动式产品应把“保住沟通通道”放在“增加通知次数”之前。
我的下半年预测:标签先热,留存再给答案
下面两点是我的预测,不是已经发生的产品事实。
第一,我预计“主动式 Agent”会成为更拥挤的产品叙事。定时和监测功能已经可见,给一个普通通知系统换上 proactive 的名字并不困难。
第二,我预计留存数据会淘汰一批低估打扰成本的产品。它们把“能先开口”当作能力,却没有解决“是否应该现在开口”。
这项预测应该接受指标检验,而不是靠声量自证:
- 用户是否持续保留通知权限,还是很快静音;
- 提示的接受率是否随着使用时间上升;
- 同类误报的成本是否下降;
- 用户标记“时机不对”后,系统是否真的学会换一个时刻;
- 低价值通知减少时,任务完成率是否仍能保持。
如果这些指标没有改善,所谓主动只是更会制造信息瀑布。我的判断是:主动式的护城河不在于敢不敢说,而在于能不能靠记忆、触发策略、时机信号和反馈回路,挣到打扰用户的资格。
主动提示不等于自主决策
主动和自主是两个维度。主动讨论的是“谁先发起”,自主讨论的是“谁作最终决定”。一个系统可以积极地扫描、分析和起草,同时在真正执行前保持克制。
下面是我用于个人和团队工作流的安全策略,不是行业统一定律:
| 风险级别 | 例子 | 默认策略 |
|---|---|---|
| 低风险、可撤销 | 整理资料、生成草稿、建立待办 | 可自动执行,保留日志与撤销能力 |
| 中风险、影响他人 | 创建会议邀请草稿、准备发布内容、修改共享文档 | 先预览,明确确认后执行 |
| 高风险或不可逆 | 发出邮件、转账、删除记录、修改生产配置 | 必须经过 HITL 人工确认,并设置权限边界 |
这里的核心不是给所有动作贴一张永恒不变的标签,而是根据可逆性、影响范围和补救成本分级。对高风险动作,我选择让系统停在门前:Agent 可以收集证据、提出选项、生成草稿,但最后一步必须由人打开。
这就是我常说的:安全长在 harness 里,而不是长在模型的自觉里。 约束需要由权限、审批、隔离、日志和回滚共同实现,而不是寄希望于模型每次都“知道分寸”。关于无人看守 Agent 如何逐层建立信任,我在如何信任无人看守的 AI Agent 里有更完整的讨论。
落地时,我会检查这七件事
如果要设计或选择一个主动式 Agent,我会按顺序检查:
- 默认保持沉默。 信号先进入过滤器,只有满足明确条件时才升级为提示。
- 记录事后命中率。 不把模型自报的置信度当真,用用户是否采纳来校准
p。 - 从保守阈值开始。 初始值只是产品假设,根据真实的
G、C和反馈调整。 - 把“现在能否被打断”设为一等信号。 日程、活动状态和历史响应模式都只能辅助,不能被当成确定答案。
- 按紧急程度分层。 可批量汇总的进入摘要,需要及时处理的才提示,真正紧急的才允许强打断。
- 让反馈足够便宜。 至少区分“没价值”和“有价值但不是现在”,分别校准相关性与时机。
- 按风险决定人工门禁。 低风险动作允许自动化,高风险或不可逆动作必须停在 HITL 之前。
反过来看,一个产品若只是定时问候、把 webhook 原样转发、在不了解用户时频繁建议、只追求通知数量,或者把“主动”偷换成“未经确认就执行”,它都没有解决真正的问题。
判断标准可以压成一句话:看团队有没有认真做过“让系统闭嘴”的工程。
结语:从等你说话,到理解你没有说出口的部分
命令行、对话、主动式,像是一条机器逐渐理解人的曲线。最初,它只能理解你精确写下的命令;后来,它可以理解自然语言表达的意图;到了主动式,它还要尝试理解你没有说出口、却可能正在影响工作的那部分。
这既令人期待,也值得警惕。系统越了解你,它正确判断时越能节省注意力;判断偏斜时,也越可能把偏差送到离你更近的地方。
所以我对主动式 Agent 的态度是乐观,但保留距离。产品会越来越会说,真正稀缺的能力仍是知道什么时候不说。对用户而言,最后一道护城河也不是 Agent 替你生成了多少判断,而是你仍然能够决定:这一次,我是否应该相信它。
Sources
- OpenAI Academy:Codex Automations :说明 Codex 工作可按计划重复运行,并把结果交给用户审阅。
- OpenAI Help Center:Scheduled Tasks in ChatGPT :说明一次性与周期性任务、变化监测、通知及当前产品限制。
- OpenAI:Introducing the Codex app :介绍后台定时自动化与任务完成后的审阅队列。
产品信息核对日期为 2026-07-31。文中的交互范式、打扰模型、安全分级与下半年预测均为作者分析,不代表上述来源的结论。





读者回响