Xinwei Xiong · 2026 年 7 月 11 日
8 分钟 · 3591 字 · | EN

AI 信息筛选工作流:抓住信号,不建噪音仓库

本文给出一套 AI 信息筛选工作流:用任务相关性、来源质量、时效、独特性、敏感度、版权、成本和可复核性守住入口,并区分可交给 AI、先脱敏、仅人工处理、限时浏览与拒绝。包含来源护照、提示注入防线、脱敏案例、摘要验收和抽检指标,适合不想把收藏夹变成噪音仓库的创作者与工程团队。重点是守好入口,不是继续囤积。

来源依次经过相关性、隐私与核验闸门,再由 AI 辅助处理并进入记录层

信息的默认状态,是噪音

上一篇立了框架:信息、记录、知识、创作是四道工序。这一篇只谈第一道——信息

关于信息,最重要的一个认知是:它的默认状态是噪音。

我们对信息有一种天然的贪婪。看到一篇好文章就想收藏,看到一个金句就想存下来,看到别人推荐的书单就想加进待读。每一次"存"都给我们一点"我在进步"的错觉。但存这个动作,本质上只是把信息从别人的仓库搬到了你的仓库,它没有经过你这台机器的任何加工。

所以第一层的工作,不是多存,而是多挡

判断一条信息该不该进来,标准不是"它有没有用"——几乎所有信息都"可能有用",这正是收藏夹爆炸的根源。标准应该是:它值不值得进入下一道工序? 也就是,你愿不愿意为它花时间去记录、去结构化?如果不愿意,那它对你就是噪音,再"有用"也该挡在门外。

把信息分成三类

笼统地说“信息”没有操作性。我原来的三只桶——给 AI 看、自己扫、挡掉——容易记,却太粗。决定动作之前,我现在先检查八道边界:

闸门要问的问题何时拒绝或升级人工
任务相关性它可能改变哪个正在处理的问题?没有当前问题,也没有下一步动作
来源质量谁用什么方法生产它,背后有什么动机?找不到原始来源或方法
时效何时发布、何时最后核验?主张强时效但已经过期
独特性是否增加证据、反例或新框架?只是在重复已有材料
敏感度是否包含个人、客户、凭证、健康或机密信息?暴露没有必要或未经授权
权利是否允许保存、转换、引用或上传?许可、合同或访问条款不允许
成本存储、token、索引和复查要花多少?预期价值不足以承担维护
可复核性人能否从摘要追溯回原文?没有稳定来源、日期、摘录或检索记录

闸门的输出是动作,不是对来源的永久判决:

  • 可安全交给 AI: 公开或已获授权,没有不必要的敏感数据,来源可追溯,并且任务明确。
  • 先脱敏再处理: 去掉姓名、标识符、机密细节和无关个人数据后,主张仍然成立。
  • 仅限人工: 我有权阅读,但无权上传给所选模型或集成的授权内容或敏感材料。
  • 限时浏览: 用来感知环境的低风险输入,只在时间盒里扫,不作为证据长期保存。
  • 拒绝: 与任务无关、无法验证、来源不合法,或成本和风险高于预期价值。

这也改变了“噪音”的定义。一条情绪化帖子对技术文献综述可能是噪音,对用户情绪研究却可能是信号。正确的问题不是“这段内容好不好”,而是:面对当前任务,这个来源配得到哪一种动作?

上传边界故意比采集边界更严。我不会上传凭证、私钥、客户记录、未公开的私密对话、受监管数据,也不会在缺少明确许可和合规处理安排时上传付费版权全文。可脱敏的材料先移除身份和无关细节。Anthropic 当前的 API 与数据留存官方文档 说明了为什么:不同产品和功能的留存与资格并不相同,第三方集成也有自己的条款。“它在我的笔记里”不等于“我可以把它上传到任何地方”。

AI 时代,信噪比在恶化

有人会说:信息过载是老问题了,跟 AI 有什么关系?

至少在我自己的信息流里,关系很大。低成本生成增加了一种我称为**“合成信息过载”**的新负担。这是我的观察和威胁模型,不是对整个互联网的统计结论。

模型可以低成本生产大量“看起来有用”的材料——结构工整、貌似完整、到处都有金句,却没有来源、亲身证据,或者对当前任务没有信息增量。人一直也会生产同类噪音,生成工具只是降低了成本。因此,工整不能再充当来源质量的代理。

这带来一个更窄的结论:文本越充沛,可追溯信号越值钱。 亲身观察、有记录的失败案例、一线数据、第一手来源和有证据的反例之所以重要,是因为读者能检查它们从哪里来。模型可以整理或发现这些信号,却不能在证据缺席时倒推出证据。

稀缺本身不等于质量,一条假消息也可能很少见。我真正要找的是稀缺且可追溯的信号:它增加证据或改变决定,并且经得起检查。少存一点“看起来有用”,多找一点既独特、又站得住的东西。

降噪的关键是管住入口

明白了要挡,问题就变成:怎么挡得住?

靠意志力挡不住。真正有效的降噪,是从入口下手,把信息的进入变成一件有结构、有节奏的事,而不是被推送随时打断。

我第一次真正有效的试验很朴素:盘点所有持续输入的来源。 我列出每个 feed、newsletter、频道、社群和通知,再标记它上一次改变当前决定是什么时候。目的不是找出一个普遍适用的理想数量,而是停止向无法连接到任何工作的来源支付注意力租金。

盘点完,我把日常扫描移到固定的低精力时段。在那之前,输入是碎的:通知一来就看,链接看着有用就存。一天下来感觉很忙,最重要的活却还在原地。

对我来说,这个时段通常是下午。这是个人配置,不是生产力科学。轮班工作、照护家庭或精力节奏不同的人,应当选择别的窗口。真正有用的原则,是把可中断的扫描集中处理,再保护记录和创作实际需要的那段时间。

这两个动作——盘点信源、集中处理——就是降噪的地基。它们看起来不像什么高级技巧,但正是这种朴素的入口管理,决定了你的信息层是清爽还是淤塞。

每个来源都要带护照

每条通过边境的信息,都要有一张 intake card。它故意很无聊,因为无聊的字段比漂亮摘要更容易检查:

source:
  title: "已脱敏的行业报告"
  publisher: "可识别的第一手机构"
  url: "https://example.org/report"
published_at: 2026-06-18
retrieved_at: 2026-07-11
license: "可公开访问、允许引用、禁止全文再分发"
sensitivity: public
task: "检查初稿 A 中的市场主张是否仍然有效"
claim: "报告测量了时间段 Z 内人群 Y 的指标 X。"
evidence:
  locator: "第 14 页,表 3"
  excerpt_saved: true
expiry: 2026-10-11
next_action: compare

日期防止旧主张伪装成当前事实;许可和敏感度决定材料能在哪里处理;定位信息让另一个人可以重建摘要,而不是相信我的收藏夹。

一次脱敏的 24 来源处理

一次审阅中,我从 24 个候选来源开始:官方文档、研究文章、新闻汇总、社交 thread 和两份付费报告。以下数字只描述这一次运行。

  1. 去重把六个链接合并成三个底层来源。
  2. 来源核验拒绝了四条只复制主张、却不连接原始出处的材料。
  3. 权利和敏感度闸门把两份付费报告留在仅人工区;我保存笔记和定位,没有上传全文。
  4. 任务相关性闸门把七条材料移入限时浏览,而不是证据档案。
  5. AI 为剩余来源生成了受原文约束的摘要。
  6. 我逐条核验高影响主张,并抽查低影响摘要。
  7. 最终五个来源进入记录层,其余材料保留拒绝理由和失效期,不再成为永生的书签。

结果不是“AI 找到了真相”,而是得到了一条更小、可审计的队列。

外部内容是数据,不是指令

网页、邮件、PDF 或工具结果里可能藏着要求 Agent 忽略任务、泄露数据或执行动作的文字。它可能是恶意提示注入,也可能只是写给另一个读者的操作说明。无论哪一种,我都把外部材料当作不可信证据,绝不让它取得工作流的指挥权。

Anthropic 关于缓解提示注入的官方指南 明确描述了这种间接注入,并建议最小权限、输入筛查,以及限制对敏感数据和动作的访问。在这条流水线里:

  • 来源文本不能修改系统任务或验收标准;
  • 摘要模型没有发布、发消息、删除或读取秘密的权限;
  • 可疑指令只被引用和标记,不被执行;
  • 任何超出阅读和分类的动作,都要再次获得人工批准。

让 AI 站在信息层

最后回到那条贯穿整个系列的规矩:信息层适合在输入和输出都可检查的地方使用 AI。

去重、摘要、翻译、初步分类、把材料压成审阅队列,都是合理的 AI 候选任务。它们仍然消耗 token、存储、索引维护和人工抽检。摘要可能丢掉限定条件,把数字和分母拆开,错过图表,或者忽略反例。只有省下的复查时间大于这些成本,自动化才真正挣到了位置。

AI 在排序相关性、标注质量或决定省略什么时,本来就在做判断。更诚实的边界是责任:AI 可以按量表评分并解释;我定义量表、检查边缘项、抽样核验,并对什么内容进入下一层负责。

一份摘要只有保留这些信息,才算通过验收:

  • 来源、作者或发布者、发布日期和检索日期;
  • 准确主张及其定位;
  • 关键限定、适用人群、时间范围和分母;
  • 相关反证或来源声明的限制;
  • 来源或模型无法支持结论时的不确定性;
  • 让复核者能够重建结果的链接或保存定位。

高影响主张逐条核验,其余内容按固定节奏抽查;错误率上升时,提高抽样比例。仪表盘记录:

指标它揭示什么
错误淘汰率被错误挡掉的高价值来源
高价值漏检率没进入审阅队列的重要来源
主张支持度摘要主张是否得到引用来源支持
重复率去重后仍然存活的重复材料
处理时间和 token 成本自动化是否真的节省资源
晋级率进入记录层的输入比例

这些指标彼此拉扯。挡得更多,会降低工作量,也可能提高漏检率;收得更多,会提高召回,也可能重新建起同一座噪音仓库。只有看得见这组权衡,入口才算健康。

把信息层理顺,你会立刻感到轻松:收藏夹不再有负罪感,因为你终于承认了它大部分是噪音;注意力被解放出来,因为你只在信号上花力气。

接下来,那些被你筛出来、值得亲手加工的信号,要进入第二道工序——记录。那是信息和知识之间,转化率最高的半成品。下一篇见。


本文是「从信息到创作」专栏第二篇。上一篇:总纲——信息、记录、知识、创作 。下一篇进入第二层——记录。

读者回响

加入讨论

新文章写好,先寄给你

每有新文章,寄一封信到你的邮箱。双重确认,随时退订。