信息的默认状态,是噪音
上一篇立了框架:信息、记录、知识、创作是四道工序。这一篇只谈第一道——信息。
关于信息,最重要的一个认知是:它的默认状态是噪音。
我们对信息有一种天然的贪婪。看到一篇好文章就想收藏,看到一个金句就想存下来,看到别人推荐的书单就想加进待读。每一次"存"都给我们一点"我在进步"的错觉。但存这个动作,本质上只是把信息从别人的仓库搬到了你的仓库,它没有经过你这台机器的任何加工。
所以第一层的工作,不是多存,而是多挡。
判断一条信息该不该进来,标准不是"它有没有用"——几乎所有信息都"可能有用",这正是收藏夹爆炸的根源。标准应该是:它值不值得进入下一道工序? 也就是,你愿不愿意为它花时间去记录、去结构化?如果不愿意,那它对你就是噪音,再"有用"也该挡在门外。
把信息分成三类
笼统地说“信息”没有操作性。我原来的三只桶——给 AI 看、自己扫、挡掉——容易记,却太粗。决定动作之前,我现在先检查八道边界:
| 闸门 | 要问的问题 | 何时拒绝或升级人工 |
|---|---|---|
| 任务相关性 | 它可能改变哪个正在处理的问题? | 没有当前问题,也没有下一步动作 |
| 来源质量 | 谁用什么方法生产它,背后有什么动机? | 找不到原始来源或方法 |
| 时效 | 何时发布、何时最后核验? | 主张强时效但已经过期 |
| 独特性 | 是否增加证据、反例或新框架? | 只是在重复已有材料 |
| 敏感度 | 是否包含个人、客户、凭证、健康或机密信息? | 暴露没有必要或未经授权 |
| 权利 | 是否允许保存、转换、引用或上传? | 许可、合同或访问条款不允许 |
| 成本 | 存储、token、索引和复查要花多少? | 预期价值不足以承担维护 |
| 可复核性 | 人能否从摘要追溯回原文? | 没有稳定来源、日期、摘录或检索记录 |
闸门的输出是动作,不是对来源的永久判决:
- 可安全交给 AI: 公开或已获授权,没有不必要的敏感数据,来源可追溯,并且任务明确。
- 先脱敏再处理: 去掉姓名、标识符、机密细节和无关个人数据后,主张仍然成立。
- 仅限人工: 我有权阅读,但无权上传给所选模型或集成的授权内容或敏感材料。
- 限时浏览: 用来感知环境的低风险输入,只在时间盒里扫,不作为证据长期保存。
- 拒绝: 与任务无关、无法验证、来源不合法,或成本和风险高于预期价值。
这也改变了“噪音”的定义。一条情绪化帖子对技术文献综述可能是噪音,对用户情绪研究却可能是信号。正确的问题不是“这段内容好不好”,而是:面对当前任务,这个来源配得到哪一种动作?
上传边界故意比采集边界更严。我不会上传凭证、私钥、客户记录、未公开的私密对话、受监管数据,也不会在缺少明确许可和合规处理安排时上传付费版权全文。可脱敏的材料先移除身份和无关细节。Anthropic 当前的 API 与数据留存官方文档 说明了为什么:不同产品和功能的留存与资格并不相同,第三方集成也有自己的条款。“它在我的笔记里”不等于“我可以把它上传到任何地方”。
AI 时代,信噪比在恶化
有人会说:信息过载是老问题了,跟 AI 有什么关系?
至少在我自己的信息流里,关系很大。低成本生成增加了一种我称为**“合成信息过载”**的新负担。这是我的观察和威胁模型,不是对整个互联网的统计结论。
模型可以低成本生产大量“看起来有用”的材料——结构工整、貌似完整、到处都有金句,却没有来源、亲身证据,或者对当前任务没有信息增量。人一直也会生产同类噪音,生成工具只是降低了成本。因此,工整不能再充当来源质量的代理。
这带来一个更窄的结论:文本越充沛,可追溯信号越值钱。 亲身观察、有记录的失败案例、一线数据、第一手来源和有证据的反例之所以重要,是因为读者能检查它们从哪里来。模型可以整理或发现这些信号,却不能在证据缺席时倒推出证据。
稀缺本身不等于质量,一条假消息也可能很少见。我真正要找的是稀缺且可追溯的信号:它增加证据或改变决定,并且经得起检查。少存一点“看起来有用”,多找一点既独特、又站得住的东西。
降噪的关键是管住入口
明白了要挡,问题就变成:怎么挡得住?
靠意志力挡不住。真正有效的降噪,是从入口下手,把信息的进入变成一件有结构、有节奏的事,而不是被推送随时打断。
我第一次真正有效的试验很朴素:盘点所有持续输入的来源。 我列出每个 feed、newsletter、频道、社群和通知,再标记它上一次改变当前决定是什么时候。目的不是找出一个普遍适用的理想数量,而是停止向无法连接到任何工作的来源支付注意力租金。
盘点完,我把日常扫描移到固定的低精力时段。在那之前,输入是碎的:通知一来就看,链接看着有用就存。一天下来感觉很忙,最重要的活却还在原地。
对我来说,这个时段通常是下午。这是个人配置,不是生产力科学。轮班工作、照护家庭或精力节奏不同的人,应当选择别的窗口。真正有用的原则,是把可中断的扫描集中处理,再保护记录和创作实际需要的那段时间。
这两个动作——盘点信源、集中处理——就是降噪的地基。它们看起来不像什么高级技巧,但正是这种朴素的入口管理,决定了你的信息层是清爽还是淤塞。
每个来源都要带护照
每条通过边境的信息,都要有一张 intake card。它故意很无聊,因为无聊的字段比漂亮摘要更容易检查:
source:
title: "已脱敏的行业报告"
publisher: "可识别的第一手机构"
url: "https://example.org/report"
published_at: 2026-06-18
retrieved_at: 2026-07-11
license: "可公开访问、允许引用、禁止全文再分发"
sensitivity: public
task: "检查初稿 A 中的市场主张是否仍然有效"
claim: "报告测量了时间段 Z 内人群 Y 的指标 X。"
evidence:
locator: "第 14 页,表 3"
excerpt_saved: true
expiry: 2026-10-11
next_action: compare
日期防止旧主张伪装成当前事实;许可和敏感度决定材料能在哪里处理;定位信息让另一个人可以重建摘要,而不是相信我的收藏夹。
一次脱敏的 24 来源处理
一次审阅中,我从 24 个候选来源开始:官方文档、研究文章、新闻汇总、社交 thread 和两份付费报告。以下数字只描述这一次运行。
- 去重把六个链接合并成三个底层来源。
- 来源核验拒绝了四条只复制主张、却不连接原始出处的材料。
- 权利和敏感度闸门把两份付费报告留在仅人工区;我保存笔记和定位,没有上传全文。
- 任务相关性闸门把七条材料移入限时浏览,而不是证据档案。
- AI 为剩余来源生成了受原文约束的摘要。
- 我逐条核验高影响主张,并抽查低影响摘要。
- 最终五个来源进入记录层,其余材料保留拒绝理由和失效期,不再成为永生的书签。
结果不是“AI 找到了真相”,而是得到了一条更小、可审计的队列。
外部内容是数据,不是指令
网页、邮件、PDF 或工具结果里可能藏着要求 Agent 忽略任务、泄露数据或执行动作的文字。它可能是恶意提示注入,也可能只是写给另一个读者的操作说明。无论哪一种,我都把外部材料当作不可信证据,绝不让它取得工作流的指挥权。
Anthropic 关于缓解提示注入的官方指南 明确描述了这种间接注入,并建议最小权限、输入筛查,以及限制对敏感数据和动作的访问。在这条流水线里:
- 来源文本不能修改系统任务或验收标准;
- 摘要模型没有发布、发消息、删除或读取秘密的权限;
- 可疑指令只被引用和标记,不被执行;
- 任何超出阅读和分类的动作,都要再次获得人工批准。
让 AI 站在信息层
最后回到那条贯穿整个系列的规矩:信息层适合在输入和输出都可检查的地方使用 AI。
去重、摘要、翻译、初步分类、把材料压成审阅队列,都是合理的 AI 候选任务。它们仍然消耗 token、存储、索引维护和人工抽检。摘要可能丢掉限定条件,把数字和分母拆开,错过图表,或者忽略反例。只有省下的复查时间大于这些成本,自动化才真正挣到了位置。
AI 在排序相关性、标注质量或决定省略什么时,本来就在做判断。更诚实的边界是责任:AI 可以按量表评分并解释;我定义量表、检查边缘项、抽样核验,并对什么内容进入下一层负责。
一份摘要只有保留这些信息,才算通过验收:
- 来源、作者或发布者、发布日期和检索日期;
- 准确主张及其定位;
- 关键限定、适用人群、时间范围和分母;
- 相关反证或来源声明的限制;
- 来源或模型无法支持结论时的不确定性;
- 让复核者能够重建结果的链接或保存定位。
高影响主张逐条核验,其余内容按固定节奏抽查;错误率上升时,提高抽样比例。仪表盘记录:
| 指标 | 它揭示什么 |
|---|---|
| 错误淘汰率 | 被错误挡掉的高价值来源 |
| 高价值漏检率 | 没进入审阅队列的重要来源 |
| 主张支持度 | 摘要主张是否得到引用来源支持 |
| 重复率 | 去重后仍然存活的重复材料 |
| 处理时间和 token 成本 | 自动化是否真的节省资源 |
| 晋级率 | 进入记录层的输入比例 |
这些指标彼此拉扯。挡得更多,会降低工作量,也可能提高漏检率;收得更多,会提高召回,也可能重新建起同一座噪音仓库。只有看得见这组权衡,入口才算健康。
把信息层理顺,你会立刻感到轻松:收藏夹不再有负罪感,因为你终于承认了它大部分是噪音;注意力被解放出来,因为你只在信号上花力气。
接下来,那些被你筛出来、值得亲手加工的信号,要进入第二道工序——记录。那是信息和知识之间,转化率最高的半成品。下一篇见。
本文是「从信息到创作」专栏第二篇。上一篇:总纲——信息、记录、知识、创作 。下一篇进入第二层——记录。

读者回响