Xinwei Xiong · 2026 年 7 月 11 日
8 分钟 · 3968 字 · | EN

AI 知识工作流:从信息、记录、知识到创作

本文给出一套完整的 AI 知识工作流:让信息依次经过入口海关、可追溯记录、证据化知识和面向受众的创作,并通过反馈回流持续修正。文章统一四层输入、状态、AI 角色、人工责任、验收标准和健康指标,适合希望借 AI 提速,又不愿丢掉来源、范围、判断与发布责任的创作者和工程团队。重点不是存得多,而是交接可查。

信息经过入口闸门成为记录和知识,再面向受众创作并沿可测量反馈回路返回

四个名字,代表四种不同的工作

我过去的笔记只朝一个方向生长:向内。链接进来,碎片堆积,目录反复改名,仓库越来越重。我把“拥有”错认成了“加工”。

AI 让这种错误变得更便宜。模型可以快速生成、摘要、分类和改写文字,但速度不会自动把来源变成证据,把观察变成知识,也不会把初稿变成我应当发布的东西。它完全可能把仓库撑得更大,而机器一点没变强。

所以我把工作流拆成四种操作状态:

信息
  │ 入口闸门
记录
  │ 澄清与证据
知识
  │ 显式检索与有边界的复用
创作
  │ 面向受众交付与可测量反馈
  └──────────────────────▶ 信息

这不是一套关于人类学习的普遍分类。一个来源可以跳过某一层,同一个产物在不同任务里可以承担不同角色,一篇已经发布的文章也会变成下一次研究的信息。四个名字之所以有用,是因为它们逼我在每次交接时回答一个实际问题:

什么发生了变化?责任现在属于谁?哪份证据允许它继续往前走?

这条流水线与其说是传送带,不如说是一条海关路线。每一道边境,都需要不同的护照。

一张表看完整条流水线

输入主要工作输出AI 可以协助人仍然负责验收标准
信息外部来源、feed、文档、观察相关性、来源、时效、权利、敏感度、成本、核验可交给 AI、先脱敏、仅人工、限时浏览或拒绝去重、分类、受来源约束的摘要任务、上传边界、来源质量、边缘项来源可追溯,行动有理由
记录值得保存的来源或事件捕获、澄清事实与解释、补上下文和下一步capturedclarifiedreviewedpromoteddiscarded转写、时间戳、缺失字段追问同意、亲身事实、证据、敏感数据另一人能重建发生了什么
知识已复查记录与受保护参考资料状态、范围、反证、测试、检索、复查draftimportedtestedretired 卡片检索、比较、冲突和过期提示入库、范围、例外、复查与退役主张有支持、可检索、有范围、可撤回
创作有边界的知识与当前研究定义读者任务、选择主张和载体、起草、核验、发布面向受众的作品与创作记录大纲、变体、压缩、载体适配证据、亲历、声音、最终批准读者承诺完成,主张仍有支持

四层不同,但一条规则贯穿始终:

provenance:
  source: "它从哪里来"
  captured_at: "何时获得或观察"
  scope: "主张适用于哪里"
  evidence: "什么支持它"
  sensitivity: "谁可以看或处理"
  owner: "谁接受责任"
  status: "它经历了什么"
  next_action: "接下来该发生什么"

如果交接丢了这本护照,下一层得到的就是没有历史的自信。漂亮摘要会这样变成错误事实,个人技巧也会这样被写成普遍建议。

信息:守住入口

信息不是“所有可以喂给 AI 的东西”,而是等待一个处理动作的输入。

入口检查任务相关性、来源质量、时效、独特性、敏感度、权利、处理成本和可复核性。结果可能是安全交给 AI、脱敏后处理、仅限人工、放进时间盒浏览,或者拒绝。

这个区别很重要,因为采集权不等于上传权。凭证、客户数据、私密对话、受监管信息和付费版权材料,不会因为进入我的笔记就自动变得安全。产品和功能的数据留存也不相同。Anthropic 当前的 API 与数据留存官方文档 提醒我检查真实的处理安排,而不是假设所有 AI 界面都一样。

外部内容也是不可信数据。网页、PDF、邮件或工具结果中,可能存在试图改变 Agent 行为的指令。Anthropic 关于缓解提示注入的官方指南 描述了这种间接注入边界。在我的工作流里,来源文本无权修改任务、读取秘密或批准外部动作。

信息层不负责永久判断一个来源“好不好”或“是不是噪音”。它只回答:面对当前任务,这个来源配得到哪一种动作?

记录:先保住现实,再解释现实

记录是半成品。它保存观察和上下文,却还没有挣到反复复用的资格。

文字只是媒介之一。语音、截图、代码 diff、实验输出和决策日志都可以成为记录。低摩擦仍需要最小护照:捕获时间、来源、上下文、观察、解释、敏感度和下一步。

真正有用的摩擦从澄清开始:

  • 发生了什么?
  • 哪一部分只是我的推断?
  • 哪份证据支持结果?
  • 什么反例会改变解释?
  • 下一步必须验证什么?

AI 可以转写、去重、把笔记和来源对照,并追问缺失项。它不能恢复从未捕获的上下文,不能编造第一人称经历,不能推断参与者同意,也不能制造不存在的结果。

延迟复读是一种个人默认,不是普遍冷却定律。安全事件、会议决定、同意和易失实验条件必须立即澄清。距离可能减少我对自己文字的自动脑补,却无法重建已经蒸发的证据。

知识:修道路,不只做书架

知识是准备在明确范围里复用的主张。在这套工作流里,它经过 draftimportedtestedretired

一张 tested 卡记录主张、范围、来源、真实使用、结果、反证、负责人、复查日期和替代关系。tested 不等于普遍正确,只表示卡片在声明边界内经受过一次明确使用。

组织方式应服从检索。Tiago Forte 在 PARA 官方说明 里定义的 PARA,适合从项目和长期领域出发工作的场景。其他仓库可能更适合问题、实体、时间线、playbook 或图谱。更多卡片和链接不会自动产生复利,也可能制造冲突和检索污染。

目录是一张地图,但锁在抽屉里的地图不会指路。文件只有被产品或工作流读取、导入、检索或发现后,才会影响模型。Claude Code 关于项目记忆的官方文档 描述了 CLAUDE.md、import 和范围指令的一种具体机制,却不承诺每条笔记都会被加载、正确排序或跨会话记住。

所以知识层必须保存检索失败日志:

  • 相关卡片漏召回;
  • 旧卡压过替代卡;
  • 冲突卡同时加载却没有关系;
  • 卡片被应用到范围之外;
  • 组装上下文时丢掉反证。

退役同样需要显式、可逆。长期未使用只会生成复查候选,不会生成删除命令。墓碑保留原因、日期、来源、替代项与恢复条件。低频应急、法律、历史和高影响知识,即使没有使用,也可能需要受保护地保留。

知识库仍然是我和 Agent 之间的共享世界线,只是它只存在于主张、检索与纠正相遇且可检查的地方。

创作:为读者重组,再让反馈回来

知识面对可复用的内部任务,创作面对一个具体的读者任务。

我的创作交接有八道门:选择知识卡、定义受众任务、确定统领主张、附上证据、选择载体、人工验收、有意识地发布、筛选反馈再回流。

AI 可以协助探索方向、生成变体、压缩、寻找反方立场和适配载体。作者仍然负责目标、亲身主张、来源核验、遗漏、声音和发布动作。Anthropic 的 Prompt Engineering 官方总览 也从同一项操作纪律开始:先定义成功标准和检验方式,再优化 prompt。

反馈首先是信息,不是自动晋级的知识。事实纠错要核验,重复问题进入研究队列,有论据的异议与原主张并列,偏好留在创作记录,赞美、愤怒和原始互动量不会因为声音大就变成真理。

只有当反馈重新经过入口海关,飞轮才真正闭合。

同一个问题,如何走完四层

下面是一条来自这个博客的脱敏追踪。

1. 信息

生产站点漏掉了一篇仓库里确实存在的文章。输入包括内容文件、构建输出、Hugo 行为和当前发布时间。入口闸门把仓库秘密留在外面,并把主张标成强时效。

2. 记录

第一条记录分开保存:

  • 观察:文件存在,但生产构建没有页面;
  • 解释:+08:00 的发布时间可能仍在未来;
  • 替代解释:draft: true 也会造成类似症状;
  • 下一步:用生产构建分别复现两种情况。

记录保存 commit、命令、输出、环境和捕获时间。

3. 知识

测试产生了一张有范围的卡:

state: tested
claim: "未来日期的 Hugo 内容不会进入本站生产构建。"
scope: "此仓库当前 Hugo 配置"
counterevidence:
  - "draft 内容也会造成相同的表面症状"
next_action: "分别检查 draft 状态与上海发布时间"

卡片没有说“时区总会造成页面缺失”,而是保留诊断顺序与测试条件。

4. 创作

这张卡被重组成写给博客维护者的故障排查段落。读者任务是:不靠猜测,定位页面为什么没有发布。AI 协助压缩步骤,人核验命令、第一人称经历和最终措辞。

后续读者纠错不会静默改写卡片。它会作为信息重新入场,被复现、更新记录,并修订或替代旧知识。

这就是一条失败里的完整框架:现实进入,记录把它钉住,知识给它划边界,创作把它交给别人,反馈再带着护照回来。

风险会跨层旅行

不存在“安全的 AI 层”。失败只是在不同位置改变形状:

失败出现在哪里
提示注入外部来源和工具结果
限定条件或分母遗漏摘要与澄清记录
转写错误语音和会议捕获
错误晋级记录无证据进入知识
漏召回或旧卡覆盖知识上下文装配
范围漂移tested 卡被应用到别处
编造经历创作初稿
虚荣指标优化反馈与分发

责任原则比固定 AI 配额更有用:

一个主张越难撤回、越像亲身经历、越会影响别人,它需要的证据和人工复核就越强。

AI 可以出现在每一层,人的责任不会从任何一层消失。

测量交接,不测仓库有多大

每一层都有自己的失败指标:

健康信号
信息高价值漏检率、错误淘汰率、主张支持度
记录来源完整率、上下文缺失率、可重建率、人工纠正率
知识支持度、过期率、冲突率、检索命中率、误召回率、复用成功率
创作主张支持度、完读、有效反馈、读者结果、下游行动

这些指标彼此拉扯。激进过滤会降低工作量,也可能提高漏检;更多卡片能提高召回,也可能增加误召回;高完读可以和低读者结果同时发生。只有权衡可见、纠正能够往回走,系统才算健康。

我仍然关心这套工作流有没有改变我,但变化本身不是证明:错误记录也能改变决定。更完整的检验是,作品是否有支持、可重建、有范围、对目标读者有用,并且可以在不擦除历史的情况下纠正。

信息在一些场景里便宜,在另一些场景里昂贵。这里真正重要的不是关于信息充沛的一句口号,而是我能否把来源变成负责任的动作,把观察变成可重建记录,把记录变成有边界的能力,再把能力变成另一个人真正用得上的作品。

这才是机器。仓库只是它投下的影子。

阅读完整专栏

  1. 第一层·信息:建立入口闸门
  2. 第二层·记录:保存可追溯的半成品
  3. 第三层·知识:建立可验证、可检索的能力
  4. 第四层·创作:面向受众重组

本文是「从信息到创作」专栏总纲。继续阅读第一层·信息

读者回响

加入讨论

新文章写好,先寄给你

每有新文章,寄一封信到你的邮箱。双重确认,随时退订。