一份清单让我警觉的地方
过去半年,我大概认真读过二三十份「AI 时代超级个体装备清单」。中文的、英文的、公众号的、Twitter 长帖的。它们长得高度相似:先列几个大模型,再列几个 AI 编程工具,然后是自动化平台、知识库、剪辑工具,最后来一张打分表。
我自己也在用其中的绝大多数。可读到第十几份的时候,我开始警觉:这些清单彼此之间的差异,比它们各自宣称的优势要小得多。
如果一万个人都拿到了同一份清单,都装上了同一套工具,都把开发速度提到了同一个量级——那么这套装备到底给了谁优势?
答案是:给了这一万个人相对于「还没装的人」的优势。而在这一万个人内部,什么都没发生。
这不是一个抬杠式的诡辩。它指向一个我认为被系统性忽略的事实:AI 时代最大的变化不是"个体变强了",而是"变强这件事变成了公共品"。 模型每一次升级,都同时发给你和你所有的竞争对手。你昨天靠工具建立的领先,今天会被一次版本更新抹平——不是被某个具体的对手抹平,是被所有人同时抹平。
所以我想换一个方式来谈装备。不按功能分类,不按价格分档,而是按一个更冷的标准来分层。
唯一值得用的判断标准
对任何一件装备,我只问一个问题:
这层装备的进步,是只帮我,还是同时帮我所有的竞争者?
这个问题把所有装备分成了两类,界限非常干净。
第一类是入场券。 它的进步是公共的、外生的、同时发放的。模型变强、AI 编程工具变好、部署变便宜——这些进步不需要你做任何事就会落到你头上,同样也会落到每一个人头上。你在这一层的投入,只能让你「不掉队」,不能让你「领先」。
第二类是资产。 它的进步是私有的、内生的、有时间成本的。你写过的两百篇文章、你三年积累的一万个读者、别人提到你名字时的第一反应、你在某个开源社区里被记住的贡献——这些东西没有任何一次模型升级能替另一个人补上。它们只能被时间和一致的行为堆出来。
区分这两类,比区分「哪个模型更聪明」重要一百倍。因为入场券的投入回报会随着普及率快速衰减到零,而资产的投入回报会随着时间复利。
这里有一个反直觉的推论,我想说得明确一点:在入场券那一层拼命追新,本质上是一种负债。 不是因为工具没用——它们非常有用——而是因为你投在那里的注意力有机会成本,而那层的边际收益正在被全行业的进步稀释。你花两周把工具链调到极致,节省下来的时间如果又投回去调工具,你就永远停在了那一层。
我知道这个说法容易被误读成「不要学新工具」,所以补一句:入场券的必要性和它的不可持续性,是同时成立的两件事。 没有入场券你连场都进不了,但拿着入场券也不代表你能赢。真正的问题不是「要不要投」,而是「投到什么程度该停」——这个问题几乎没人问,因为工具层的进步太容易带来「我在进步」的错觉。你换了一个更好的模型,交付确实变快了,这个正反馈非常真实,也非常容易让人停在那里循环。
还有一个更隐蔽的地方:入场券的普及速度,比你迭代自己的速度快。 你今天靠一套精心调过的配置领先,三个月后有人装个默认配置就到了你八成的位置——因为你那套配置里有一大半价值来自「趟过的坑」,而坑会随着生态成熟自动消失,消失的收益全行业均分。这就是为什么工具层的领先总是在贬值:它的价值不是被对手夺走的,是被时间蒸发掉的。
四层装备栈
按这个标准往下切,装备自然分成四层。我按「AI 抹平的难度」从易到难排列——注意编号方向:第四层最容易被抹平,第一层最难。
难被 AI 抹平 · 复利最强
▲
│ ┌─────────────────────────────────────────┐
第一层 │ 声誉层 别人为什么信你 │ 资产
│ │ 开源信誉 / 一致的公开输出 / 关系网络 │
│ └─────────────────────────────────────────┘
│ ┌─────────────────────────────────────────┐
第二层 │ 分发层 你的东西怎么被看见 │ 资产
│ │ 受众 / 内容管道 / 被 AI 检索到的能力 │
│ └─────────────────────────────────────────┘
│ ┌─────────────────────────────────────────┐
第三层 │ 判断层 做什么、不做什么、做成什么样 │ 半资产
│ │ 需求闸门 / 品味 / 把判断固化成规则 │
│ └─────────────────────────────────────────┘
│ ┌─────────────────────────────────────────┐
第四层 │ 生产层 把它建出来 │ 入场券
│ │ AI 编码 / agent 编排 / 部署 / 自动化 │
▼ └─────────────────────────────────────────┘
易被 AI 抹平 · 公共品
我知道这种分层图很容易变成又一张「打分表」,所以我要立刻补一句:这四层不是并列的选项,你不需要在它们之间做取舍。你需要的是搞清楚每一层该投多少、投到什么程度停手,以及它们之间的方向。
第四层 · 生产层:配到够用就停
这一层是绝大多数装备清单的全部内容:AI 编程工具、agent 编排、部署平台、自动化流水线。
它是入场券的典型形态。这一层每一次进步都是全行业同步的公共事件。我不会说它不重要——恰恰相反,它是必需品。没有它你连场都进不了。但它的战略地位是「必需但不充分」,而大部分人把它当成了「必需且充分」。
这层的正确用法是:配到够用,配到便宜,然后停手。 判断「够用」的标准不是「我用上了最新的工具」,而是「我的交付速度不再是我的瓶颈」。一旦瓶颈转移了——通常是转移到「我审不过来」或者「我不知道该做什么」——就该把注意力挪到上一层去。
我会在第二篇里专门拆这一层,包括一个大部分人没意识到的事实:当执行速度上去之后,真正的瓶颈会转移到 review 带宽,而 review 带宽几乎无法用同样的方式扩张。 那篇会引一些让人不太舒服的实证数据。
第三层 · 判断层:执行免费之后,成本全在这里
AI 能把你想清楚的东西建出来。它建不出来你没想清楚的东西——但它会假装建出来,而且看起来很像那么回事。
这一层是「做什么、不做什么、做成什么样」的能力。它包括需求闸门(判断哪些需求值得进队列)、验收标准(判断产出合不合格)、以及审美和选品(判断什么东西值得存在)。
它是半资产:一部分可以外化成规则和文档反复复用,另一部分只能长在人脑子里。
这一层的价值曲线很特别:执行成本越低,判断的相对价值越高。 当建一个东西要三个月的时候,做错方向的代价被漫长的建造过程本身部分对冲了——你有大把时间中途醒悟。当建一个东西只要三小时,做错方向的代价是全额的,而且你会在醒悟之前已经建完了五个错的东西。
AI 提需求几乎不要成本。这句话听起来是好消息,其实是这套系统里最危险的一环——它会把你的队列填满一堆看着合理、实际低价值的任务,然后你的 agent 会忠实地把它们全部做完。
第二层 · 分发层:唯一还在复利的产能
产品可以一夜被抄,你花两年积累的读者抄不走。
这一层是「你做的东西怎么被看见」的能力:受众、内容管道、渠道调性、以及在 AI 检索时代新增的一项——你的内容能不能被模型找到并引用。
它是纯资产。受众和信任是时间的函数,没有任何工具能压缩这个函数。一个新账号和一个三年的账号,就算发同样的内容,得到的反馈也完全不同,而这个差距只能用时间补。
这一层最容易被技术出身的人低估。我自己也走过这个弯路:总觉得「产品做得足够好,自然会有人来」。这句话在建造成本高的时代还有几分道理——因为好产品本身就稀缺。在建造成本趋零的时代它基本失效了:好产品不再稀缺,被看见才稀缺。
第一层 · 声誉层:抹不平的最后一层
「这个东西是他做的」——当这句话本身能改变别人对一个产品的判断时,你就有了第一层的资产。
它包括你在开源社区的贡献记录、你长期公开输出建立的可预期性、以及真实的人际关系网络。
它是四层里最难建、最慢、也最难被抹平的。原因很朴素:信任的建立需要时间上的一致性,而时间不可压缩。 你可以用 AI 在一天内生产一百篇文章,但你没法用 AI 在一天内让一百个人信任你。
这一层往往不是「工具」,是「资产」,甚至是「你这个人」。也正因为如此,它最容易被从装备清单里漏掉——清单只装得下能被购买的东西。
这句话值得停一下:清单能列出来的东西,就已经不稀缺了。 一件装备能被写进清单、被链接、被一键安装,恰恰说明它已经是公共品。所以「不在任何清单上」这个属性本身,就是第一层稀缺性的来源。它没法被列出来,是因为它没法被购买;它没法被购买,是因为它只能被时间和一致的行为长出来。
为什么几乎所有清单都停在第四层
如果四层的逻辑这么直白,为什么绝大多数「超级个体装备」的讨论都只谈第四层?
我想过三个原因,它们都不是「作者不懂」。
第一,第四层是唯一可以被清单化的一层。 工具有名字、有链接、有价格、有替代品,天然适合被列成表格。而「判断力」「受众」「信誉」没法被列成表格——你没法写「推荐:三年一致的公开输出,⭐⭐⭐⭐⭐」。载体决定了内容:只要形式是清单,内容就只能是第四层。
第二,第四层的反馈最快。 换个工具,当天就能感觉到快了。而判断力的改善要几个月才看得出来,受众要一两年,信誉要更久。人的行为会自然地被最短的反馈回路捕获,这不是意志力问题,是结构问题。
第三,也是最关键的:第四层是唯一能靠花钱解决的一层。 剩下三层都只能靠时间和一致性,而这两样东西没法加购。所以当一个人焦虑「我是不是落后了」的时候,买工具是唯一能立刻缓解焦虑的动作——哪怕它并不能解决问题。
意识到这三点之后,我对那些清单的态度反而缓和了:它们不是错的,是被形式限制住的。真正的问题在读的人这边——把一份注定只能覆盖第四层的清单,当成了完整的答案。
四层之间是有方向的
如果这篇只讲到分层,它会变成又一张打分表。所以我想强调这个框架里真正重要的部分:层与层之间不是并列的,是有方向的。
方向是从下往上:第四层的每一次产出,都应该往上沉淀成第二层和第一层的资产。
第四层产出一个东西
│
├──► 直接价值:这个产品本身的收入(线性、可被追平)
│
└──► 沉淀价值:把「怎么做出来的」变成内容
│
├──► 第二层:内容带来受众
│
└──► 第一层:一致的输出建立信誉
│
└──► 反哺:下一个产品的冷启动成本更低
这个方向如果不打通,你的每一次交付都是一次性的:产品上线、赚一点钱、然后归零,下一个产品从头开始。打通了,第 N 个产品的起点是前面 N-1 个产品攒下的受众和信誉。
这才是「超级个体」和「一个用 AI 很熟练的人」之间的真正区别。 不是后者工具用得差,而是后者的每一次努力都不留下东西。
我见过太多技术很好的人,卡在同一个地方:第四层强得离谱,第一层有底子却从来没主动经营过,第二层完全靠自然生长。三件事互相之间没有任何管道。这不是能力问题,是架构问题。
怎么判断自己卡在哪一层
框架的价值不在于分类,在于诊断。所以在展开后面四篇之前,先给一个粗糙但好用的自检方法。
看你的瓶颈在哪里,就知道你卡在哪一层。
问:如果现在给你一个五倍速的执行能力,你的产出会变好吗?
会 ──────────────────────► 你卡在第四层(生产层)
继续配装备是对的
不会,因为我不知道该做什么 ──► 你卡在第三层(判断层)
再快也只是更快地做错事
不会,因为做出来也没人看 ────► 你卡在第二层(分发层)
产能过剩,出口堵死
不会,因为没人相信我做的 ────► 你卡在第一层(声誉层)
这是最慢也最值得投的一层
这个自检有个很实际的用处:它能挡住那个最常见的错误决策——瓶颈明明在上面,却继续往第四层投入。
我自己犯过这个错,而且犯得很典型:某段时间产出不理想,我的第一反应永远是「是不是工具不够好」,于是去研究新的工作流、新的编排方式。事后回看,那几次里至少有两次,真正的问题是我根本没想清楚在做什么——第三层的问题,用第四层的药。
之所以会这样,是因为第四层的问题是唯一有明确解法的问题。工具不好换工具,流程不顺改流程,这些动作有确定的完成感。而「我不知道该做什么」这种问题没有完成感,你甚至不知道自己什么时候算想清楚了。人会本能地逃向有解法的那一侧。
还有一个更值得警惕的信号:如果你的瓶颈在上面三层,那么第四层的每一次提速,反而会让问题恶化。 判断没想清楚的时候提速,会更快地生产出错的东西;分发没打通的时候提速,会积压更多没人看的产出。这不是比喻——它是真实的资源浪费,而且因为「我很忙、我产出很多」的感觉太强烈,很难被自己察觉。
关于「10 倍生产力」,我想先泼一盆冷水
在展开后面四篇之前,我想先把一个东西说清楚,否则整个系列都会建立在一个虚假的前提上。
几乎所有装备清单都会承诺一个数字:10 倍生产力、5 倍提效、一人抵一个团队。这些数字的来源,绝大多数是自我报告。
而自我报告在这件事上是不可靠的,有一个我认为每个用 AI 写代码的人都该知道的研究。2025 年 7 月,METR 做了一个随机对照实验:16 名在自己熟悉的成熟开源项目上工作、平均有五年经验的开发者,246 个真实任务,随机分配「允许用 AI」和「禁止用 AI」。
结果是:允许用 AI 的时候,任务耗时多了 19%。
但比这个数字更有杀伤力的是另一组数据:这些开发者事前预测 AI 会让他们快 24%,做完之后仍然认为 AI 让自己快了 20%。实测是慢的,主观感受是快的,而且做完之后感受都没有修正。
我必须补充一个重要的更新,否则这个数字会被误用。METR 自己在 2026 年 2 月发文说,第二轮实验(更大样本、更新的工具)已经转为「提速」,但他们同时认为这批数据的信号不可靠——因为出现了严重的选择偏差:大量开发者拒绝参加实验(不愿意在不用 AI 的条件下工作),还有三到五成的参与者承认故意不提交那些 AI 能大幅加速的任务。METR 的原话大意是:我们倾向于认为 2026 年初的开发者确实比 2025 年初被 AI 加速得更多,但证据很弱。
所以正确的结论不是「AI 让人变慢」。正确的结论是更冷的那个:
连专门研究这件事的机构自己都承认,现在已经很难干净地测量 AI 对生产力的影响了。
这比任何一个具体数字都更能拆解「10 倍提效」的话术。当一件事既无法被可靠测量,又能带来强烈的主观加速感时,围绕它形成的一切数字宣称都应该被打上问号——包括那些装备清单里的。
这不是让你不用 AI。我自己每天都在用,重度地用。这是让你在读接下来四篇的时候,带着一个基本的怀疑:任何声称「装上这个就快 X 倍」的说法,都在回避一个更重要的问题——快了之后呢?
这个专栏接下来讲什么
五篇,一层一篇,加上这篇总纲。
第二篇讲生产层 :AI 编码和 agent 编排的现状,什么该配、什么是过配、过夜 agent 的真实瓶颈在哪,以及为什么「一次做对率」比「并行度」重要得多。这篇会引用一些关于 AI 生成代码质量和安全性的实证数据,它们不太好看,但绕不过去。
第三篇讲判断层 :当执行趋零,判断就是全部成本。需求闸门怎么守,验收标准怎么写,以及怎么把「判断」这件只存在于脑子里的东西,外化成 agent 能反复读取的规则——这是这一层能从「个人能力」升级成「可复用资产」的唯一路径。
第四篇讲分发层 :受众为什么是唯一还在复利的产能,怎么把做产品的过程本身变成内容,以及 AI 检索时代新出现的一件事——你的内容能不能被模型读到、理解、引用。
第五篇讲声誉层 ,也是收尾:为什么信任是 AI 抹不平的最后一样东西,开源贡献这类「非清单资产」怎么被系统性低估,以及最重要的——怎么把四层打通成一个互相喂养的系统,而不是四件分开的事。
如果你只打算读一篇,读第三篇。如果你已经有很强的第四层能力,直接跳到第四篇。
需要说明的是,这个专栏不是一份「照着做就行」的操作手册。四层里只有最下面一层能被操作手册覆盖,而那一层恰恰是最不值钱的。上面三层我能给的只有判断标准和一些踩过的坑——因为它们的答案本来就因人而异,任何声称能给出通用答案的说法,多半是把第四层的确定性错误地借用到了上面三层。
最后说一句可能有点扫兴的话。
写这个系列的过程中,我反复回到同一个念头:我们这一代人可能高估了「工具」在这件事里的分量。
不是说工具不重要。是说当所有人的工具都一样好的时候,工具就从「差异的来源」变成了「差异的背景」。真正的分野会退回到那些非常古老的东西上——你想做什么、你判断力如何、有多少人信你。
这些东西在工具稀缺的年代被工具的差距掩盖了。现在工具的差距被抹平,它们重新露了出来。
这可能才是 AI 时代最值得警惕、也最让人踏实的一件事:你没法再靠装备赢了,你只能靠你自己。




读者回响