去年冬天有一次我算了一笔很难看的账。
那天我在一家咖啡馆待了一整个下午,边写代码边拍素材,手机和录屏加起来大概四十分钟。晚上回去开始剪,凌晨一点半导出,成片五十八秒。
四十分钟素材,六个小时剪辑,五十八秒成片。发出去之后数据也很普通。
我第一反应是"剪辑效率不行,得上 AI"。于是那一个月我把能试的都试了一遍:智能成片、自动踩点、自动字幕、自动调色。效率确实提升了,六个小时压到了两个半小时。但成片变得更没人看了。
后来我才想明白,我一开始就把问题问错了。我要解决的从来不是"剪得慢",而是"我拍的时候没想清楚要剪出什么"。 剪辑之所以耗六个小时,是因为那四十分钟素材里没有结构——我在用剪辑台做本该在出门前就做完的事,而 AI 加速的恰好是我不该做的那部分。
这篇写的是我后来怎么重搭这件事。它同时是一套判断(哪些环节该给 AI、哪些一步都不能让)和一套可以照着做的流程(拍摄参数、目录约定、命令、发布架构)。我自己跑的是四条内容线:AI 产品和技术的拆解、电脑上的屏幕演示、咖啡馆和城市的日常、以及少量徒步。四条线的处理方式不一样,但流水线是同一条。
先把视频放回正确的位置
我在超级个体的情报系统那篇 里借过一个判断,这里想再用一次:一层装备的价值,取决于它的进步是只帮你,还是同时帮你所有对手。
按这个标准,视频剪辑能力属于哪一层?
它属于分发层,不属于生产层。这个区分不是文字游戏,它直接决定了你该在哪儿花时间。
如果视频是生产层,那么"剪得更快更好看"就是核心指标,而 AI 剪辑工具的每一次升级都是纯收益。但视频对超级个体来说不是产出物本身,它是把你已经有的东西——你做的产品、你踩的坑、你的判断——搬运到别人注意力里的通道。通道的价值不由通道的精美程度决定,由它搬运的东西是否稀缺决定。
这一条推论很反直觉但很硬:一条画面粗糙但讲了一件只有你知道的事的视频,分发价值高于一条画面精致但讲了所有人都在讲的事的视频。而 AI 剪辑工具的所有升级,作用的全是后半句里的"精致"。
所以第一个判断是:在视频这件事上,把画面质量优化到"不构成阻碍"就可以停手了,再往上投入的边际收益极低。 你的时间应该花在前一步——决定拍什么。
内容的价值来源
│
┌──────────────┴──────────────┐
│ │
只有你有的东西 呈现的精美程度
(一手经历 / 具体数字 / (画质 / 调色 / 转场 /
失败细节 / 判断) 节奏 / 字幕样式)
│ │
AI 无法生成 AI 正在快速追平
也无法替代 并同步发放给所有人
│ │
← 应该在这里花时间 够用就停手 →
AI 一键成片为什么必然是 60 分
这是我踩得最实的一个坑,值得单独说清楚,因为它的失败原因不是"工具还不够好",而是结构性的。
各家的智能成片、AI 自动剪辑,本质做的是三件事:识别镜头边界、给每个镜头打质量分、按一套通用的节奏模板排序拼接。它做得其实不差——我试过的几个都能吐出一个结构完整、能直接编辑的粗剪,比从空时间线开始要快。
问题在于它的目标函数。它在你的素材分布上取均值,而它的模板是在全平台素材分布上取的均值。 两个均值叠加,产出的一定是一条"哪儿都不难看、哪儿都不特别"的片子。
在内容供给稀缺的年代,60 分是能活的。但 2026 年不是那个年代。当所有人都能一键产出 60 分,60 分的分发价值不是 60 分,是 0 分——因为算法和观众筛选的从来是分布的头部,不是均值。
这里有个我觉得挺重要的推论:AI 让内容生产的边际成本趋近于零的同时,必然抬高内容分发的实际成本。 供给暴增,注意力总量不变,单位注意力的获取价格上升。所以"用 AI 提高产量"这条路,在数学上是自我抵消的。产量涨十倍,但每条的期望曝光跌得比十倍还快。
真正有效的用法是反过来的:用 AI 把每条的固定成本压下去,把省出来的时间全部投到"只有你有的那部分"上。 不是产量翻十倍,是每条里独有的信息密度翻十倍。
把 AI 能做的和不能做的切开
我现在的划分是三档,边界画得比较死,因为模糊地带是效率损失最大的地方。
第一档:确定性搬运,全部交出去。
这些任务有唯一正确答案,做对做错可以机器判定:
- 转写。语音转文字,用于字幕和后续的文本检索。
- 静音和废话切除。录屏里"呃……让我看一下"这类内容。
- 镜头切分。把一段长素材按画面变化切成独立片段。
- 格式归一。帧率、分辨率、色彩空间、音频采样率统一。
- 字幕烧录、封面尺寸批量导出、多平台画幅裁切。
- 降噪、去背景、超分。
这一档我用脚本跑,不用 GUI。原因下一节说。
第二档:概率性提议,让它出草稿,我做取舍。
- 从转写稿里挑候选片段和金句。
- 生成十个开头钩子的变体。
- 从脚本反推 shot list。
- 生成标题、标签、描述、封面文案的候选。
- 调色的起点(自动白平衡、参考帧匹配)。
关键词是"候选"。我从来不直接采用,我只从里面选。这一档 AI 的价值不在于它选得准,在于它把"从零开始"变成了"从二十个里挑一个"——后者的认知成本低一个量级。
第三档:不可外包的判断,一步都不让。
- 前三秒。这是全片唯一真正决定成败的地方,也是 AI 最平庸的地方,因为好钩子的本质是反预期,而模型生成的是符合预期的东西。
- 节奏和留白。AI 知道哪里可以切,不知道哪里应该切。一个停顿是尴尬还是张力,差别在语境里,不在波形里。
- 音乐。
- 最终的色彩风格。
- 结论。你到底想说什么、你的真实判断是什么。
我之前写过 harness 的那个比例——脚手架占 98.4%,判断占 1.6%,但那 1.6% 决定了另外 98.4% 值不值钱。视频这件事上这个比例几乎原封不动地成立。剪辑操作的绝大部分是机械劳动,但成片好坏由那一小撮判断决定。
拍摄端才是真正的杠杆
现在回到开头那个六小时的教训。
剪辑之所以能被自动化,前提是素材有结构。AI 不可能剪出你没拍的镜头,也救不了一堆没有内在逻辑的素材。 所以整条流水线里投入产出比最高的一段,其实是出门前的十分钟。
我的做法是给每条内容线固定一份 shot list,每次拍完全一样的镜头。这样剪辑就从"创作"降级成"填模板",而填模板是可以自动化的。
屏幕演示线(AI 产品拆解、技术 demo)
这条线最该被彻底工程化,因为它的每一个环节都是确定性的,随机因素接近于零。
录制前的固定动作:
- 先写脚本再录。不是逐字稿,是一份分段的 outline,每段一句话说明"这一段要让观众明白什么"。没有这个,录出来一定是三十分钟的漫游。
- 一条视频只讲一个概念。 想讲三个就录三条。
- 环境预置:终端字号调到 16–18pt(默认字号在手机上完全看不清)、清空 shell 历史和会干扰的提示、关掉所有通知、准备一个干净的演示目录、浏览器换成无扩展的独立 profile。
- 分辨率固定 1920×1080 录制,后期再裁 9:16 竖版。反过来不行。
- 窗口不要全屏,留一点边距,后期加圆角和背景更像样。
录制工具我的判断是:OBS 免费开源,稳定,做长内容和直播够用;如果你的技术演示要发短视频,值得为自动缩放平移的那类工具付钱,因为代码这类小字内容在手机上必须靠推近才能看清,而手动做这件事极其耗时。Screen Studio 这类工具的核心价值就是自动跟随鼠标做缩放和平滑运镜——这是我唯一觉得"付费明显值"的剪辑类支出。(定价这两年变动频繁,下单前自己核一遍官网。)
一个具体的技巧:演示失败的部分不要剪掉。 我最开始会把报错、跑不通、绕弯的部分全删掉,只留顺利的路径。后来发现留下来的那些视频数据反而更好。原因不难理解——顺利的路径任何人跑一遍文档都能得到,卡住的地方和怎么绕出来的才是别人搜不到的。这也正好是 AI 生成不出来的东西。
咖啡馆与城市线
这条线的目标是"氛围 + 人设",信息密度可以低,但真实感要求高。
拍摄参数(iPhone + Blackmagic Camera,免费):
| 项 | 设置 | 原因 |
|---|---|---|
| 帧率 | 4K 24fps | 电影感的物理来源。30/60fps 出来是"新闻感" |
| 快门 | 锁 1/48s(180° 法则) | 决定运动模糊的量,太快画面发脆 |
| 色彩 | Apple Log(新机型可用 Log 2) | 后期宽容度高一个量级 |
| ISO | 最低可用值 | 咖啡馆光线不足时提 ISO,不要动快门 |
| 白平衡/对焦 | 手动锁定 | 自动模式的忽明忽暗是手机片"不高级"的最大来源 |
| 防抖 | 只用光学,关掉增强防抖 | 见下 |
| 户外 | 夹式 ND 滤镜 5–8 档 | 手机不能收光圈,白天守 1/48s 必过曝 |
把这套存成预设,每次一键调用。
防抖那一条我想多说两句,因为它和直觉相反。手持的微小晃动不是缺陷,是这个风格的信号本身。 过度稳定之后画面会"飘",像悬浮而不是移动,观感上反而假。稳定器抹掉的恰好是那些让运动显得有人味的微小不完美。所以我的做法是:肘部夹紧肋侧,用躯干当稳定器,膝盖微屈,脚跟到脚尖滚动着走。这样得到的是纪录片式的呼吸感,不是廉价的高频抖。
移动镜头用 0.5x 超广角——广角畸变会吸收手抖,比 1x 稳得多,代价是边缘变形,后期裁一点就行。特写用 1x 主摄,禁用数字变焦,想拍近就物理凑近。
固定 shot list(十一个镜头,每个 5–10 秒,全程不超过十五分钟):
1 门头 / 招牌(带推门动作,留给转场)
2 进店第一视角横移
3 点单或菜单特写
4 出杯 / 制作过程(收原声:磨豆、蒸汽)
5 找座、放包、放电脑的动作
6 开机、敲键盘的手部特写
7 屏幕画面(终端 / 编辑器,人设镜头)
8 咖啡放到桌上的特写
9 环境空镜 ×2–3(窗、灯、虚化的人)
10 固定机位工作长镜头 3–5 分钟(后期 10–20 倍速)
11 离店 / 天色变化收尾
这套路径的关键不是它拍得多好,是它和我本来就要去咖啡馆办公这件事完全重叠,边际成本接近零。可持续,不靠意志力。
徒步线
徒步和前两条最大的区别是:你不可能重拍。所以策略要从"拍够素材"改成"保证几个锚点镜头一定拿到"。
我的做法是只强制四个镜头,其余随缘:
- 起点的环境全景(建立空间感)
- 中途最难那一段的主观视角(这是唯一有叙事张力的地方)
- 一个"人在环境里很小"的远景(这类镜头在任何平台都吃香)
- 终点的回望
其余的坑:备用电源必须带,低温掉电极快;徒步素材天然冗长而缺乏事件,所以后期一定要靠加速和音乐来建立节奏;不要试图记录全程,记录全程的结果一定是没人看完。
可编程流水线
这一节是开发者相对于普通创作者的结构性优势,而且我觉得被严重低估了。
别人的剪辑流程是"每次重新做一遍",你的可以是"写一次,跑一百次"。差别不在单次效率,在于它是资产还是消耗。
素材落盘规范
流水线能跑的前提是输入可预测。我的目录约定:
footage/
2026-07-19_cafe-shenzhen/
raw/ # 原始素材,只读,永不修改
proxy/ # 归一化后的代理文件(脚本生成)
audio/ # 分离出的音轨
transcript/ # 转写结果 json + srt
scenes/ # 切分后的片段
edl.json # 剪辑决策表
out/ # 渲染产物
meta.yaml # 拍摄地点、主题、平台目标
raw/ 只读这条很重要。所有中间产物都可以从 raw/ 加一段脚本重建,这意味着流水线改进之后你可以把历史素材全部重跑一遍。
五个环节
归一化。 所有素材先用 ffmpeg 统一成同一套参数,后面所有环节都不用再处理格式差异。这一步看着无聊,但它消除的是整条链路上最常见的失败来源。
ffmpeg -i raw/IMG_0001.MOV -c:v libx264 -crf 18 -r 24 \
-c:a aac -ar 48000 proxy/0001.mp4
转写。 faster-whisper 本地跑,出 json(带词级时间戳)和 srt。词级时间戳是后面所有文本驱动剪辑的基础,没有它就只能按句子切,精度不够。
需要说明的是,faster-whisper 的更新节奏在 2025 年底之后明显放缓,我理解它属于"成熟停更"而不是废弃——功能稳定、社区还在用,但不要指望它继续快速迭代。
切分。 PySceneDetect 按画面内容变化把长素材切成独立片段,输出一份带时间码的清单。注意它在 2026 年中发了一个破坏性改版(时间戳部分重构,加了可变帧率支持),如果你有旧脚本,升级前先跑测试。
去静音。 auto-editor 处理录屏和口播素材,把静音段和废话切掉。它可以直接输出剪好的 mp4,也可以输出时间线文件给专业剪辑软件。这个项目更新很活跃,是这条链上我最放心的一环。
LLM 出 EDL。 这是真正把前面几步串起来的一环,也是我认为大部分人没用起来的一环。
思路:把转写稿 + 场景清单 + shot list 模板一起喂给模型,让它输出一份结构化的剪辑决策表,而不是让它"剪视频"。模型处理文本,ffmpeg 处理像素,各干各的。
{
"target": {"platform": "xiaohongshu", "aspect": "9:16", "duration_sec": 58},
"hook": {
"source": "scenes/0007.mp4",
"in": 2.4, "out": 5.1,
"caption": "深圳龙华,30 块坐一下午,插座管够",
"note": "选这个是因为画面里有插座特写,直接兑现标题承诺"
},
"timeline": [
{"source": "scenes/0003.mp4", "in": 0.0, "out": 2.8, "speed": 1.0},
{"source": "scenes/0011.mp4", "in": 12.5, "out": 15.0, "speed": 1.0,
"audio_lead_in": 0.5},
{"source": "scenes/0018.mp4", "in": 0.0, "out": 40.0, "speed": 16.0}
],
"captions_srt": "transcript/final.srt",
"cta": "评论区问我要具体位置"
}
有了这个 schema,渲染就是一段确定性代码,而且每一次剪辑决策都变成了可 diff、可版本化、可复用的文本。上一期的 EDL 可以直接当下一期的模板。你甚至可以把数据回灌进来——哪一类开头留人率高,直接写进下次生成 EDL 的提示里。
这类"LLM 出 EDL"的开源项目 2025 年之后冒出来不少,但我看下来还没有一个进入生产级生态位,基本都是个人或小团队项目。我的建议是看思路不要看具体实现,自己按上面的结构写一份两百行的脚本,比接入任何一个都可控。
最后 20% 交回 GUI
流水线跑到粗剪为止。最后的调色、音乐、字幕样式、节奏微调,我在 GUI 里手动做。
调色我用 DaVinci Resolve,免费版对个人完全够用。需要注意的是它这两年新增的一批 AI 功能(脚本对齐自动剪、按物体和台词检索素材这些)基本都是付费的 Studio 独占,免费版没有。Studio 是一次性买断,价格这几年没涨,如果你的量上来了,这是我认为性价比最高的一次性支出之一。
Log 素材的调色顺序:先套转换 LUT 还原、再用色轮平衡、降饱和 5–10%、阴影推一点青绿高光推一点暖、最后叠胶片颗粒(强度 20–30%,不要拉满)。导出时关掉任何"智能补帧 / 流畅"选项——24fps 拍就 24fps 导,补帧会把前面所有的帧感努力全部抹掉。
竖版和字幕我用剪映做,因为它的自动字幕和模板确实快。但有一条要注意:它的服务条款对上传到云端的内容授予的许可范围非常宽,如果你在意素材的权利归属,就在本地完成编辑和导出,不要开云同步。这一条对处理客户素材或者未发布内容的人尤其重要。
四条内容线其实是一个人设
这一节讲平台切入点,但要从定位说起,因为切入点是定位的推论。
我一开始的错误是把四条线当成四个题材,每条线都想找一个"这个题材里没人做的角度"。这条路走不通,因为每个题材里的空位都在快速被填满。
后来的思路是反过来的:四条线不是四个题材,是同一个人的四种曝光度。
一个人设
「一个人带一队 agent 在世界各地干活」
│
┌────────┬───────┴───────┬────────┐
│ │ │ │
AI 拆解 屏幕演示 咖啡馆 徒步
│ │ │ │
最高信息 过程证据 生活质感 人的部分
密度 (证明你是活人)
│ │ │ │
建立专业 建立可信 建立亲近 建立记忆点
四条线里,中间两条是主线,两头是辅线。AI 拆解建立你懂什么,屏幕演示证明你真的做出来了,咖啡馆和徒步证明说这些话的是一个具体的人而不是一个账号。
这个结构的好处是:任何一条线的内容都在给另外三条充值。 你在咖啡馆拍的那个屏幕镜头,观众看到的是你在写代码;你在技术演示里提一句"这是我在清迈那家店改的",人设线就被顺手喂了一口。而如果你把它们当四个独立题材做,四条线就是四份成本,互不相干。
切入点:别在"测评"里挤
AI 工具测评是 2026 年最红的红海,因为它的生产成本被 AI 自己压到了地板。任何人花两小时都能产出一条"我试了十个 AI 剪辑工具"。
我的判断是:从"这个工具怎么样"切换到"我用它真的做完了一件事"。
差别在于前者是可复制的信息,后者是不可复制的过程证据。前者 AI 能生成,后者不能——因为它需要你真的花时间失败过。而观众和算法在 2026 年都在快速提高对"有没有真做过"的辨别力。
具体到选题模式,我现在优先做的三类:
- 完整的过程记录。 不是"教你用 X",是"我用 X 做完了 Y,中间踩了这三个坑"。带具体数字、具体报错、具体的绕法。
- 成本和账。 “这套流程我一个月花多少钱"“哪个订阅我退了为什么”。这类内容极难 AI 生成,因为它需要真实的账单。
- 反常识的否定结论。 “这个功能我用了三个月,最后关掉了”。否定结论天然稀缺,因为它需要长期使用才敢下。
四个平台的差异
| 平台 | 形态 | 我的定位 | 切入点 |
|---|---|---|---|
| B 站 | 长视频 | 主阵地,放完整过程 | 技术深度 + 完整叙事,观众容忍长度 |
| YouTube | 长 + Shorts | 英文内容,长尾复利 | 英文技术圈的搜索长尾 + 数字游民 |
| 小红书 | 竖屏短 + 图文 | 生活线和轻技术 | 搜索驱动,标题要带长尾词 |
| 抖音 | 竖屏短 | 拉新,不做主阵地 | 强钩子,信息密度低但要有记忆点 |
有一条我想强调:小红书的搜索流量占比现在很高,而搜索流量的转化率显著高于推荐流量。 这意味着标题和标签要按关键词写,不要按文案写。“在深圳龙华找到一家能坐一下午的咖啡馆"比"今天的 vibe"有效得多,因为前者能被搜到。
长内容和短内容不是两套素材。我的做法是:先做长的,再从长的里切短的。 反过来不成立,因为短素材没有足够的上下文能撑起长内容。这一点在拍摄阶段就要决定——按长视频的标准录,短的是免费副产品。
自动发布:诚实说清楚能做到哪一步
这是我发现网上信息最不靠谱的一块。很多文章写得像是接个 API 就能一键全平台分发,实际情况差得远。
我核过一遍当前状态,大致是这样:
YouTube 是唯一对个人开发者友好的。 官方 Data API 提供上传接口,而且配额在过去这一年放宽了两次——先是把单次上传的配额消耗大幅降低,后来又把上传单独拆成了独立的每日配额桶,不再和读取搜索抢同一个池子。对个人自动化来说这基本够用了。(具体数字建议自己核一遍 Google 的配额文档,这块变动比较频繁。)
TikTok 有官方直发接口,但门槛在审核。 接口本身支持直接发布,但必须单独通过一个内容发布审核;审核通过之前,所有通过 API 发的内容强制只有本人可见。通过之后还有频率限制(每个 token 每分钟几次、每账号每天几十条量级)。对个人是可行的,但要预留一到两周的审核时间。
抖音和 B 站要企业资质。 两家的开放平台都有内容发布能力,但注册主体必须是企业,要营业执照,B 站还要盖公章的公函。个人开发者基本没有路径。
小红书没有面向普通开发者的官方发布通道。 这一条我查得比较仔细,因为它和很多文章的说法不一致。开放平台的公开能力以电商和数据类为主,内容侧主要是读取。市面上那些号称"小红书发布 API"的第三方服务,实现方式是你把内容提交给它,它生成一个二维码,你还是要拿手机扫码在 App 里完成发布——这件事本身就说明纯服务端的直发通道不存在。
关于浏览器自动化方案。 确实有一批开源项目通过模拟登录和浏览器自动化实现多平台一键发布,覆盖面很广,也确实能跑。但我要把风险说清楚:这类方案绕过官方鉴权,普遍违反平台的开发者协议和用户协议,风险包括风控封号、Cookie 泄露,以及在国内相关法规下的合规责任。我个人的选择是不用在主账号上。 如果你要用,至少不要用在你花了几年积累的那个账号上——受众是你唯一在复利的资产,为了省几分钟的手动上传去赌它,账算不过来。
所以现实架构是半自动
我的结论是:把发布拆成"准备"和"投递"两段,准备段全自动,投递段分平台处理。
渲染完成
│
▼
┌──────────────────────────────────────┐
│ 自动:生成分发清单 manifest.yaml │
│ · 各平台画幅版本(16:9 / 9:16 / 4:5)│
│ · 各平台标题 / 描述 / 标签(LLM 生成 │
│ 候选,人工确认) │
│ · 封面图批量导出 │
│ · 首评文案、置顶评论 │
│ · AI 使用情况声明(见下节) │
└──────────────────────────────────────┘
│
├──► YouTube :官方 API 自动上传
├──► TikTok :官方 API(需先过审)
├──► B 站/抖音 :手动上传,manifest 里的
│ 文案直接复制粘贴
└──► 小红书 :手机手动发布
这个架构的价值在于:手动的部分被压缩成了纯机械操作。 我不需要在发布的时候再想标题、再裁画幅、再写标签,那些在 manifest 里都准备好了。剩下的"打开 App 选文件粘贴文案"每个平台不到两分钟。
这里有个判断我想说清楚:追求 100% 全自动在这件事上是负收益的。 最后那一步手动上传,恰好给了你一个强制的复查窗口——很多次我在准备发的时候发现标题不对、封面选错、或者干脆觉得这条不该发。全自动会把这个窗口消掉。这是我少数几个主动保留人在回路里的地方,不是因为技术做不到,是因为它值。
合规:这一节不能跳
2026 年做 AI 辅助的内容,标识规则是硬约束,不是可选项。
中国的《人工智能生成合成内容标识办法》2025 年 9 月 1 日已经施行。 核心要求是双轨标识:显式标识(用户能明显感知的文字、声音或图形提示,而且下载导出的文件也必须带)和隐式标识(文件元数据里嵌入内容属性、服务提供者信息、内容编号)。覆盖文本、音频、图片、视频、虚拟场景五类——AI 写的文案、AI 生成的封面图都在范围内,局部使用 AI 也要标。责任是三方的:服务提供者要加标,应用分发平台上架时要核验,用户发布时要主动声明并使用平台提供的标识功能。删除、篡改、伪造、隐匿标识都是明确禁止的。
落到实践就三条:用了 AI 生成的画面或配音,在平台的声明入口勾选;导出时不要清除元数据;封面如果是 AI 生成的,同样要标。
YouTube 那边有两件事。 一是合成内容披露:逼真到可能被误认为真实人物、地点或事件的内容必须在后台打标。二是它把原来的"重复内容"政策改名并扩大了打击范围,现在针对的是批量模板化生产——机械 TTS 配图库幻灯片、逐字念稿、没有叙事结构的堆砌,走的是警告到暂停到永久移出的三振机制。
有一个流传很广的误解值得澄清:打了 AI 披露标签本身不影响变现。 被打击的是低质量的批量生产,不是 AI 辅助本身。只要内容有原创价值、不是复制粘贴的流水线产物,用不用 AI 不影响资格。(这一条我找到的都是二手来源,没能拿到官方帮助中心的原文,建议自己再核一遍。)
生成式视频怎么用。 我的建议很保守:不要用它伪造真实场景。 不要生成一个不存在的咖啡馆、不要生成你没去过的地方。这类内容会被认出来,而且一旦被认出来,损失的是你在所有内容上的可信度——这个代价远大于省下的拍摄时间。合理的用法只有两类:抽象的转场纹理,和明确呈现为特效的夸张镜头。
顺带说一个必须更新的事实:OpenAI 的 Sora 在 2026 年上半年已经停服了,Web 和 App 先停,API 也公布了停服时间。如果你在网上看到把它列进工具链的教程,那篇文章已经过期了。这也顺便说明了一件事——不要把流水线的关键环节绑在单一闭源服务上。我这条流水线的核心(ffmpeg、切分、转写、去静音)全部是本地开源工具,这不是洁癖,是因为它们不会某天早上告诉我下个月停服。
一份可以照着做的启动清单
如果你现在要从零开始,我建议的顺序是这样,每一步都不要跳到下一步之前就想着优化:
第一周:只解决"拍什么”。 把四条线各写一份 shot list,存成手机备忘录。这一周不碰任何工具,就按 shot list 拍,用手机原生相机也行。目标是验证 shot list 本身合不合理。
第二周:固定拍摄参数。 装 Blackmagic Camera,把 24fps / 180° 快门 / Log / 手动锁定存成预设。屏幕录制那条线把环境预置做成一个脚本(改字号、清历史、关通知)。
第三周:搭最小流水线。 只做三件事:ffmpeg 归一化、faster-whisper 转写、auto-editor 去静音。三个命令,一个 shell 脚本串起来。先不要碰 EDL。
第四周:开始出片,手动剪。 用前三周的素材连续出五条,全部手动剪。这一步的目的是让你知道自己的剪辑决策模式是什么——你不知道这个,就写不出有用的 EDL 提示词。
第二个月:把重复的决策写进 EDL 生成。 这时候你已经有五条片子的经验,知道自己每次都在做哪些相同的判断。把那些判断写成提示词和 schema。
第三个月:接发布。 先接 YouTube,跑通之后再考虑其他平台。
我想强调这个顺序里最反直觉的一点:流水线要在你已经手动做过五遍之后再搭。 我见过(也做过)的最常见的失败模式是反过来——先花两周搭一套很漂亮的自动化,然后发现它自动化的是错的环节。你不能自动化一个你还没做对过的流程。
最后
回到开头那个六小时剪出五十八秒的下午。
现在同样的内容,我的流水线跑完粗剪大概二十分钟,手动精修一小时。但这不是这套东西最重要的收益。
最重要的收益是,我不再需要每次重新耗一遍意志力。过去每一条视频都是一次从零开始的消耗,现在每一条都在往同一个装置里添零件。 shot list 会越来越准,EDL 模板会越来越贴我自己的节奏,发布 manifest 会越来越省事。这是资产和消耗的区别,也是我认为超级个体做内容唯一能跑通的路径——不是靠单条爆款,是靠让每一条的固定成本持续下降。
至于 AI 在这里面的位置,我现在的看法比一年前保守很多。它把那 98.4% 的机械劳动接走了,这很值钱。但它接不走剩下那 1.6%,而且它接走的越多,剩下那 1.6% 的相对重要性就越高——因为当所有人的 98.4% 都被同一批工具拉平之后,能区分你和别人的就只剩下那一小撮判断了。
所以真正的问题从来不是"我该用哪个 AI 剪辑工具”。是你有没有一件只有你能讲的事。有的话,工具链只是把它送出去的管道,粗糙一点也没关系。没有的话,再顺畅的流水线也只是在批量生产 60 分。
一些说明。 这篇里的工具状态、定价、平台政策我在写的时候核过一遍,但这块变动极快——过去一年里就发生了 Sora 停服、Topaz 的买断制终止转全订阅、CapCut 国际版套餐重构涨价这几件事,任何一篇写于半年前的教程现在都有过期条款。落地前请自己核一遍官网。涉及配额和审核规则的具体数字(YouTube 的每日上传上限、TikTok 的频率限制)我引用的多为二手来源,方向可信,精确数值请以官方文档为准。至于小红书没有通用官方发布 API 这一条,我没能拿到官方文档的正面确认,是从间接证据推的,如果你有相反的一手信息,欢迎告诉我。




读者回响