去年冬天有一次我算了一笔很难看的账。
那天我在一家咖啡馆待了一整个下午,边写代码边拍素材,手机和录屏加起来大概四十分钟。晚上回去开始剪,凌晨一点半导出,成片五十八秒。
四十分钟素材,六个小时剪辑,五十八秒成片。发出去之后数据也很普通。
我第一反应是"剪辑效率不行,得上 AI"。于是那一个月我把能试的都试了一遍:智能成片、自动踩点、自动字幕、自动调色。效率确实提升了,六个小时压到了两个半小时。但成片变得更没人看了。
后来我才想明白,我一开始就把问题问错了。我要解决的从来不是"剪得慢",而是"我拍的时候没想清楚要剪出什么"。 剪辑之所以耗六个小时,是因为那四十分钟素材里没有结构——我在用剪辑台做本该在出门前就做完的事,而 AI 加速的恰好是我不该做的那部分。
这篇写的是我后来怎么重搭这件事。它同时是一套判断(哪些环节该给 AI、哪些一步都不能让)和一套可以照着做的流程(拍摄参数、目录约定、命令、发布架构)。我自己跑的是四条内容线:AI 产品和技术的拆解、电脑上的屏幕演示、咖啡馆和城市的日常、以及少量徒步。四条线的处理方式不一样,但流水线是同一条。
先把视频放回正确的位置
我在超级个体的情报系统那篇 里借过一个判断,这里想再用一次:一层装备的价值,取决于它的进步是只帮你,还是同时帮你所有对手。
按这个标准,视频剪辑能力属于哪一层?
它属于分发层,不属于生产层。这个区分不是文字游戏,它直接决定了你该在哪儿花时间。
如果视频是生产层,那么"剪得更快更好看"就是核心指标,而 AI 剪辑工具的每一次升级都是纯收益。但视频对超级个体来说不是产出物本身,它是把你已经有的东西——你做的产品、你踩的坑、你的判断——搬运到别人注意力里的通道。通道的价值不由通道的精美程度决定,由它搬运的东西是否稀缺决定。
我后来采用了一条更实用的判断:一条画面不算精致、但带着一手经验的视频,往往比又一条同质化精修片更值得看。AI 剪辑工具能迅速补齐呈现质量,却不能替我经历那件事。
所以第一个判断是:在视频这件事上,把画面质量优化到"不构成阻碍"就可以停手了,再往上投入的边际收益极低。 你的时间应该花在前一步——决定拍什么。
内容的价值来源
│
┌──────────────┴──────────────┐
│ │
只有你有的东西 呈现的精美程度
(一手经历 / 具体数字 / (画质 / 调色 / 转场 /
失败细节 / 判断) 节奏 / 字幕样式)
│ │
AI 无法生成 AI 正在快速追平
也无法替代 并同步发放给所有人
│ │
← 应该在这里花时间 够用就停手 →
为什么一键成片更适合做粗剪
这是我踩得最实的一个坑,值得单独说清楚,因为它的失败原因不是"工具还不够好",而是结构性的。
各家的智能成片、AI 自动剪辑,本质做的是三件事:识别镜头边界、给每个镜头打质量分、按一套通用的节奏模板排序拼接。它做得其实不差——我试过的几个都能吐出一个结构完整、能直接编辑的粗剪,比从空时间线开始要快。
问题在于目标函数。自动剪辑会把素材平滑到一套通用节奏里。在我这组数量有限的测试中,结果通常没有明显错误,也没有留下能记住的选择。
这不等于工具没用。一个能直接继续编辑的粗剪,已经省掉从空时间线开始的摩擦;只是它不能替我决定哪些失败要保留、哪里该沉默、最后到底想说什么。
对我有效的用法恰好相反:用 AI 降低每条内容的固定成本,再把省下来的时间还给证据和判断。 目标不是机械增加产量,而是让每条内容更像真实发生过的事。
把 AI 能做的和不能做的切开
我现在的划分是三档,边界画得比较死,因为模糊地带是效率损失最大的地方。
第一档:确定性搬运,全部交出去。
这些任务的验收条件相对明确,适合让机器先做:
- 转写。语音转文字,用于字幕和后续的文本检索。
- 静音和废话切除。录屏里"呃……让我看一下"这类内容。
- 镜头切分。把一段长素材按画面变化切成独立片段。
- 格式归一。帧率、分辨率、色彩空间、音频采样率统一。
- 字幕烧录、封面尺寸批量导出、多平台画幅裁切。
- 降噪、去背景、超分。
这一档我用脚本跑,不用 GUI。原因下一节说。
第二档:概率性提议,让它出草稿,我做取舍。
- 从转写稿里挑候选片段和金句。
- 生成十个开头钩子的变体。
- 从脚本反推 shot list。
- 生成标题、标签、描述、封面文案的候选。
- 调色的起点(自动白平衡、参考帧匹配)。
关键词是"候选"。我从来不直接采用,我只从里面选。这一档 AI 的价值不在于它选得准,在于它把"从零开始"变成了"从二十个里挑一个"——后者的认知成本低一个量级。
第三档:不可外包的判断,一步都不让。
- 开头。在我自己的短视频样本里,早期退出常聚集在这里,但不存在能解释所有平台和受众的统一"三秒定律"。
- 节奏和留白。AI 知道哪里可以切,不知道哪里应该切。一个停顿是尴尬还是张力,差别在语境里,不在波形里。
- 音乐。
- 最终的色彩风格。
- 结论。你到底想说什么、你的真实判断是什么。
我之前写过 harness 的那个比例——脚手架占 98.4%,判断占 1.6%,但那 1.6% 决定了另外 98.4% 值不值钱。视频这件事上这个比例几乎原封不动地成立。剪辑操作的绝大部分是机械劳动,但成片好坏由那一小撮判断决定。
拍摄端才是真正的杠杆
现在回到开头那个六小时的教训。
剪辑之所以能被自动化,前提是素材有结构。AI 不可能剪出你没拍的镜头,也救不了一堆没有内在逻辑的素材。 所以整条流水线里投入产出比最高的一段,其实是出门前的十分钟。
我的做法是给每条内容线固定一份 shot list,每次拍完全一样的镜头。这样剪辑就从"创作"降级成"填模板",而填模板是可以自动化的。
屏幕演示线(AI 产品拆解、技术 demo)
这条线最该被彻底工程化,因为它的每一个环节都是确定性的,随机因素接近于零。
录制前的固定动作:
- 先写脚本再录。不是逐字稿,是一份分段的 outline,每段一句话说明"这一段要让观众明白什么"。没有它,我很容易录成一段漫无目的的操作。
- 一条视频只讲一个概念。 想讲三个就录三条。
- 环境预置:终端字号调到 16–18pt(默认字号在手机上完全看不清)、清空 shell 历史和会干扰的提示、关掉所有通知、准备一个干净的演示目录、浏览器换成无扩展的独立 profile。
- 我固定用 1920×1080 录制,再从横版构图裁出 9:16 竖版;如果题材本来只服务竖屏,直接竖拍也更合理。
- 窗口不要全屏,留一点边距,后期加圆角和背景更像样。
录制工具我的判断是:OBS 免费开源,稳定,做长内容和直播够用;如果技术演示要发短视频,自动缩放平移工具可能值得付费,因为代码在手机上常常需要推近才能看清,而手工关键帧很耗时。Screen Studio 这类工具的价值就在自动跟随鼠标做缩放和平滑运镜;是否值得购买取决于你的产量,定价也应在下单前去官网复核。
一个具体的技巧:演示失败的部分不要剪掉。 我最开始会把报错、跑不通、绕弯的部分全删掉,只留顺利的路径。后来发现留下来的那些视频数据反而更好。原因不难理解——顺利的路径任何人跑一遍文档都能得到,卡住的地方和怎么绕出来的才是别人搜不到的。这也正好是 AI 生成不出来的东西。
咖啡馆与城市线
这条线的目标是"氛围 + 人设",信息密度可以低,但真实感要求高。
拍摄参数(iPhone + Blackmagic Camera,免费):
| 项 | 设置 | 原因 |
|---|---|---|
| 帧率 | 4K 24fps | 电影感的物理来源。30/60fps 出来是"新闻感" |
| 快门 | 锁 1/48s(180° 法则) | 决定运动模糊的量,太快画面发脆 |
| 色彩 | 支持机型上的 Apple Log | 比直接烘焙风格留出更多调色空间 |
| ISO | 最低可用值 | 咖啡馆光线不足时提 ISO,不要动快门 |
| 白平衡/对焦 | 手动锁定 | 自动模式的忽明忽暗是手机片"不高级"的最大来源 |
| 防抖 | 只用光学,关掉增强防抖 | 见下 |
| 户外 | 夹式 ND 滤镜 5–8 档 | 手机不能收光圈,白天守 1/48s 必过曝 |
把这套存成预设,每次一键调用。
防抖那一条我想多说两句,因为它和直觉相反。手持的微小晃动不是缺陷,是这个风格的信号本身。 过度稳定之后画面会"飘",像悬浮而不是移动,观感上反而假。稳定器抹掉的恰好是那些让运动显得有人味的微小不完美。所以我的做法是:肘部夹紧肋侧,用躯干当稳定器,膝盖微屈,脚跟到脚尖滚动着走。这样得到的是纪录片式的呼吸感,不是廉价的高频抖。
移动镜头用 0.5x 超广角——广角畸变会吸收手抖,比 1x 稳得多,代价是边缘变形,后期裁一点就行。特写用 1x 主摄,禁用数字变焦,想拍近就物理凑近。
固定 shot list(十一个镜头,每个 5–10 秒,全程不超过十五分钟):
1 门头 / 招牌(带推门动作,留给转场)
2 进店第一视角横移
3 点单或菜单特写
4 出杯 / 制作过程(收原声:磨豆、蒸汽)
5 找座、放包、放电脑的动作
6 开机、敲键盘的手部特写
7 屏幕画面(终端 / 编辑器,人设镜头)
8 咖啡放到桌上的特写
9 环境空镜 ×2–3(窗、灯、虚化的人)
10 固定机位工作长镜头 3–5 分钟(后期 10–20 倍速)
11 离店 / 天色变化收尾
这套路径的关键不是它拍得多好,而是它和我本来就要去咖啡馆办公这件事高度重叠,新增成本很低。它因此更容易持续,不必每次重新动员意志力。
徒步线
徒步和前两条最大的区别是:很多现场很难重拍。所以策略要从"拍够素材"改成"优先保证几个锚点镜头"。
我的做法是只强制四个镜头,其余随缘:
- 起点的环境全景(建立空间感)
- 中途最难那一段的主观视角(通常最容易形成叙事张力)
- 一个"人在环境里很小"的远景(这类镜头在任何平台都吃香)
- 终点的回望
我通常会带备用电源;低温下电池续航更容易下降。徒步素材常常冗长而缺少事件,后期可以用加速、环境声和音乐重建节奏。与其记录全程,我更愿意保留能推动故事的少数片段。
可编程流水线
这一节是开发者相对于普通创作者的结构性优势,而且我觉得被严重低估了。
别人的剪辑流程是"每次重新做一遍",你的可以是"写一次,跑一百次"。差别不在单次效率,在于它是资产还是消耗。
素材落盘规范
流水线能跑的前提是输入可预测。我的目录约定:
footage/
2026-07-19_cafe-shenzhen/
raw/ # 原始素材,只读,永不修改
proxy/ # 归一化后的代理文件(脚本生成)
audio/ # 分离出的音轨
transcript/ # 转写结果 json + srt
scenes/ # 切分后的片段
edl.json # 剪辑决策表
out/ # 渲染产物
meta.yaml # 拍摄地点、主题、平台目标
raw/ 只读这条很重要。所有中间产物都可以从 raw/ 加一段脚本重建,这意味着流水线改进之后你可以把历史素材全部重跑一遍。
五个环节
归一化。 所有素材先用 ffmpeg 统一成同一套参数,后面所有环节都不用再处理格式差异。这一步看着无聊,但它消除的是整条链路上最常见的失败来源。
ffmpeg -i raw/IMG_0001.MOV -c:v libx264 -crf 18 -r 24 \
-c:a aac -ar 48000 proxy/0001.mp4
转写。 faster-whisper 本地跑,出 json(带词级时间戳)和 srt。词级时间戳是后面所有文本驱动剪辑的基础,没有它就只能按句子切,精度不够。
需要说明的是,faster-whisper 的更新节奏在 2025 年底之后明显放缓,我理解它属于"成熟停更"而不是废弃——功能稳定、社区还在用,但不要指望它继续快速迭代。
切分。 PySceneDetect 按画面内容变化把长素材切成独立片段,输出一份带时间码的清单。0.7 迁移指南 把它标为破坏性版本:为支持可变帧率视频,时间戳处理被重构,多处 API 也发生迁移。我在 2026-07-31 复核过这份文档;旧脚本应先锁定当前版本,再在升级前跑回归测试。
去静音。 auto-editor 处理录屏和口播素材,把静音段和废话切掉。它可以直接输出剪好的 mp4,也可以输出时间线文件给专业剪辑软件。这个项目更新很活跃,是这条链上我最放心的一环。
LLM 出 EDL。 这是真正把前面几步串起来的一环,也是我认为大部分人没用起来的一环。
思路:把转写稿 + 场景清单 + shot list 模板一起喂给模型,让它输出一份结构化的剪辑决策表,而不是让它"剪视频"。模型处理文本,ffmpeg 处理像素,各干各的。
{
"target": {"platform": "xiaohongshu", "aspect": "9:16", "duration_sec": 58},
"hook": {
"source": "scenes/0007.mp4",
"in": 2.4, "out": 5.1,
"caption": "深圳龙华,30 块坐一下午,插座管够",
"note": "选这个是因为画面里有插座特写,直接兑现标题承诺"
},
"timeline": [
{"source": "scenes/0003.mp4", "in": 0.0, "out": 2.8, "speed": 1.0},
{"source": "scenes/0011.mp4", "in": 12.5, "out": 15.0, "speed": 1.0,
"audio_lead_in": 0.5},
{"source": "scenes/0018.mp4", "in": 0.0, "out": 40.0, "speed": 16.0}
],
"captions_srt": "transcript/final.srt",
"cta": "评论区问我要具体位置"
}
有了这个 schema,渲染就是一段确定性代码,而且每一次剪辑决策都变成了可 diff、可版本化、可复用的文本。上一期的 EDL 可以直接当下一期的模板。你甚至可以把数据回灌进来——哪一类开头留人率高,直接写进下次生成 EDL 的提示里。
这类"LLM 出 EDL"的开源项目 2025 年之后冒出来不少,但我看下来还没有一个进入生产级生态位,基本都是个人或小团队项目。我的建议是看思路不要看具体实现,自己按上面的结构写一份两百行的脚本,比接入任何一个都可控。
最后 20% 交回 GUI
流水线跑到粗剪为止。最后的调色、音乐、字幕样式、节奏微调,我在 GUI 里手动做。
调色我用 DaVinci Resolve,因为我熟悉它的控制方式;这只是工作流偏好,不是对 2026 年 7 月产品档位和性价比的普遍结论。功能归属与价格会变,购买前应以 Blackmagic Design 当时的产品页为准。
Log 素材的调色顺序:先套转换 LUT 还原、再用色轮平衡、降饱和 5–10%、阴影推一点青绿高光推一点暖、最后叠胶片颗粒(强度 20–30%,不要拉满)。导出时关掉任何"智能补帧 / 流畅"选项——24fps 拍就 24fps 导,补帧会把前面所有的帧感努力全部抹掉。
我目前会用剪映处理一部分竖版和字幕,因为它在我的流程里够快。客户素材和未发布内容仍留在本地;我没有完成逐法域的服务条款审查,所以这里只说明自己的安全边界,不把它写成法律结论。
四条内容线其实是一个人设
这一节讲平台切入点,但要从定位说起,因为切入点是定位的推论。
我一开始的错误是把四条线当成四个题材,每条线都想找一个"这个题材里没人做的角度"。这条路走不通,因为每个题材里的空位都在快速被填满。
后来的思路是反过来的:四条线不是四个题材,是同一个人的四种曝光度。
一个人设
「一个人带一队 agent 在世界各地干活」
│
┌────────┬───────┴───────┬────────┐
│ │ │ │
AI 拆解 屏幕演示 咖啡馆 徒步
│ │ │ │
最高信息 过程证据 生活质感 人的部分
密度 (证明你是活人)
│ │ │ │
建立专业 建立可信 建立亲近 建立记忆点
四条线里,中间两条是主线,两头是辅线。AI 拆解建立你懂什么,屏幕演示证明你真的做出来了,咖啡馆和徒步证明说这些话的是一个具体的人而不是一个账号。
这个结构的好处是:任何一条线的内容都在给另外三条充值。 你在咖啡馆拍的那个屏幕镜头,观众看到的是你在写代码;你在技术演示里提一句"这是我在清迈那家店改的",人设线就被顺手喂了一口。而如果你把它们当四个独立题材做,四条线就是四份成本,互不相干。
切入点:别在"测评"里挤
AI 工具测评是 2026 年最红的红海,因为它的生产成本被 AI 自己压到了地板。任何人花两小时都能产出一条"我试了十个 AI 剪辑工具"。
我的判断是:从"这个工具怎么样"切换到"我用它真的做完了一件事"。
差别在于前者是可复制的信息,后者是不可复制的过程证据。前者 AI 能生成,后者不能——因为它需要你真的花时间失败过。而观众和算法在 2026 年都在快速提高对"有没有真做过"的辨别力。
具体到选题模式,我现在优先做的三类:
- 完整的过程记录。 不是"教你用 X",是"我用 X 做完了 Y,中间踩了这三个坑"。带具体数字、具体报错、具体的绕法。
- 成本和账。 “这套流程我一个月花多少钱"“哪个订阅我退了为什么”。这类内容极难 AI 生成,因为它需要真实的账单。
- 反常识的否定结论。 “这个功能我用了三个月,最后关掉了”。否定结论天然稀缺,因为它需要长期使用才敢下。
我自己的四平台分工
下面只是我怎么使用这些平台,不代表平台排名、受众画像或账号资格的普遍结论:
| 平台 | 我发布的形态 | 在我的流程里 | 我测试的切入点 |
|---|---|---|---|
| B 站 | 长视频 | 主阵地,放完整过程 | 技术深度 + 完整叙事,观众容忍长度 |
| YouTube | 长 + Shorts | 英文内容,长尾复利 | 英文技术圈的搜索长尾 + 数字游民 |
| 小红书 | 竖屏短 + 图文 | 生活线和轻技术 | 搜索驱动,标题要带长尾词 |
| 抖音 | 竖屏短 | 拉新,不做主阵地 | 强钩子,信息密度低但要有记忆点 |
我没有找到能量化小红书搜索占比或转化率的公开一手资料。能确认的只有自己的样本:包含地点和具体问题的标题,往往比情绪文案更久地获得发现。“在深圳龙华找到一家能坐一下午的咖啡馆"也比"今天的 vibe"更直接地告诉人这条内容有什么。
长内容和短内容不必是两套素材。我的做法是:先按长内容所需的上下文拍,再从中切短片。 这适合过程型内容;若选题天生只服务竖屏短视频,直接为短片设计更省事。
自动发布:诚实说清楚能做到哪一步
这是我发现网上信息最不靠谱的一块。很多文章写得像是接个 API 就能一键全平台分发,实际情况差得远。
下面是我在 2026-07-31 能从一手资料确认的边界:
YouTube 要拆成频道权限、API 项目审计和上传配额三件事。 官方 videos.insert 接口
可以上传视频,但 2020 年 7 月 28 日以后创建、且尚未通过合规审计的 API 项目,上传内容会被限制为仅私人可见。这是开发者项目的限制,不等于创作者频道没有资格。Google 的配额计算页
在复核当天列出独立的 Video Uploads 配额桶:每次 videos.insert 消耗 1 个单位,默认每天 100 次。它是默认 API 配额,不是鼓励频道每天发布 100 条。
TikTok 也要拆成创作者授权与开发者客户端审核。 创作者先授权应用发布,开发者的 API client 另有审核状态。TikTok 的内容分享指南
写明:未审核客户端只能用 SELF_ONLY 可见性,并且 24 小时内最多服务 5 个用户;审核前后仍受创作者与发布频率限制,文档给出的典型上限约为每位创作者每天 15 条,但实际值可能变化。这说明的是 API 能力和客户端审核,不是所有创作者账号都自动获得发布资格。
抖音、B 站和小红书要分别看三层:创作者账号资格、开发者应用审核、应用最终获批的 API scope。 我在 2026-07-31 的公开一手资料调查,既不能证明个人一律无资格,也不能证明企业申请必然获批,更不能证明普通开发者稳定拥有通用服务端发布接口。除非平台明确为我的应用授予所需发布 scope,我就把这三个目的地保留为手动投递。这是当日调查结论,不是对平台内部能力的断言。
关于浏览器自动化方案。 我见过模拟登录和发布的项目,但没有逐一审计这些工具,也没有逐平台完成最新协议分析。我的边界更简单:不把主账号的 session cookie 交给非官方发布器。即使暂不讨论条款,这也是一条值得保留的安全边界。
所以现实架构是半自动
我的结论是:把发布拆成"准备"和"投递"两段,准备段全自动,投递段分平台处理。
渲染完成
│
▼
┌──────────────────────────────────────┐
│ 自动:生成分发清单 manifest.yaml │
│ · 各平台画幅版本(16:9 / 9:16 / 4:5)│
│ · 各平台标题 / 描述 / 标签(LLM 生成 │
│ 候选,人工确认) │
│ · 封面图批量导出 │
│ · 首评文案、置顶评论 │
│ · AI 使用情况声明(见下节) │
└──────────────────────────────────────┘
│
├──► YouTube :官方 API,在审计与配额范围内
├──► TikTok :官方 API,在已获批 scope 内
├──► B 站/抖音 :除非应用获批发布 scope,否则手动
└──► 小红书 :当前工作流保持手机手动发布
这个架构的价值在于:手动部分被压缩成了机械操作。 我不需要在发布时再想标题、裁画幅、写标签,manifest 已经准备好了。剩下的步骤通常很短,但具体时间取决于每个平台当时的审核与交互。
这里有个判断我想说清楚:对我的主账号,追求 100% 全自动并不划算。 最后一次人工确认提供了复查窗口——我会在这里发现标题不对、封面选错,或者干脆决定这条不该发。保留人在回路里,不只是技术妥协,也是编辑选择。
合规:这一节不能跳
2026 年做 AI 辅助的内容,标识规则是硬约束,不是可选项。
中国的《人工智能生成合成内容标识办法》已于 2025 年 9 月 1 日施行。 我在 2026-07-31 复核的官方文本 覆盖文本、图片、音频、视频和虚拟场景,并区分显式标识与文件元数据中的隐式标识。不同角色承担的义务并不相同:生成合成服务提供者按规定添加标识,内容传播服务提供者核验或补充提示,用户发布生成合成内容时主动声明并使用平台提供的标识功能;恶意删除、篡改、伪造或隐匿规定标识也被禁止。
这份办法并不支持"只要工作流里出现过任何 AI,就一律使用同一种标签"的捷径。我的实践是按具体内容与平台流程判断:发布生成合成内容时主动声明,保留来源和处理记录,不主动清除已有的合规元数据。
YouTube 有两套需要分开的规则。 官方的更改或合成内容说明 要求披露经过实质性更改或生成、且看起来真实的内容,例如伪造真实事件或地点;轻微编辑,以及用 AI 辅助提纲、字幕、标题或缩略图,并不因此自动要求披露。同一页面也明确说,披露本身不会限制受众或变现资格。
另一套是频道获利政策 :YouTube 在 2025 年 7 月把原来的"重复性内容"改称"非原创内容(inauthentic content)",用于澄清重复或批量生产内容不符合获利要求;“重复使用的内容(reused content)“仍是另一项判断,关注借用素材是否加入了有意义的原创评论或改造。官方页面没有原稿所写的自动"三振"路径,具体处置要看对应政策和审核结果。
生成式视频怎么用。 我的建议很保守:不要用它伪造真实场景。 不要生成一个不存在的咖啡馆、不要生成你没去过的地方。这类内容会被认出来,而且一旦被认出来,损失的是你在所有内容上的可信度——这个代价远大于省下的拍摄时间。合理的用法只有两类:抽象的转场纹理,和明确呈现为特效的夸张镜头。
这里还有一条需要精确到日期的时间线。OpenAI 的 Sora 停服公告 写明:Web 与 App 已在 2026 年 4 月 26 日结束服务,API 将于 2026 年 9 月 24 日结束服务。因此我不再把它列为这条流水线的可持续环节。这也说明:不要让关键步骤只依赖一个托管服务。 我的核心环节——ffmpeg、场景切分、转写和去静音——都可以在本地运行。
一份可以照着做的启动清单
如果你现在要从零开始,我建议的顺序是这样,每一步都不要跳到下一步之前就想着优化:
第一周:只解决"拍什么”。 把四条线各写一份 shot list,存成手机备忘录。这一周不碰任何工具,就按 shot list 拍,用手机原生相机也行。目标是验证 shot list 本身合不合理。
第二周:固定拍摄参数。 装 Blackmagic Camera,把 24fps / 180° 快门 / Log / 手动锁定存成预设。屏幕录制那条线把环境预置做成一个脚本(改字号、清历史、关通知)。
第三周:搭最小流水线。 只做三件事:ffmpeg 归一化、faster-whisper 转写、auto-editor 去静音。三个命令,一个 shell 脚本串起来。先不要碰 EDL。
第四周:开始出片,手动剪。 用前三周的素材连续出五条,全部手动剪。这一步的目的是让你知道自己的剪辑决策模式是什么——你不知道这个,就写不出有用的 EDL 提示词。
第二个月:把重复的决策写进 EDL 生成。 这时候你已经有五条片子的经验,知道自己每次都在做哪些相同的判断。把那些判断写成提示词和 schema。
第三个月:接发布。 先接 YouTube,跑通之后再考虑其他平台。
我想强调这个顺序里最反直觉的一点:我会先手动做过几遍,再搭流水线。 五条只是一个便于启动的经验值,不是定律。先观察自己反复做出的剪辑决定,才知道哪些步骤值得写进自动化;否则很容易把错误流程跑得更快。
最后
回到开头那个六小时剪出五十八秒的下午。
现在同样的内容,我的流水线跑完粗剪大概二十分钟,手动精修一小时。但这不是这套东西最重要的收益。
最重要的收益是,我不再需要每次重新耗一遍意志力。过去每一条视频都是一次从零开始的消耗,现在每一条都在往同一个装置里添零件。 shot list 会越来越准,EDL 模板会越来越贴我自己的节奏,发布 manifest 会越来越省事。对我而言,这是一条比押注单条爆款更可持续的路:让每一条的固定成本继续下降。
至于 AI 在这里面的位置,我现在的看法比一年前保守很多。98.4% 和 1.6% 只是我借来提醒自己的比喻,并非测量结果:机械劳动可以交给工具,但少数编辑判断仍会决定成片是否值得看。工具越普及,那些判断就越显眼。
所以真正的问题很少只是"我该用哪个 AI 剪辑工具”,而是我有没有一件亲自做过、能够讲清楚的事。有的话,工具链只是把它送出去的管道;没有的话,再顺畅的流水线也很容易走向同质化。
核验说明。 文中的平台政策、配额、审核与工具版本核验于 2026-07-31。YouTube、TikTok、中国 AI 内容标识、PySceneDetect 与 Sora 的具体事实均直接链接一手文档;抖音、B 站、小红书无法由公开一手资料证明的部分,已明确写成作者当日调查与个人工作流,而不是平台的普遍规则。落地前仍应再次核对官网,因为权限、配额和产品状态会继续变化。




读者回响