Xinwei Xiong · 2026 年 7 月 19 日
21 分钟 · 10135 字 · | EN

独立创作者的 AI 视频剪辑流水线:拍摄、粗剪与多平台发布

面向独立创作者的AI视频剪辑流水线:先用镜头清单约束拍摄,再由ffmpeg、faster-whisper、PySceneDetect和结构化EDL完成粗剪,把节奏与判断留给人。文章核验截至2026年7月31日的平台发布边界、AI内容标识和Sora停服时间,帮助开发者降低重复劳动并守住原创表达与账号安全。

独立创作者从拍摄到多平台发布的 AI 视频剪辑流水线

去年冬天有一次我算了一笔很难看的账。

那天我在一家咖啡馆待了一整个下午,边写代码边拍素材,手机和录屏加起来大概四十分钟。晚上回去开始剪,凌晨一点半导出,成片五十八秒。

四十分钟素材,六个小时剪辑,五十八秒成片。发出去之后数据也很普通。

我第一反应是"剪辑效率不行,得上 AI"。于是那一个月我把能试的都试了一遍:智能成片、自动踩点、自动字幕、自动调色。效率确实提升了,六个小时压到了两个半小时。但成片变得更没人看了。

后来我才想明白,我一开始就把问题问错了。我要解决的从来不是"剪得慢",而是"我拍的时候没想清楚要剪出什么"。 剪辑之所以耗六个小时,是因为那四十分钟素材里没有结构——我在用剪辑台做本该在出门前就做完的事,而 AI 加速的恰好是我不该做的那部分。

这篇写的是我后来怎么重搭这件事。它同时是一套判断(哪些环节该给 AI、哪些一步都不能让)和一套可以照着做的流程(拍摄参数、目录约定、命令、发布架构)。我自己跑的是四条内容线:AI 产品和技术的拆解、电脑上的屏幕演示、咖啡馆和城市的日常、以及少量徒步。四条线的处理方式不一样,但流水线是同一条。

先把视频放回正确的位置

我在超级个体的情报系统那篇 里借过一个判断,这里想再用一次:一层装备的价值,取决于它的进步是只帮你,还是同时帮你所有对手。

按这个标准,视频剪辑能力属于哪一层?

它属于分发层,不属于生产层。这个区分不是文字游戏,它直接决定了你该在哪儿花时间。

如果视频是生产层,那么"剪得更快更好看"就是核心指标,而 AI 剪辑工具的每一次升级都是纯收益。但视频对超级个体来说不是产出物本身,它是把你已经有的东西——你做的产品、你踩的坑、你的判断——搬运到别人注意力里的通道。通道的价值不由通道的精美程度决定,由它搬运的东西是否稀缺决定。

我后来采用了一条更实用的判断:一条画面不算精致、但带着一手经验的视频,往往比又一条同质化精修片更值得看。AI 剪辑工具能迅速补齐呈现质量,却不能替我经历那件事。

所以第一个判断是:在视频这件事上,把画面质量优化到"不构成阻碍"就可以停手了,再往上投入的边际收益极低。 你的时间应该花在前一步——决定拍什么。

                内容的价值来源
                      │
       ┌──────────────┴──────────────┐
       │                             │
  只有你有的东西                  呈现的精美程度
  (一手经历 / 具体数字 /        (画质 / 调色 / 转场 /
   失败细节 / 判断)              节奏 / 字幕样式)
       │                             │
  AI 无法生成                    AI 正在快速追平
  也无法替代                     并同步发放给所有人
       │                             │
   ← 应该在这里花时间          够用就停手 →

为什么一键成片更适合做粗剪

这是我踩得最实的一个坑,值得单独说清楚,因为它的失败原因不是"工具还不够好",而是结构性的。

各家的智能成片、AI 自动剪辑,本质做的是三件事:识别镜头边界、给每个镜头打质量分、按一套通用的节奏模板排序拼接。它做得其实不差——我试过的几个都能吐出一个结构完整、能直接编辑的粗剪,比从空时间线开始要快。

问题在于目标函数。自动剪辑会把素材平滑到一套通用节奏里。在我这组数量有限的测试中,结果通常没有明显错误,也没有留下能记住的选择。

这不等于工具没用。一个能直接继续编辑的粗剪,已经省掉从空时间线开始的摩擦;只是它不能替我决定哪些失败要保留、哪里该沉默、最后到底想说什么。

对我有效的用法恰好相反:用 AI 降低每条内容的固定成本,再把省下来的时间还给证据和判断。 目标不是机械增加产量,而是让每条内容更像真实发生过的事。

把 AI 能做的和不能做的切开

我现在的划分是三档,边界画得比较死,因为模糊地带是效率损失最大的地方。

第一档:确定性搬运,全部交出去。

这些任务的验收条件相对明确,适合让机器先做:

  • 转写。语音转文字,用于字幕和后续的文本检索。
  • 静音和废话切除。录屏里"呃……让我看一下"这类内容。
  • 镜头切分。把一段长素材按画面变化切成独立片段。
  • 格式归一。帧率、分辨率、色彩空间、音频采样率统一。
  • 字幕烧录、封面尺寸批量导出、多平台画幅裁切。
  • 降噪、去背景、超分。

这一档我用脚本跑,不用 GUI。原因下一节说。

第二档:概率性提议,让它出草稿,我做取舍。

  • 从转写稿里挑候选片段和金句。
  • 生成十个开头钩子的变体。
  • 从脚本反推 shot list。
  • 生成标题、标签、描述、封面文案的候选。
  • 调色的起点(自动白平衡、参考帧匹配)。

关键词是"候选"。我从来不直接采用,我只从里面选。这一档 AI 的价值不在于它选得准,在于它把"从零开始"变成了"从二十个里挑一个"——后者的认知成本低一个量级。

第三档:不可外包的判断,一步都不让。

  • 开头。在我自己的短视频样本里,早期退出常聚集在这里,但不存在能解释所有平台和受众的统一"三秒定律"。
  • 节奏和留白。AI 知道哪里可以切,不知道哪里应该切。一个停顿是尴尬还是张力,差别在语境里,不在波形里。
  • 音乐。
  • 最终的色彩风格。
  • 结论。你到底想说什么、你的真实判断是什么。

我之前写过 harness 的那个比例——脚手架占 98.4%,判断占 1.6%,但那 1.6% 决定了另外 98.4% 值不值钱。视频这件事上这个比例几乎原封不动地成立。剪辑操作的绝大部分是机械劳动,但成片好坏由那一小撮判断决定。

拍摄端才是真正的杠杆

现在回到开头那个六小时的教训。

剪辑之所以能被自动化,前提是素材有结构。AI 不可能剪出你没拍的镜头,也救不了一堆没有内在逻辑的素材。 所以整条流水线里投入产出比最高的一段,其实是出门前的十分钟。

我的做法是给每条内容线固定一份 shot list,每次拍完全一样的镜头。这样剪辑就从"创作"降级成"填模板",而填模板是可以自动化的。

屏幕演示线(AI 产品拆解、技术 demo)

这条线最该被彻底工程化,因为它的每一个环节都是确定性的,随机因素接近于零。

录制前的固定动作:

  • 先写脚本再录。不是逐字稿,是一份分段的 outline,每段一句话说明"这一段要让观众明白什么"。没有它,我很容易录成一段漫无目的的操作。
  • 一条视频只讲一个概念。 想讲三个就录三条。
  • 环境预置:终端字号调到 16–18pt(默认字号在手机上完全看不清)、清空 shell 历史和会干扰的提示、关掉所有通知、准备一个干净的演示目录、浏览器换成无扩展的独立 profile。
  • 我固定用 1920×1080 录制,再从横版构图裁出 9:16 竖版;如果题材本来只服务竖屏,直接竖拍也更合理。
  • 窗口不要全屏,留一点边距,后期加圆角和背景更像样。

录制工具我的判断是:OBS 免费开源,稳定,做长内容和直播够用;如果技术演示要发短视频,自动缩放平移工具可能值得付费,因为代码在手机上常常需要推近才能看清,而手工关键帧很耗时。Screen Studio 这类工具的价值就在自动跟随鼠标做缩放和平滑运镜;是否值得购买取决于你的产量,定价也应在下单前去官网复核。

一个具体的技巧:演示失败的部分不要剪掉。 我最开始会把报错、跑不通、绕弯的部分全删掉,只留顺利的路径。后来发现留下来的那些视频数据反而更好。原因不难理解——顺利的路径任何人跑一遍文档都能得到,卡住的地方和怎么绕出来的才是别人搜不到的。这也正好是 AI 生成不出来的东西。

咖啡馆与城市线

这条线的目标是"氛围 + 人设",信息密度可以低,但真实感要求高。

拍摄参数(iPhone + Blackmagic Camera,免费):

设置原因
帧率4K 24fps电影感的物理来源。30/60fps 出来是"新闻感"
快门锁 1/48s(180° 法则)决定运动模糊的量,太快画面发脆
色彩支持机型上的 Apple Log比直接烘焙风格留出更多调色空间
ISO最低可用值咖啡馆光线不足时提 ISO,不要动快门
白平衡/对焦手动锁定自动模式的忽明忽暗是手机片"不高级"的最大来源
防抖只用光学,关掉增强防抖见下
户外夹式 ND 滤镜 5–8 档手机不能收光圈,白天守 1/48s 必过曝

把这套存成预设,每次一键调用。

防抖那一条我想多说两句,因为它和直觉相反。手持的微小晃动不是缺陷,是这个风格的信号本身。 过度稳定之后画面会"飘",像悬浮而不是移动,观感上反而假。稳定器抹掉的恰好是那些让运动显得有人味的微小不完美。所以我的做法是:肘部夹紧肋侧,用躯干当稳定器,膝盖微屈,脚跟到脚尖滚动着走。这样得到的是纪录片式的呼吸感,不是廉价的高频抖。

移动镜头用 0.5x 超广角——广角畸变会吸收手抖,比 1x 稳得多,代价是边缘变形,后期裁一点就行。特写用 1x 主摄,禁用数字变焦,想拍近就物理凑近。

固定 shot list(十一个镜头,每个 5–10 秒,全程不超过十五分钟):

1  门头 / 招牌(带推门动作,留给转场)
2  进店第一视角横移
3  点单或菜单特写
4  出杯 / 制作过程(收原声:磨豆、蒸汽)
5  找座、放包、放电脑的动作
6  开机、敲键盘的手部特写
7  屏幕画面(终端 / 编辑器,人设镜头)
8  咖啡放到桌上的特写
9  环境空镜 ×2–3(窗、灯、虚化的人)
10 固定机位工作长镜头 3–5 分钟(后期 10–20 倍速)
11 离店 / 天色变化收尾

这套路径的关键不是它拍得多好,而是它和我本来就要去咖啡馆办公这件事高度重叠,新增成本很低。它因此更容易持续,不必每次重新动员意志力。

徒步线

徒步和前两条最大的区别是:很多现场很难重拍。所以策略要从"拍够素材"改成"优先保证几个锚点镜头"。

我的做法是只强制四个镜头,其余随缘:

  1. 起点的环境全景(建立空间感)
  2. 中途最难那一段的主观视角(通常最容易形成叙事张力)
  3. 一个"人在环境里很小"的远景(这类镜头在任何平台都吃香)
  4. 终点的回望

我通常会带备用电源;低温下电池续航更容易下降。徒步素材常常冗长而缺少事件,后期可以用加速、环境声和音乐重建节奏。与其记录全程,我更愿意保留能推动故事的少数片段。

可编程流水线

这一节是开发者相对于普通创作者的结构性优势,而且我觉得被严重低估了。

别人的剪辑流程是"每次重新做一遍",你的可以是"写一次,跑一百次"。差别不在单次效率,在于它是资产还是消耗

素材落盘规范

流水线能跑的前提是输入可预测。我的目录约定:

footage/
  2026-07-19_cafe-shenzhen/
    raw/          # 原始素材,只读,永不修改
    proxy/        # 归一化后的代理文件(脚本生成)
    audio/        # 分离出的音轨
    transcript/   # 转写结果 json + srt
    scenes/       # 切分后的片段
    edl.json      # 剪辑决策表
    out/          # 渲染产物
    meta.yaml     # 拍摄地点、主题、平台目标

raw/ 只读这条很重要。所有中间产物都可以从 raw/ 加一段脚本重建,这意味着流水线改进之后你可以把历史素材全部重跑一遍。

五个环节

归一化。 所有素材先用 ffmpeg 统一成同一套参数,后面所有环节都不用再处理格式差异。这一步看着无聊,但它消除的是整条链路上最常见的失败来源。

ffmpeg -i raw/IMG_0001.MOV -c:v libx264 -crf 18 -r 24 \
       -c:a aac -ar 48000 proxy/0001.mp4

转写。 faster-whisper 本地跑,出 json(带词级时间戳)和 srt。词级时间戳是后面所有文本驱动剪辑的基础,没有它就只能按句子切,精度不够。

需要说明的是,faster-whisper 的更新节奏在 2025 年底之后明显放缓,我理解它属于"成熟停更"而不是废弃——功能稳定、社区还在用,但不要指望它继续快速迭代。

切分。 PySceneDetect 按画面内容变化把长素材切成独立片段,输出一份带时间码的清单。0.7 迁移指南 把它标为破坏性版本:为支持可变帧率视频,时间戳处理被重构,多处 API 也发生迁移。我在 2026-07-31 复核过这份文档;旧脚本应先锁定当前版本,再在升级前跑回归测试。

去静音。 auto-editor 处理录屏和口播素材,把静音段和废话切掉。它可以直接输出剪好的 mp4,也可以输出时间线文件给专业剪辑软件。这个项目更新很活跃,是这条链上我最放心的一环。

LLM 出 EDL。 这是真正把前面几步串起来的一环,也是我认为大部分人没用起来的一环。

思路:把转写稿 + 场景清单 + shot list 模板一起喂给模型,让它输出一份结构化的剪辑决策表,而不是让它"剪视频"。模型处理文本,ffmpeg 处理像素,各干各的。

{
  "target": {"platform": "xiaohongshu", "aspect": "9:16", "duration_sec": 58},
  "hook": {
    "source": "scenes/0007.mp4",
    "in": 2.4, "out": 5.1,
    "caption": "深圳龙华,30 块坐一下午,插座管够",
    "note": "选这个是因为画面里有插座特写,直接兑现标题承诺"
  },
  "timeline": [
    {"source": "scenes/0003.mp4", "in": 0.0,  "out": 2.8, "speed": 1.0},
    {"source": "scenes/0011.mp4", "in": 12.5, "out": 15.0, "speed": 1.0,
     "audio_lead_in": 0.5},
    {"source": "scenes/0018.mp4", "in": 0.0,  "out": 40.0, "speed": 16.0}
  ],
  "captions_srt": "transcript/final.srt",
  "cta": "评论区问我要具体位置"
}

有了这个 schema,渲染就是一段确定性代码,而且每一次剪辑决策都变成了可 diff、可版本化、可复用的文本。上一期的 EDL 可以直接当下一期的模板。你甚至可以把数据回灌进来——哪一类开头留人率高,直接写进下次生成 EDL 的提示里。

这类"LLM 出 EDL"的开源项目 2025 年之后冒出来不少,但我看下来还没有一个进入生产级生态位,基本都是个人或小团队项目。我的建议是看思路不要看具体实现,自己按上面的结构写一份两百行的脚本,比接入任何一个都可控。

最后 20% 交回 GUI

流水线跑到粗剪为止。最后的调色、音乐、字幕样式、节奏微调,我在 GUI 里手动做。

调色我用 DaVinci Resolve,因为我熟悉它的控制方式;这只是工作流偏好,不是对 2026 年 7 月产品档位和性价比的普遍结论。功能归属与价格会变,购买前应以 Blackmagic Design 当时的产品页为准。

Log 素材的调色顺序:先套转换 LUT 还原、再用色轮平衡、降饱和 5–10%、阴影推一点青绿高光推一点暖、最后叠胶片颗粒(强度 20–30%,不要拉满)。导出时关掉任何"智能补帧 / 流畅"选项——24fps 拍就 24fps 导,补帧会把前面所有的帧感努力全部抹掉。

我目前会用剪映处理一部分竖版和字幕,因为它在我的流程里够快。客户素材和未发布内容仍留在本地;我没有完成逐法域的服务条款审查,所以这里只说明自己的安全边界,不把它写成法律结论。

四条内容线其实是一个人设

这一节讲平台切入点,但要从定位说起,因为切入点是定位的推论。

我一开始的错误是把四条线当成四个题材,每条线都想找一个"这个题材里没人做的角度"。这条路走不通,因为每个题材里的空位都在快速被填满。

后来的思路是反过来的:四条线不是四个题材,是同一个人的四种曝光度。

                    一个人设
        「一个人带一队 agent 在世界各地干活」
                       │
      ┌────────┬───────┴───────┬────────┐
      │        │               │        │
   AI 拆解   屏幕演示        咖啡馆     徒步
      │        │               │        │
   最高信息   过程证据       生活质感   人的部分
   密度                                (证明你是活人)
      │        │               │        │
   建立专业   建立可信       建立亲近   建立记忆点

四条线里,中间两条是主线,两头是辅线。AI 拆解建立你懂什么,屏幕演示证明你真的做出来了,咖啡馆和徒步证明说这些话的是一个具体的人而不是一个账号。

这个结构的好处是:任何一条线的内容都在给另外三条充值。 你在咖啡馆拍的那个屏幕镜头,观众看到的是你在写代码;你在技术演示里提一句"这是我在清迈那家店改的",人设线就被顺手喂了一口。而如果你把它们当四个独立题材做,四条线就是四份成本,互不相干。

切入点:别在"测评"里挤

AI 工具测评是 2026 年最红的红海,因为它的生产成本被 AI 自己压到了地板。任何人花两小时都能产出一条"我试了十个 AI 剪辑工具"。

我的判断是:从"这个工具怎么样"切换到"我用它真的做完了一件事"。

差别在于前者是可复制的信息,后者是不可复制的过程证据。前者 AI 能生成,后者不能——因为它需要你真的花时间失败过。而观众和算法在 2026 年都在快速提高对"有没有真做过"的辨别力。

具体到选题模式,我现在优先做的三类:

  1. 完整的过程记录。 不是"教你用 X",是"我用 X 做完了 Y,中间踩了这三个坑"。带具体数字、具体报错、具体的绕法。
  2. 成本和账。 “这套流程我一个月花多少钱"“哪个订阅我退了为什么”。这类内容极难 AI 生成,因为它需要真实的账单。
  3. 反常识的否定结论。 “这个功能我用了三个月,最后关掉了”。否定结论天然稀缺,因为它需要长期使用才敢下。

我自己的四平台分工

下面只是我怎么使用这些平台,不代表平台排名、受众画像或账号资格的普遍结论:

平台我发布的形态在我的流程里我测试的切入点
B 站长视频主阵地,放完整过程技术深度 + 完整叙事,观众容忍长度
YouTube长 + Shorts英文内容,长尾复利英文技术圈的搜索长尾 + 数字游民
小红书竖屏短 + 图文生活线和轻技术搜索驱动,标题要带长尾词
抖音竖屏短拉新,不做主阵地强钩子,信息密度低但要有记忆点

我没有找到能量化小红书搜索占比或转化率的公开一手资料。能确认的只有自己的样本:包含地点和具体问题的标题,往往比情绪文案更久地获得发现。“在深圳龙华找到一家能坐一下午的咖啡馆"也比"今天的 vibe"更直接地告诉人这条内容有什么。

长内容和短内容不必是两套素材。我的做法是:先按长内容所需的上下文拍,再从中切短片。 这适合过程型内容;若选题天生只服务竖屏短视频,直接为短片设计更省事。

自动发布:诚实说清楚能做到哪一步

这是我发现网上信息最不靠谱的一块。很多文章写得像是接个 API 就能一键全平台分发,实际情况差得远。

下面是我在 2026-07-31 能从一手资料确认的边界:

YouTube 要拆成频道权限、API 项目审计和上传配额三件事。 官方 videos.insert 接口 可以上传视频,但 2020 年 7 月 28 日以后创建、且尚未通过合规审计的 API 项目,上传内容会被限制为仅私人可见。这是开发者项目的限制,不等于创作者频道没有资格。Google 的配额计算页 在复核当天列出独立的 Video Uploads 配额桶:每次 videos.insert 消耗 1 个单位,默认每天 100 次。它是默认 API 配额,不是鼓励频道每天发布 100 条。

TikTok 也要拆成创作者授权与开发者客户端审核。 创作者先授权应用发布,开发者的 API client 另有审核状态。TikTok 的内容分享指南 写明:未审核客户端只能用 SELF_ONLY 可见性,并且 24 小时内最多服务 5 个用户;审核前后仍受创作者与发布频率限制,文档给出的典型上限约为每位创作者每天 15 条,但实际值可能变化。这说明的是 API 能力和客户端审核,不是所有创作者账号都自动获得发布资格。

抖音、B 站和小红书要分别看三层:创作者账号资格、开发者应用审核、应用最终获批的 API scope。 我在 2026-07-31 的公开一手资料调查,既不能证明个人一律无资格,也不能证明企业申请必然获批,更不能证明普通开发者稳定拥有通用服务端发布接口。除非平台明确为我的应用授予所需发布 scope,我就把这三个目的地保留为手动投递。这是当日调查结论,不是对平台内部能力的断言。

关于浏览器自动化方案。 我见过模拟登录和发布的项目,但没有逐一审计这些工具,也没有逐平台完成最新协议分析。我的边界更简单:不把主账号的 session cookie 交给非官方发布器。即使暂不讨论条款,这也是一条值得保留的安全边界。

所以现实架构是半自动

我的结论是:把发布拆成"准备"和"投递"两段,准备段全自动,投递段分平台处理。

   渲染完成
       │
       ▼
  ┌──────────────────────────────────────┐
  │ 自动:生成分发清单 manifest.yaml      │
  │  · 各平台画幅版本(16:9 / 9:16 / 4:5)│
  │  · 各平台标题 / 描述 / 标签(LLM 生成 │
  │    候选,人工确认)                   │
  │  · 封面图批量导出                     │
  │  · 首评文案、置顶评论                 │
  │  · AI 使用情况声明(见下节)          │
  └──────────────────────────────────────┘
       │
       ├──► YouTube    :官方 API,在审计与配额范围内
       ├──► TikTok     :官方 API,在已获批 scope 内
       ├──► B 站/抖音  :除非应用获批发布 scope,否则手动
       └──► 小红书     :当前工作流保持手机手动发布

这个架构的价值在于:手动部分被压缩成了机械操作。 我不需要在发布时再想标题、裁画幅、写标签,manifest 已经准备好了。剩下的步骤通常很短,但具体时间取决于每个平台当时的审核与交互。

这里有个判断我想说清楚:对我的主账号,追求 100% 全自动并不划算。 最后一次人工确认提供了复查窗口——我会在这里发现标题不对、封面选错,或者干脆决定这条不该发。保留人在回路里,不只是技术妥协,也是编辑选择。

合规:这一节不能跳

2026 年做 AI 辅助的内容,标识规则是硬约束,不是可选项。

中国的《人工智能生成合成内容标识办法》已于 2025 年 9 月 1 日施行。 我在 2026-07-31 复核的官方文本 覆盖文本、图片、音频、视频和虚拟场景,并区分显式标识与文件元数据中的隐式标识。不同角色承担的义务并不相同:生成合成服务提供者按规定添加标识,内容传播服务提供者核验或补充提示,用户发布生成合成内容时主动声明并使用平台提供的标识功能;恶意删除、篡改、伪造或隐匿规定标识也被禁止。

这份办法并不支持"只要工作流里出现过任何 AI,就一律使用同一种标签"的捷径。我的实践是按具体内容与平台流程判断:发布生成合成内容时主动声明,保留来源和处理记录,不主动清除已有的合规元数据。

YouTube 有两套需要分开的规则。 官方的更改或合成内容说明 要求披露经过实质性更改或生成、且看起来真实的内容,例如伪造真实事件或地点;轻微编辑,以及用 AI 辅助提纲、字幕、标题或缩略图,并不因此自动要求披露。同一页面也明确说,披露本身不会限制受众或变现资格。

另一套是频道获利政策 :YouTube 在 2025 年 7 月把原来的"重复性内容"改称"非原创内容(inauthentic content)",用于澄清重复或批量生产内容不符合获利要求;“重复使用的内容(reused content)“仍是另一项判断,关注借用素材是否加入了有意义的原创评论或改造。官方页面没有原稿所写的自动"三振"路径,具体处置要看对应政策和审核结果。

生成式视频怎么用。 我的建议很保守:不要用它伪造真实场景。 不要生成一个不存在的咖啡馆、不要生成你没去过的地方。这类内容会被认出来,而且一旦被认出来,损失的是你在所有内容上的可信度——这个代价远大于省下的拍摄时间。合理的用法只有两类:抽象的转场纹理,和明确呈现为特效的夸张镜头。

这里还有一条需要精确到日期的时间线。OpenAI 的 Sora 停服公告 写明:Web 与 App 已在 2026 年 4 月 26 日结束服务,API 将于 2026 年 9 月 24 日结束服务。因此我不再把它列为这条流水线的可持续环节。这也说明:不要让关键步骤只依赖一个托管服务。 我的核心环节——ffmpeg、场景切分、转写和去静音——都可以在本地运行。

一份可以照着做的启动清单

如果你现在要从零开始,我建议的顺序是这样,每一步都不要跳到下一步之前就想着优化:

第一周:只解决"拍什么”。 把四条线各写一份 shot list,存成手机备忘录。这一周不碰任何工具,就按 shot list 拍,用手机原生相机也行。目标是验证 shot list 本身合不合理。

第二周:固定拍摄参数。 装 Blackmagic Camera,把 24fps / 180° 快门 / Log / 手动锁定存成预设。屏幕录制那条线把环境预置做成一个脚本(改字号、清历史、关通知)。

第三周:搭最小流水线。 只做三件事:ffmpeg 归一化、faster-whisper 转写、auto-editor 去静音。三个命令,一个 shell 脚本串起来。先不要碰 EDL。

第四周:开始出片,手动剪。 用前三周的素材连续出五条,全部手动剪。这一步的目的是让你知道自己的剪辑决策模式是什么——你不知道这个,就写不出有用的 EDL 提示词。

第二个月:把重复的决策写进 EDL 生成。 这时候你已经有五条片子的经验,知道自己每次都在做哪些相同的判断。把那些判断写成提示词和 schema。

第三个月:接发布。 先接 YouTube,跑通之后再考虑其他平台。

我想强调这个顺序里最反直觉的一点:我会先手动做过几遍,再搭流水线。 五条只是一个便于启动的经验值,不是定律。先观察自己反复做出的剪辑决定,才知道哪些步骤值得写进自动化;否则很容易把错误流程跑得更快。

最后

回到开头那个六小时剪出五十八秒的下午。

现在同样的内容,我的流水线跑完粗剪大概二十分钟,手动精修一小时。但这不是这套东西最重要的收益。

最重要的收益是,我不再需要每次重新耗一遍意志力。过去每一条视频都是一次从零开始的消耗,现在每一条都在往同一个装置里添零件。 shot list 会越来越准,EDL 模板会越来越贴我自己的节奏,发布 manifest 会越来越省事。对我而言,这是一条比押注单条爆款更可持续的路:让每一条的固定成本继续下降。

至于 AI 在这里面的位置,我现在的看法比一年前保守很多。98.4% 和 1.6% 只是我借来提醒自己的比喻,并非测量结果:机械劳动可以交给工具,但少数编辑判断仍会决定成片是否值得看。工具越普及,那些判断就越显眼。

所以真正的问题很少只是"我该用哪个 AI 剪辑工具”,而是我有没有一件亲自做过、能够讲清楚的事。有的话,工具链只是把它送出去的管道;没有的话,再顺畅的流水线也很容易走向同质化。


核验说明。 文中的平台政策、配额、审核与工具版本核验于 2026-07-31。YouTube、TikTok、中国 AI 内容标识、PySceneDetect 与 Sora 的具体事实均直接链接一手文档;抖音、B 站、小红书无法由公开一手资料证明的部分,已明确写成作者当日调查与个人工作流,而不是平台的普遍规则。落地前仍应再次核对官网,因为权限、配额和产品状态会继续变化。

读者回响

加入讨论

新文章写好,先寄给你

每有新文章,寄一封信到你的邮箱。双重确认,随时退订。