状态更新(2026年7月):Sora 网页与应用已在 2026 年 4 月 26 日停止服务,Sora API 将在 2026 年 9 月 24 日停止。本文不再把 Sora 当作一份“如何入场”的推荐,而是把它当作一次完整的技术与产品复盘。
2024 年 2 月,我第一次写 Sora 时,最容易被吸引的是那段“一分钟视频”。两年后再看,真正值得记录的不是热闹,而是四个不断变化的边界:研究能力不等于产品规格,模型进步不等于产品永续,安全措施不等于风险消失,生成内容也不天然拥有清晰的版权归属。
技术浪潮里,人常把“已经展示”写成“已经可用”,再把“计划提供”写成“可以依赖”。Sora 的完整周期提醒我:预测未来不难,难的是在事实改变之后,愿意把旧判断重新校准。
一条需要按日期阅读的时间线
| 时间 | 发生了什么 | 应当怎样理解 |
|---|---|---|
| 2024-02-15 | OpenAI 发布 Sora 研究预览与技术报告,展示最长一分钟的高清视频样例 | 这是研究结果和定性展示,不是公开产品的服务承诺 |
| 2024-12-09 | Sora Turbo 在 Sora.com 上线,面向 ChatGPT Plus 与 Pro 用户 | 产品支持文本、图片和视频输入,最高 1080p、最长 20 秒 |
| 2025-09-30 | Sora 2 与独立 Sora 应用发布 | 模型加入同步对白、音效与环境声,并提升可控性和物理一致性 |
| 2026-04-26 | Sora 网页与应用停止服务 | 用户端产品已经退场,历史内容需要尽快导出 |
| 2026-09-24 | Sora API 计划停止 | 仍有相关集成的开发者应在此日期前完成迁移 |
这条时间线最重要的作用,是避免把不同阶段的事实拼成一个不存在的产品:2024 年 2 月的研究模型、2024 年 12 月的 Sora Turbo、2025 年 9 月的 Sora 2,并不是同一组能力和限制。
Sora 的技术,公开资料究竟说了什么
从视频到时空 patch
OpenAI 的技术报告把 Sora 描述为一个在视频和图片上联合训练的文本条件扩散模型。处理流程可以用三个层次理解:
- 视频先被压缩到低维潜在空间,以降低直接处理原始像素的负担。
- 潜在表示再被切分为 spacetime patches(时空 patch)。它们同时覆盖空间和时间,可以类比语言模型中的 token,但不是文字 token。
- Transformer 在这些带噪 patch 上工作,模型通过扩散过程逐步去噪,得到视频或图片。
这种统一表示让同一个模型可以训练和生成不同时长、分辨率与宽高比的视觉数据。训练时保留原始尺寸和构图,也比把所有素材强行裁成同一种格式更自然。
Sora 还沿用了 DALL·E 3 的 recaptioning 思路:先为训练视频生成更详细的描述,再用这些描述训练文本跟随能力。它解释了为什么提示词里的主体、环境、镜头和动作需要写清楚,却不意味着模型能够稳定兑现每一个细节。
“扩散 Transformer”不是完整配方
“扩散模型 + Transformer + 时空 patch”是官方公开到的抽象层。2024 年技术报告同时明确说明:模型和实现细节不包含在报告中。
因此,下面这些说法都不应被当作已知事实:
- 训练或生成固定需要多少张 A100;
- 生成一条视频的精确成本;
- 模型参数量、完整网络层数与数据配比;
- 某种分辨率下能够实时生成;
- 只凭公开示意图就能复现 Sora。
讨论技术边界,比填补官方没有公布的空白更重要。未知就是未知,不需要用一个看起来精确的数字替它化妆。
一分钟研究样例,不等于 20 秒产品规格
这是旧文章最容易误导读者的地方。
2024 年 2 月的技术报告称,最大的研究模型可以生成最长一分钟的高保真视频。这里描述的是研究能力,报告以定性样例为主,也没有给出公开服务的延迟、成本和稳定性承诺。
2024 年 12 月真正上线的 Sora Turbo,则允许用户生成最高 1080p、最长 20 秒的视频,支持宽屏、竖屏和方形比例,并提供 storyboard、extend、remix、blend 等产品功能。
| 维度 | 2024年2月研究预览 | 2024年12月Sora Turbo产品 |
|---|---|---|
| 性质 | 技术报告与研究样例 | 面向用户的线上产品 |
| 时长 | 展示最长一分钟 | 最长20秒 |
| 分辨率 | 报告称高清视频,样例覆盖多种规格 | 最高1080p |
| 重点 | 规模化训练、时空patch、模拟能力 | 生成、分镜、延展、混合与再创作 |
| 可依赖性 | 不构成API或服务承诺 | 受套餐、地区、限额和产品生命周期约束 |
所以,“Sora 能生成一分钟视频”在研究语境里成立,却不能拿来描述 2024 年 12 月上线产品的统一规格。
Sora 2 改变了什么,又没有改变什么
Sora 2 在 2025 年 9 月发布。与第一代相比,官方强调了三类进步:
- 原生视频与音频生成:能够生成同步对白、音效和背景声景;
- 更强的可控性:更好地遵循跨多个镜头的复杂指令,并维持场景状态;
- 更好的物理一致性:相比旧模型,更能表现失败、碰撞、浮力等结果,而不是为了满足提示词让物体突然变形或瞬移。
但“更准确”不等于“准确”。OpenAI 在发布文章里直接承认模型仍会犯很多错误。把它称为“世界模拟器的研究方向”,也不等于它已经建立了可靠的因果模型,更不能据此用于安全关键仿真、工程验证或事实取证。
同步音频同样扩大了风险面:生成的不再只是一个人的脸,还可能包括声音、对白和带有误导性的完整情境。能力多一个维度,审查就不能只多看一眼画面。
安全不是一个水印,而是一条责任链
来源标记:C2PA 与可见水印
Sora Turbo 上线时,OpenAI 表示所有生成资产都带有 C2PA 元数据,并默认加入可见水印;Sora 2 发布时也使用可见与不可见的来源信号、C2PA 元数据和内部检索工具。
C2PA 可以记录内容来源,可见水印可以提醒观看者,但它们都不是“真实性证明”。元数据可能在转码和平台分发中丢失,画面上的标记也可能被裁剪。更稳妥的发布流程应该同时保留原始文件、生成记录、编辑历史和使用授权,而不是把责任交给一个角标。
肖像与声音:同意必须可以撤回
Sora 2 的 characters 功能要求用户通过一次视频和音频录制验证身份并捕捉肖像。本人决定谁可以使用自己的 character,可以撤销访问,也可以查看和删除包含自己的视频。后来开放真人图片转视频时,上传者还需要确认已获得画面中人物的同意并拥有上传权利。
对开发者来说,“用户勾选了协议”只是起点。一个可信的肖像系统至少要记录:
- 谁在什么时间授权了哪种用途;
- 授权是否包含声音、脸部、公开传播和商业使用;
- 如何撤回,以及撤回后怎样处理缓存、草稿和衍生内容;
- 当事人如何查看、举报和删除涉及自己的生成结果。
OpenAI 的政策禁止未经许可使用他人肖像,也禁止非自愿亲密影像、诈骗、冒充和误导性内容。系统卡还说明了输入检查、输出拦截、多模态分类器、人工审核与举报机制。它们组成防线,却没有让滥用概率变成零。
版权问题:平台规则不等于法律结论
旧文章曾把“版权归原始内容创作者”写得过于确定。更准确的说法是:
- OpenAI 的使用政策禁止侵犯他人的知识产权;
- 上传素材的人需要拥有必要权利;
- 生成结果是否构成受保护作品、谁拥有权利、训练与输出是否侵权,要取决于具体素材、人的创作贡献、使用方式以及所在法域;
- 平台允许生成或发布,不代表作品已经通过版权审查。
不同国家和地区对 AI 生成内容的作者资格、原创性门槛和合理使用判断并不一致。商业项目应保留素材来源与授权证据,并让熟悉目标法域的专业人士审查。本文只讨论风险框架,不提供法律意见。
产品已经停止,开发者现在该做什么
OpenAI 帮助中心确认,Sora 网页和应用已于 2026 年 4 月 26 日停止,Sora API 将于 2026 年 9 月 24 日停止。帮助中心建议用户尽快通过 sora.chatgpt.com/sunset 导出内容;最终导出窗口结束后,相关数据将被永久删除。
如果你的系统仍依赖 Sora API,不要再新增深度绑定。现在更现实的清单是:
- 盘点模型名称、端点、密钥、队列、回调和审核流程中的所有依赖;
- 导出原始视频、提示词、参数、授权记录和 C2PA 信息;
- 把“生成视频”抽象成可替换的供应商接口,不让业务代码依赖单一响应结构;
- 用自己的测试集比较候选方案,至少覆盖指令遵循、人物一致性、音画同步、延迟、失败率和安全拦截;
- 设计降级路径:生成失败时可以转为分镜图、素材检索或人工制作,而不是让整条工作流停摆;
- 在 2026 年 9 月 24 日前完成迁移、回归测试和旧凭证下线。
没有公开、稳定的 API 时,开发者最不该做的是围绕“未来可能开放”搭建商业承诺;有 API 之后,也不能把“今天可用”误读为“长期存在”。
从 Sora 留下的四个产品教训
1. 把研究演示、产品规格和服务承诺分开
演示回答“能力上限可能在哪里”,产品规格回答“用户今天能做什么”,服务承诺回答“系统能依赖到什么程度”。三者混写,文章会过时,架构也会变脆。
2. 用评测替代形容词
“惊艳”“革命性”“理解世界”都无法指导开发。更有价值的问题是:十组固定提示词中有几组保持人物一致?多镜头指令漏掉了哪些约束?声音与口型偏差多大?失败能否自动检测?
3. 把同意、溯源和删除做成数据结构
肖像授权不是一段免责声明,内容来源也不是一个水印。它们需要版本、时间、范围、撤回状态和审计记录。安全只有进入数据模型与工作流,才不只是发布会上的段落。
4. 为供应商退场而设计
模型接口天然有版本、地区、价格、配额和生命周期风险。可替换适配层、离线资产、回归测试集和退出计划,不是大型公司的奢侈品,而是任何依赖外部 AI 服务的基本工程卫生。
结语
Sora 没有按 2024 年最热闹的叙事一路延伸。它从研究样例走向产品,从无声视频走向同步音频,又在两年后结束了面向用户的服务。这不意味着技术没有价值,也不意味着当年的探索毫无意义。
它更像一次提醒:浪潮真正留下来的,往往不是浪尖上的名字,而是我们在浪退之后仍能使用的方法——区分事实与推测,区分能力与承诺,尊重人的同意,并让系统随时准备告别一个供应商。


读者回响