一段动画里,同一个角色跨过几个镜头,颜色没有变,身体比例没有漂移,字幕准时出现,最后一个动作落在音乐节拍上。看到这样的作品,很容易把进步归结为“模型突然懂视频了”。但在公开项目 Shipvideo 里,Opus 交出的核心文件其实是一份 HTML:浏览器负责把它变成画面,编码器再把画面变成视频。项目说明
这不减损作品的价值,却改变了我们该问的问题。我们需要解释代码为什么适合做这类动画,也需要解释:相同工具其他模型也能用,为什么这一代可能做得更好?
截至 2026 年 9 月 26 日,公开证据支持一个有分寸的判断:**Opus 5.5 在专业读图、看多视角图生成 CAD 程序等测试中有明确进步;真实项目展示了这类能力进入制作流程后的价值。但完整动画的质量跃迁,还不能全部归因于模型,更不能直接等同于世界模型或某项强化学习技术的突破。**下面沿着成片的生产过程,看看证据分别落在哪里。
一份程序怎样变成一千帧画面
Opus 5.5 的官方接口接受文字和图像,输出文本。它于 2026 年 9 月 22 日发布;就这个接口而言,它并不直接输出像素视频。模型文档
文本可以是剧本,也可以是能运行的程序。Shipvideo 选择后者:模型写出包含布局、图形与动画逻辑的单个 HTML 文件,渲染端用浏览器的虚拟时钟推进时间、逐帧取画面,再用 ffmpeg 编码。导演提示还限制了外部图像、视频和随机行为,尽量让输出成为可重复执行的作品。导演源码 、渲染源码
这条路线把一个困难转移到了更容易控制的地方。
以一段假设的 30 秒、每秒 30 帧动画为例,它共有 900 帧。若角色的形状和颜色定义在同一份绘图函数里,900 帧都会调用这份定义。模型不必为每一帧重新决定“这个角色长什么样”,只需决定它在此刻的位置、缩放、表情和动作。跨帧一致性的一部分由程序执行保证。
运动也可以压缩成少量规则。让一个圆从左边进入画面,可以给出起点、终点、开始时间、持续时间和一条缓动曲线。曲线负责逐渐加速或减速,渲染器计算中间的所有位置。只要逻辑正确,延长半秒、改成蓝色、把轨迹调高,都有明确的修改入口。
第二个公开项目 PDoomVideo 将这种做法写成制作纪律:每个镜头都应是时间 t 的纯函数,使用共享的角色形状、调色板、时间线与节拍工具。所谓纯函数,是指直接询问第 12 秒该画什么,就能得到结果,不依赖是否已经播放过前 11 秒。因此各帧可以并行、乱序渲染,也便于跳到具体时刻检查。动画协作规范
这里的收益非常具体:角色复用减少身份漂移,统一时间线减少镜头错位,确定性执行减少“重跑一下又不一样”,参数化修改减少整段重做的成本。图文动效、产品说明片和风格化动画尤其容易利用这些条件。复杂真人动作与开放场景物理仍是另一类难题,不能从这些案例推出同样的优势。
不过,程序只会忠实执行决定。一个始终画错的角色,也能保持高度一致。
难点在于做出一组能共存的决定
“把视觉意图转成程序”听起来像解释,实际上还少了一层:意图通常并没有说清楚。
假设任务是“做一段 20 秒的缓存原理动画,给没有技术背景的人看,轻快一点”。这只是说明性例子,不是本文做过的模型实验。模型首先要决定用什么表达缓存:旁边的小抽屉、服务台,还是一张临时便条?随后要让观众看懂第一次取数据与第二次命中的区别,同时处理字幕、节奏、空间和结尾。
这些决定相互牵制。把解释写完整,文字可能来不及读;延长字幕停留,后面的动作要缩短;把数据库画大一些,数据移动路径和画面重心又要重排。即使每个局部都没有代码错误,整段动画仍可能让人不知道该看哪里。
因此,强模型的潜在优势不只是少写错几个函数,还包括选择一个能拍完的表达方案,在后续实现中维持它,并在发现问题时知道该牺牲什么。把任务拆成十个镜头不难,让十个镜头共同完成一个解释才难。
PDoomVideo 的公开分镜提供了一个有意思的例子:主角从屏幕上的涂鸦逐渐扩大到行星尺度,舞台反复出现并升级,最后拉远揭示舞台表演。这个叙事安排给各个场景施加了共同约束——规模可以扩大,但仍要属于同一个世界,结尾还必须能够回收前面的视觉设定。分镜文件
这种高层承诺能帮助避免“每一屏都很热闹,整片却没有方向”。但分镜里写了什么,和模型是否独立、稳定地完成了所有制作步骤,是两种证据。项目作者说作品通过两轮 Claude Code 生成,第二轮补充了笔触、场景趣味与转场要求,并称分镜和协作规范由模型编写;这些属于作者的制作说明,公开仓库并未提供足以验证每一步的完整执行记录。音乐另有 2024 年的作品来源,不能算作 Opus 原生生成的音视频。作者说明
好看有多少已经写在规则里
理解成片还要追问:哪些决定原本就有人替模型做了?
Shipvideo 的导演提示已经给出相当具体的设计要求:20—40 秒、6—10 个节拍、每屏最多 8 个词,并规定叙事次序、字体候选、调色板、缓动和结尾停留。这些要求会提前排除一批常见问题,例如满屏文字、节奏没有起伏、最后一屏一闪而过。导演提示源码
因此,看到这个系统生成一段清爽的短片,合理的解释应包括它借用了已有设计知识。模型仍需决定具体内容并正确实施,但“每屏少写字”这条原则并非它临场发现。
PDoomVideo 的归因稍有不同。按作者说法,模型参与编写了制作规范,那么产出可用规则本身也可能属于模型能力。不过,作者补充的第二轮要求依然是人工贡献。不能把成片里所有好决定都记给模型,也不能因存在提示词就把模型贡献归零。
可以将这些环节分开理解:项目定义决定要交付什么;规则缩小方案选择范围;模型选择并实现具体方案;harness——让模型调用工具、接收结果、继续执行的运行系统——把这些决定接到真实环境上;渲染器负责忠实生成画面。评价 agent 时测到的是模型与这套运行系统的组合,这也是 Anthropic 的评估工程文档明确强调的口径。Agent 评估说明
其中还有一个容易高估的环节:反馈。
Shipvideo 的 check_scene 会报告 JavaScript 错误、网络错误,以及指定时间点的 DOM 可见文字和背景色。它并不把截图交回模型评审。这能帮助发现页面没运行、文字没有按时出现,却无法充分判断字幕是否被遮住、Canvas 内的文字是否好读、构图是否呆板。检查工具返回“没报错”,距离观众觉得“好看”还很远。检查工具源码
PDoomVideo 的规范则要求渲染静帧和 contact sheet(多帧拼图),查看首尾、中间与转场,检查遮挡、尺度、对比和动作僵硬。这种反馈更接近视觉问题,但规范要求做,并不等于每一项实际执行过;少量静帧也不能完整检验运动节奏。检查规范
工具的价值取决于它能暴露哪种错误,也取决于模型能否把错误修掉。一个只返回运行日志的环境,不能因为里面放了视觉模型,就自动拥有视觉审稿能力。
工具大家都有,为什么这一代仍可能更强
到这里,我们解释了代码动画的优势,却还没有解释 Opus 5.5 相比上一代的进步。程序、浏览器和协作规范都不是它独占的技术。
更直接的证据在系统卡。以下数字来自同一版系统卡中的同口径比较;保留无工具和有工具两列,正是为了避免把所有进步混在一起。
| 任务与指标 | Opus 5 无工具 | Opus 5.5 无工具 | Opus 5 有工具 | Opus 5.5 有工具 |
|---|---|---|---|---|
| Chartography:专业读图正确率 | 29.8% | 64.4% | 83.4% | 89.0% |
| BenchCAD:三维几何 voxel IoU | 0.497 | 0.730 | 0.899 | 0.962 |
Chartography 包含 100 道专业读图题,报告 5 次运行,使用 adaptive max 和统一判分模型。BenchCAD 要求从多视角图像生成 CadQuery 代码,这里使用 1,000 个样本的子集、5 次运行;voxel IoU 衡量生成几何与目标几何的空间重合程度。系统卡将每个视图分辨率从旧实现的 128px 改为 256px,并重算了旧模型结果,因此应比较本卡数字,不能直接拼接以前的成绩。系统卡 §8.13.1—2,pp.199—204
无工具成绩的提升很重要:它说明进步无法完全由外部检查工具解释。读图和从图像重建几何,更接近模型自身的视觉理解、空间推理与程序表达。尤其 BenchCAD,把“看懂图”与“写出对应形状的程序”接了起来,为代码视觉作品提供了相关旁证。
有工具时,两代模型又都明显提高,说明反馈和执行环境有很大价值。但不要用两列的差值计算“工具贡献了百分之多少”:工具会改变解题过程,模型能力也会影响工具用法,两者存在交互;不同模型消耗的推理计算也没有被严格固定。
更关键的是,读对图表不等于懂节奏,几何重合不等于动画有趣。系统卡中的部分幽默与创意掌握指标也没有全面领先。它们同样不是动画评测,但足以提醒我们别把局部能力提升写成审美全面胜出。系统卡 §6.4.7,pp.116—118
独立评测提供了另一层背景。Artificial Analysis 报告 Opus 5.5 的 Intelligence Index 为 58,10 项测试中领先 6 项,Terminal-Bench 4.0 与 Astra xhigh 相当,在 CritPt、AA-LCR、GDP.pdf 等项目上则落后;在使用参考 harness Stirrup 的 AA-Briefcase 中,分析与呈现表现进步。不过,max 档每任务约输出 119k tokens,高于 Opus 5 的约 73k。共同 harness 并不代表共同计算预算,tokens 数也不能直接当作跨模型的等价算力。Artificial Analysis 报告
这些结果共同增强了“模型端任务能力进步”的可信度,但没有补上动画的受控对照。本文也没有运行模型替换实验或成片盲评。
如果一定要排序,需要先说清排序对象。解释这个系统为什么能产出可控短片,程序表示与确定性渲染是基础,项目规则和可用反馈决定可完成范围,模型负责其中的选择与执行。解释同样条件下这一代为什么变好,模型端能力进步是更有直接证据的候选原因,规则、harness 和预算则可能放大它;目前无法给出可靠比例。
一种合理的机制推论是:少数能力越过可用门槛,能让成片观感出现远大于单项分数变化的提升。此前总在修运行错误、修错位、补丢失的角色,新一代若更早完成这些基础工作,同一时间预算就能用来调停留、转场和视觉重心。观众看到的是打磨后的整体。这个解释符合制作流程,但仍需用实际返工次数与时间记录验证,不能作为已测得的 Opus 特性。
强化学习究竟解释了什么
追到训练层,首先要把四件事分开。
预训练让模型从大量数据中学习语言、代码、图像关联及其他规律。系统卡披露了互联网、公开与私有数据集、获许可的用户资料、其他模型生成的合成数据等来源,以及预训练后的微调;它没有给出足以重建能力跃迁的架构、参数与数据配比。系统卡 §1.1,p.11
后训练进一步调整模型的行为。强化学习是其中一种方式:模型尝试完成任务,训练过程依据奖励信号调整参数,使更高回报的行为更容易出现。Opus 5.5 系统卡明确讨论了 RL 训练 episodes、软件工程环境和 reward hacking 监测,因此不能说“是否使用 RL 完全未知”。但“用了 RL”与“视觉跃迁主要来自特定美学奖励”之间,仍缺少公开因果证据。系统卡 §6.2.1,pp.97—99
推理时反馈发生在这一次任务中。模型看到渲染结果,发现字幕被遮挡,修改位置并重新渲染;它改的是当前作品。没有另外的训练过程,就不能把这次改稿称为模型参数“实时学会了审美”。
评估则回答系统是否达到要求。可以用代码检查时长与运行错误,用模型辅助比较画面,用人评判断表达和节奏。一次发布前 eval 本身不会自动更新参数;它的结果可以指导后续开发或训练,但那是下一步。评估方法说明
若设计一个动画训练任务,怎样打奖励会是核心难点。以下是解释性假设,并非 Anthropic 公布的配方:只奖励“成功导出视频”,模型可能交出一张静止画面;再奖励“字幕存在”,它仍可能把字幕缩到难以辨认;奖励“画面变化丰富”,又可能鼓励毫无意义的晃动。每一个容易计算的代理指标,都可能偏离观众真正要的结果。
这也是为什么一条能发现问题的反馈链很宝贵,却不足以独自解释创造力。设计训练目标、监测奖励投机、用未参与训练的任务检验泛化,是不同工作。现有公开资料证明 RL 参与了训练,尚未证明哪种训练改动贡献了多少动画质量。
这算世界模型突破吗
需要先把“知道世界里的很多事”和“学习了可用于预测的环境动力学”分开。
在与交互和控制相关的世界模型研究中,一个实用判据是:给定当前状态或观测,再给一个动作,系统能否预测之后的环境,并支持新的动作序列。Dreamer 4 就明确研究从数据学习环境模型,再在模型生成的想象轨迹中训练行为;其项目展示了 Minecraft 中的交互与任务执行。Dreamer 4 原始研究
固定时间动画回答的主要是“第 12 秒应该画哪一幕”。世界模型还要处理“如果此时改走另一条路,会发生什么”。前者可以完全由脚本预先规定;后者要求预测对行动变化作出有意义的响应。
当然,程序也能定义仿真世界,语言模型也可能写出带物理规则的交互程序。但这仍不等于模型从数据中学得了可泛化的开放世界动力学。上述动画工程没有提供这种验证。它们证明了组织、实现和执行视觉程序的能力,世界模型突破则需要另一组任务与证据。
IPO 能解释发布时机,解释不了画面机制
商业背景值得知道,但不宜拿来替代技术分析。Anthropic 在 2026 年 6 月 1 日宣布向 SEC 保密提交 S-1 草案,说明其正在为可能的 IPO 做准备;公告并未表示上市已经完成。官方公告
从商业逻辑推测,上市准备可能增强展示产品能力的动机。但这只能作为传播与发布选择的背景,无法解释共享角色如何保持一致、为何无工具读图成绩提高,也不能反过来证明演示造假。对演示的怀疑应落到可检查的问题上:是否挑选成功样本,试了多少次,是否有人改稿,用了多少时间。
真正还缺的,是同一任务里的比较
对想选制作工具的读者,最有用的下一步,是让不同模型完成相同的交付,而不是比较各自最精彩的演示。
可以给 Opus 5、Opus 5.5 和一个其他代码模型同一份短片需求,固定运行环境、素材与规则,在几个明确的费用或时间上限下各做多次。共同 harness 用来约束工具条件;同时记录实际开销,因为相同 token 上限并不等价于相同成本或计算。再让不知道模型身份的评审分别看内容正确性、文字可读性、运动节奏、角色连续性和修改便利性,并报告失败率、人工干预与耗时。
如果想分离规则的作用,就分别做有设计规范和没有规范的版本;如果想分离反馈的作用,再比较只看日志与能看渲染帧的版本。这样才有机会看清某个模型是初稿更好、修错更强,还是愿意花更多预算。
今天已经可以确认,代码给视觉创作提供了一种有效的组织方式,而 Opus 5.5 在相关视觉与程序任务上有值得重视的进步。还没有确认的是:在相同制作条件下,这些进步能多稳定地变成更好的整片。
下次看到令人惊艳的演示,不妨再找三样东西:可运行的项目、修改过程和失败记录。成片展示上限,后面这三样,才更接近你实际能得到的结果。
参考资料
- Claude Opus 5.5 模型规格与发布日期
- Claude Opus 5.5 System Card :本文使用 §1.1、§6.2.1、§6.4.7、§8.13.1—2。
- Artificial Analysis:Opus 5.5 独立评测
- Shipvideo 项目
、导演提示
、检查工具
、渲染工具
。源码引用固定于提交
38ce668。 - PDoomVideo 作者说明
、动画协作规范
、分镜
。引用固定于提交
fa546a3。 - Anthropic:Demystifying evals for AI agents
- Dreamer 4:Training Agents Inside of Scalable World Models
- Anthropic:保密提交 S-1 草案的公告





读者回响