Xinwei Xiong · 2026 年 7 月 15 日
10 分钟 · 4577 字 · | EN

一个人养得起多大的 Agent 舰队:2026 年低价 API 与开放权重模型的成本账

本文以 2026 年 7 月 31 日官方价为基准,复算五千万 token 的 Agent 舰队成本,区分低价托管 API 与开放权重自托管两条路线,并把成功率、重试、工具、人审和严重错误纳入每个成功任务的总成本。适合需要多模型路由、控制上下文增长并评估个人 Agent 系统真实投入的开发者深入阅读。

一场衡量 Agent 舰队真实成本的路由实验

一个人究竟养得起多大的 Agent 舰队?

这个问题听起来像是在数进程,其实是在找一个错误的单位。一个 Agent 可能只抽取一段文字,也可能搜索二十分钟,或者经过八十次工具调用才完成一次仓库重构。真正有意义的单位不是“Agent 个数”,而是一个被验收的任务,以及它背后的输入、输出、工具、重试和人工善后。

这也迫使我把两件经常被混在一起的事拆开:

  1. 使用更便宜的托管模型 API;
  2. 部署可获得权重、允许自行托管的模型。

前者比较的是调用价格,后者还要把硬件、利用率、许可证、运维与故障时间放进分母。两条路都可能省钱,但不是同一道算术题。本文价格表中的 DeepSeek V4 Pro 只作为官方托管 API 路线出现,不代表它是一个可下载、自托管的开放权重模型

因此,我敢确认的结论比“模型便宜了九成”窄一些,却更有用:便宜的 token 能让个人 Agent 舰队在经济上成为可能;只有评测能让它在理性上成立。

一张会过期的价格快照

模型价格不是常数。供应商会改名、调整缓存规则、增加长上下文倍率,也会给批处理单独折扣。下面的数据是我在 2026 年 7 月 31 日核对的官方公开价,单位均为每百万文本 token 的美元价格。

供应商与模型未缓存输入缓存输入输出官方来源
OpenAI GPT-5.4$2.50$0.25$15.00OpenAI 模型页
Anthropic Claude Sonnet 4.6$3.00$0.30(缓存读取)$15.00Anthropic Sonnet 4.6
DeepSeek V4 Pro$0.435(缓存未命中)$0.003625(缓存命中)$0.87DeepSeek 价格页

三行数据并不完全对称。Anthropic 另收缓存写入费;OpenAI 在模型页所列阈值以上应用长上下文倍率;DeepSeek 把命中与未命中分开计费。DeepSeek 还公告了待实施的峰谷政策:政策生效后,在其列明的北京时间高峰窗口内,各计费项可能变成常规价的 2 倍

表中没有计算工具调用、联网搜索、区域处理、批处理折扣、GPU、存储、可观测性、技术支持和人力。准备做预算时,应重新打开上述页面,而不是把本文数字抄进一个永远不更新的表格。

更重要的是:价格表只比较托管 API 的标价,不比较智能,也不证明部署条件相同。 一美元不会告诉我 V4 Pro 在代码审查中是否和 GPT-5.4 同样可靠,也不会说明 Sonnet 4.6 是否更适合我的编辑流程。能力是否可替换,只能由自己的任务集回答。

复算五千万 token

假设一夜的工作负载是五千万 token:三千五百万未缓存输入、一千五百万输出。这是一个故意放大的计算情景,不是“5 个 Agent 一晚通常会消耗多少”的行业统计。借用它之前,先测量自己的流量。

OpenAI GPT-5.4
3500 万输入  × $2.50/M  =  $87.50
1500 万输出  × $15.00/M = $225.00
合计                         $312.50

Anthropic Claude Sonnet 4.6
3500 万输入  × $3.00/M  = $105.00
1500 万输出  × $15.00/M = $225.00
合计                        $330.00

DeepSeek V4 Pro
3500 万缓存未命中输入 × $0.435/M = $15.225
1500 万输出           × $0.87/M  = $13.050
合计                               $28.275

按这组常规价与 token 配比,V4 Pro 的账单比 GPT-5.4 低 90.95%,比 Sonnet 4.6 低 91.43%。如果峰时政策已经生效,且整个任务都落入峰时,DeepSeek 账单会变成 $56.55;相应差距缩小为对 GPT-5.4 低 81.90%、对 Sonnet 4.6 低 82.86%

所以“约便宜九成”只能属于一个带日期、带模型、带 token 配比的常规价情景,不能被写成永恒定律。

这笔账也没有证明输出质量相等。便宜路线若失败更多、消耗更多 token,或更频繁地把问题扔给人处理,它的真实经济性可能反而更差。这里的数字只能说明:在输入输出完全相同的前提下,标价相差约一个数量级。

能穿过现实的指标:每个成功任务的总成本

我会从真实工作里抽取一组固定任务,并冻结版本。每条模型路线都记录:

  • 任务成功率:结果是否通过相同的自动测试或人工评分准则;
  • 人工升级率:有多少任务需要人修复、审批或重跑;
  • 每个成功任务的总成本:模型、工具、重试和实测人审成本之和,除以验收通过的结果数;
  • 延迟与严重错误率,作为不可逆操作的护栏。

最简公式是:

每个成功任务的总成本
  =(模型 + 工具 + 重试 + 实测人审成本)
    / 验收通过的任务数

假设路线 A 每次 $0.08,成功率 96%;路线 B 每次 $0.01,成功率 70%,还频繁重试,并把五分之一的任务升级给人。只说 B “便宜八倍”,只是把账本做得很好看:它选错了分母。

严重错误也不能被均价冲淡。一次误发消息、错误提交或破坏数据库的代价,可能吞掉数万次便宜调用省下的钱。因此我按任务类别和风险分别评测。抽取、仓库导航和数据库写入不共享一个“质量分”。最终产物不是模型排行榜,而是一张路由表。

我现在更愿意问:不是哪个模型最聪明,而是哪条路线已经为这个后果赢得了信任。

Agent 历史何时才会二次增长

多轮 Agent 确实存在成本陷阱,但“轮数减半、成本变四分之一”只有在一组严格条件下成立:

  1. 每轮新增的历史长度大致相同;
  2. 后续每次请求都完整重放全部历史;
  3. 所有历史都按未缓存输入计费;
  4. 系统没有摘要、检索、状态裁剪或其他上下文压缩。

在这些条件下,每轮输入随轮数线性增长,累计输入是等差数列:

初始上下文:5K tokens
每轮新增历史:2K tokens
轮数:30

总输入 ≈ Σ(5K + 2K × n), n = 0…29
       ≈ 150K + 870K
       ≈ 1.02M tokens

主导项与 (n^2) 成正比。因此,在这个全量重放模型里,把轮数加倍,输入量可能接近四倍。

但 Agent 成本并不普遍遵循二次曲线。缓存可以给重复前缀折价;滚动摘要可以限制历史长度;检索只注入下一步需要的状态;结构化工作记忆只保存决策;状态化 API 可能避免反复传输部分内容;轮数与工具输出上限则能提前终止漫游。

所以,砍掉空转当然有价值,但“轮数减半就省四分之三”只是一种上界启发,不能许诺。过度砍轮也可能删除验证步骤,让错误率上升。目标不是以任何代价少思考,而是减少没有产出的运动

舰队不是一排工人,而是一条路由策略

所有任务都交给旗舰模型,简单但很难解释;把所有看起来便宜的任务一律降档,同样粗暴。我采用的是“已验证的最便宜安全路线”:

                         新任务
                  确定性规则先判断
          schema · 长度 · 可逆性 · 数据等级
              ┌─────────────┴─────────────┐
              │                           │
        低风险且已评测               不确定或高风险
              │                           │
        便宜候选路线               更强路线和/或人工审批
              └─────────────┬─────────────┘
                         验收检查
                       │          │
                     通过        失败
                       │          │
                    记账      重试或升级

路由应从规则开始,因为规则可读、可审计。任务类型、是否有 schema、上下文长度、数据敏感度、操作可逆性和历史通过率,往往不需要额外模型调用。只有当学习型路由器自己的错误率与成本也被测量后,它才值得加入。

我不会声称“不到 10% 的调用需要旗舰”。对一个拆解良好、可确定性验证的抽取流水线,这或许成立;对研究或编码系统,可能完全不成立。比例必须从生产轨迹里算:

某类任务的旗舰占比
  = 该类中通过验收的旗舰路线任务
    / 该类全部通过验收的任务

舰队规模也是如此。“五个夜间进程”只是一个作者情景,不是适用于他人的经验定律。先按职责给工作单元命名,再观察并发究竟提高了吞吐,还是只复制了等待人审的队列。

我会怎样做一次降档实验

1. 冻结任务集

从近期生产任务抽样,去重但保留普通案例和难看的边角案例。对路由逻辑隐藏预期结果,并给数据集标版本,这样模型或提示词更新后仍能同基线比较。

2. 在看结果前写好验收标准

能自动化就使用 schema 校验、单元测试、引用检查和数据库约束。主观任务则先写短评分表,并对评审隐藏模型身份。“看起来差不多聪明”不是验收条件。

3. 给不同路线同一套预算

保持工具权限、最大轮数、重试策略、上下文和输出要求一致。缓存命中与未命中分开记录。不同供应商的推理控制若无法对齐,就明确写出差异,而不是假装配置完全相同。

4. 比结果,不比演示

报告样本数、成功率、人工升级率、严重错误、延迟、token 和每个成功任务的总成本。只有达到预先声明的质量与风险阈值,便宜路线才算毕业。

5. 上线后继续监测

模型别名和供应商行为会变。尽量固定快照,记录实际解析到的模型版本,保留一键回滚,并在模型、提示词、工具集或任务分布变化后重新跑评测。

多模型路由真正的收益不是“零质量损失”,而是:质量损失已知且落在明确容忍范围内,同时每个成功任务的成本确实下降。

token 之外,账还没有算完

规模小时,token 价格可能占主导。舰队长大后,另外四类成本会浮上来:

  1. 评测:数据集、评分器、回归与复核;
  2. 运维:链路追踪、重试、限流、告警与卡死任务;
  3. 安全:权限、回滚、密钥和不可逆动作;
  4. 注意力:一个人能够认真判断的输出数量。

最后一项才是硬上限。五十份夜间产出,每份只审五分钟,第二天也要花四个多小时。便宜推理能把瓶颈从算力移到判断,却无法消灭瓶颈。

这也是我不再重复“Agent 系统有 98.4% 不是 AI”的原因。那个比例来自示意性拆分,不是跨项目测量得到的常数。可以保留的判断是:模型调用只是系统的一部分;状态、工具、评测、权限和可观测性,才决定便宜调用能否变成有用的工作。

我同样删除了“开放模型占行业 token 的 25%–30%”之类说法。我找不到口径一致的一手数据来支撑它。一个数字如果经不起追问分母、采集方法和日期,就不该替我们做架构决策。

现在值得做的四件事

先测量,再迁移。 记录供应商、实际模型版本、任务类别、缓存状态、输入输出 token、工具费用、重试、验收结果和人工分钟。否则最贵的路线会藏在平均数里。

先限制上下文,再追逐单价。 裁掉无关工具输出,用结构化形式保存长期状态,以校验保护摘要,只检索下一步所需信息,并设置轮数上限。先获得更小、更稳定的负载,再比较价格。

从一类低风险任务开始降档。 带确定性校验器的抽取或标签任务,比自主提交代码、发送外部消息更适合作为第一场实验。在冻结任务集上同时跑两条路线,比较每个验收结果的成本。

让升级与回滚足够便宜。 路由应能通过配置撤销。遇到不确定、新颖或后果严重的任务,就向上升级或要求人审。在不可逆动作上省几分钱,是一种昂贵的节俭。

低价 API 与自托管:别把两张账叠在一起

低价托管 API 的优势是启动快、无需管理硬件,账单主要随调用量变化。开放权重自托管则可能带来数据控制与稳定大吞吐下的成本优势,但必须另算:

  • 加速器采购或租赁;
  • 空闲时间与批处理后的真实利用率;
  • 推理框架、量化与升级维护;
  • 监控、容量、故障和人的值守时间;
  • 模型许可证及部署限制。

对有稳定负载、隐私约束和运维能力的团队,自托管可能合理;对独立开发者,它不会自动更便宜。闲置硬件也是成本,半夜修复推理服务也是成本。“开放权重”是一种许可与部署属性,不是一张免费推理券。

尤其需要重申:本文拿来计算的 DeepSeek V4 Pro 是官方 API 价格行。不要从这行价格推导出它存在同名、同能力、可自行部署的开放权重版本。

下半场判断

我的判断不是低价 API 或开放权重模型会替代所有前沿托管模型,而是:任务级经济性会逐渐替代模型忠诚。

多模型路由会变得普通,因为价格差太大,无法忽略;能力差又太依赖任务,无法用一个榜单概括。低价 API 与开放权重路线会先接管高频、可逆、容易验证的工作。当前沿能力确有差距、失败代价高,或评测本身薄弱时,更强的托管路线仍然有价值。

能长久工作的架构或许很朴素:

  • 确定性代码能解决的,就不用模型;
  • 可逆任务交给通过评测的最便宜模型;
  • 不确定和高后果决策使用更强路线;
  • 系统尚未赢得信任的边界,保留人类。

结语

回到最初的问题:一个人养得起多大的 Agent 舰队?

按 2026 年 7 月 31 日的常规价和本文五千万 token 情景,DeepSeek V4 Pro 的纯推理账单约为 GPT-5.4 的十一分之一。这是真实而重要的价差,它能把过去需要节制的实验,变成持续运行的流程。

但养得起不等于值得养。只有把重试、工具、运维、人审与失败都算进去,舰队仍能更快、更便宜地产出验收结果,它才成立。Agent 个数是舞台效果,每个成功任务的总成本才是经济学。

便宜模型把杠杆变长了,却不会替你选择支点。支点仍是开发者的工作:先衡量后果,在运行前定义成功,只在真正改变结果的地方购买更昂贵的智能。

读者回响

加入讨论

新文章写好,先寄给你

每有新文章,寄一封信到你的邮箱。双重确认,随时退订。