这是一篇观点文章。价格、榜单与速度数据均按 2026 年 8 月 17 日可访问页面整理。本文会使用“Codex Pro 7 天约有 1649 美元 API 等值”的社区实测作为计算假设;它不是 OpenAI 公布的余额、固定额度或承诺价值。

“DeepSeek 是性价比模型,Codex Pro 每月 200 美元太贵。”

如果这句话里的“性价比”只指 API 的每百万 Token 单价,我同意。DeepSeek V4 Pro 的公开 API 价格明显更低。可我仍然会说:对高频、真实的工程任务,Codex 可能反而更便宜。

这里的关键不是把一个更贵的 Token 强行说成便宜,而是把账从“Token”换成“一个能交付的任务”。而且这次不只靠感受:用 Artificial Analysis(AA)的 Intelligence Index、单任务成本和响应时长,把同一组基准放进账本里。

先给结论

在 AA 当前可见的高推理档对比里:

口径GPT-5.6 Terra(max)DeepSeek V4 Pro 0813(max)
AA Intelligence Index(越高越好)5753
AA Index 单任务 API 成本$0.51$0.25
首个输出块延迟155.06 秒1.71 秒
总响应时间159.11 秒32.91 秒
输出速度123.4 Token/s80.1 Token/s

这张表先说明一个不讨巧但必须承认的事实:按公开 API 原价,DeepSeek 的 AA 单任务成本约为 Terra 的一半,而且首包和总响应明显更快;Terra 则以 57 对 53 的 AA Intelligence Index 领先。

所以“DeepSeek 比 Terra API 便宜”是事实;“Terra 的综合能力稍高”也有 AA 的独立指标支持。但这还不是 Codex Pro 的最终价格。

不是三种价格,是三本账

讨论 Codex 与 DeepSeek 时,至少有三本不能混的账:

  1. API 单价:每一百万输入、缓存输入、输出 Token 的价格;
  2. 基准单任务成本:在固定评测任务上实际消耗多少 Token 后得到的加权成本;
  3. 订阅交付成本:用户花固定月费,换来多少个最后通过验收的真实任务。

DeepSeek 的官方价格页显示,V4 Pro 峰时价格为:非缓存输入 $1.32、缓存输入 $0.044、输出 $3.96(均为每百万 Token);谷时价格减半。OpenAI 对 GPT-5.6 Terra 的标准 API 价格为:输入 $2、缓存输入 $0.2、输出 $12。

只看到这里,DeepSeek 胜得很漂亮。问题是,开发者不是按“每百万 Token”下班的,而是按“这个 bug 修好了吗、这个网站能上线了吗、测试过了吗”下班的。

AA 榜单到底在衡量什么

AA 的 Intelligence Index v4.1.1 由 9 个评测组成,其中包含 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience 与 AA-LCR。它并不等同于“真实公司项目成功率”,却已经覆盖了 Agent 工具使用、终端/编码、长上下文、科学推理与知识可靠性等维度。

AA 的“Cost per Intelligence Index Task”也不是一句提示词的价格。它会将输入、缓存命中、缓存写入、推理和回答 Token 的价格纳入,并按各个评测的权重得到每个 Index 任务的加权平均成本。这正好给了我们一个比“每百万 Token”更接近任务层的 API 对照。

同一档 max 推理下,Terra 的 57 分比 DeepSeek V4 Pro 0813 的 53 分高 4 分;同时 API 单任务成本是 $0.51 对 $0.25。按 API 用,DeepSeek 的成本效率仍然很强,不能被一句“更智能”抹掉。

把 1649 美元等值代入:Codex Pro 的任务成本会发生什么

现在加入那条引起争论的社区实测:有人将 Codex Pro 的 7 天使用量按 API 价折算为约 $1649。注意,这只是一个用户的估值快照,不是 OpenAI 的公共配额;不同模型、工具调用、上下文长度和限额状态都会改变结果。

但既然它被用来讨论“200 美元会员值不值”,我们可以透明地做一个保守的等值推演:

AA Terra(max)任务数估计 = $1649 ÷ $0.51 ≈ 3,233 个 Index 任务
将整月 $200 订阅费只摊给这一段 7 天使用量:
订阅等值单任务成本 = $200 ÷ 3,233 ≈ $0.062

把它与 AA 列出的 DeepSeek V4 Pro 0813(max)API 单任务 $0.25 对照,得到的是:在“1649 美元等值确实可由这位用户的 7 天 Pro 使用量稳定获得”的假设下,Codex Pro 的 Terra 等值单任务成本约为 $0.062,是 DeepSeek 该档 API 任务成本的约四分之一。

这个算式的价值在于把前提摊在桌上,而不是藏起来:

  • 它不是“Codex 每做一个任务必定只要 6.2 美分”;
  • 它假设 1649 美元的等值用量可以和 Terra max 的 AA 平均任务价格相对应,现实中的 Codex 调度模型、工具费、缓存比和任务分布未必相同;
  • 它把 $200 的整月费用都压到了这一段 7 天上,因此没有假定每周都能无条件刷新同等额度;这是较保守的分摊方式;
  • 若一个用户根本用不到这种强度,固定订阅的单任务成本会立刻反过来变高。

换句话说,1649 不是“免费 API 额度”,却足以解释为什么重度使用者会觉得 200 美元便宜:订阅折扣来自使用密度,不来自魔法。

智能一点,为什么会比单价更重要

AA 57 对 53 的差距并不授权我们说 Terra 在每项任务上都胜出。更合理的解释是:在 AA 这套综合评测和 max 推理配置中,Terra 给出了略高的能力分数,代价是更高 API 成本和很高的首包等待。

但一旦进入 Agent 工程,成本函数会多出三项:

实际单任务成本
=(模型/工具账单 + 失败重试 + 人工接管时间)÷ 最终验收通过的任务数

一个模型 API 便宜 50%,只要它多造成一次重试、漏改一个文件、没有跑测试,或者让开发者多花十几分钟接管,节省的那几美分就可能瞬间蒸发。反过来,Codex 若能完成“读项目规则 → 改多文件 → 跑测试 → 看浏览器/日志 → 修复 → 验收”闭环,订阅制把高频任务的边际成本压低后,优势就不在一条输出,而在少几轮人机接力。

这也是我说 Codex “本质上可能更便宜”的真正含义:不是它的原价更低,而是它把高能力 Agent 的成本固定下来,并在被大量使用、真实完成任务时摊薄。

响应时间也要放进来,但别误读

AA 页面上,Terra max 的首个输出块延迟约 155 秒、总响应约 159 秒;DeepSeek V4 Pro 0813 max 分别约 1.71 秒和 32.91 秒。对于同步 API 交互、在线产品或人正在等待的场景,DeepSeek 的速度优势非常实际。

不过这两项是 AA 的模型响应测量,不是完整的软件工程任务从开始到构建、测试和浏览器验证结束的耗时。Codex 产品中的工具调度、仓库规模、网络、测试时间与人工反馈都在这个指标之外。因此不能拿 159 秒直接宣判 Codex “慢”,也不能拿 32.91 秒就认定 DeepSeek 的真实交付更快。

正确的做法是:在同一仓库、同一任务卡、同一测试、同一时间限制下,记录首次验收率、总调用成本、总墙钟时间、人工接管分钟数和最终交付率。那才是我愿意据此续费或换模型的榜单。

谁应该选谁

DeepSeek 更可能便宜的场景:

  • 低频使用,固定订阅摊不薄;
  • 批量摘要、翻译、模板化生成;
  • 对 API 首包延迟敏感;
  • 团队愿意自己维护上下文、工具调用、重试和验收闭环。

Codex Pro 更可能便宜的场景:

  • 每天都有跨文件、跨工具的实际工程任务;
  • 使用量足够高,能接近甚至超过社区实测的重度使用密度;
  • 最贵的是人盯着流程、反复解释和手工收尾;
  • 任务价值取决于最终可验收的修改,而不是生成了多少字。

最后的账本

所以我并不认为“DeepSeek 便宜”是错的。按 API 价和 AA 的基准单任务成本,DeepSeek V4 Pro 0813 的确更省;按 AA 的 max 档 Intelligence Index,Terra 则略高;按 AA 的响应测量,DeepSeek 明显更快。

我反对的是把这三句话直接推成“因此 200 美元 Codex Pro 不值”。对于低频用户,这个结论可能成立;对于把 Codex 当成日常工程搭档、并能稳定吃满用量的人,按社区 1649 美元/7 天等值做的保守推演显示,订阅等值的任务成本可以低到约 $0.062,反而明显低于 DeepSeek 的 $0.25 AA API 任务成本。

真正该比较的从来不是“谁的一百万 Token 更便宜”,而是“谁更少地把我叫回来收拾残局,并以更低总成本交出可验收的结果”。

数据来源与限制

AA 数据会随模型版本、推理档位和测量批次更新;社区的 1649 美元数据没有官方 SLA。本文的订阅等值计算是公开前提下的情景推演,不是购买承诺。