一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

Codex 使用 GPT-5.6 Sol 时如何计算输入、缓存与输出 token 成本

时间:2026-09-12 08:36:01 编辑:袖梨 来源:一聚教程网

Codex 使用 GPT-5.6 Sol 时,计算 token 成本要把未缓存输入、缓存输入、缓存写入和输出分别计价,再判断请求是否触发长上下文倍率,最后单独加上可能存在的工具调用费用。不能只用总 token 乘一个统一单价。

根据当前官方 OpenAI 文档,GPT-5.6 Sol 的标准 API 文本价格为每百万未缓存输入 token 4 美元、缓存输入 0.40 美元、输出 20 美元;缓存写入按未缓存输入费率的 1.25 倍计费,也就是当前每百万 5 美元。

标准请求的基础公式

文本成本 =
未缓存输入 token ÷ 1,000,000 × 4
+ 缓存命中 token ÷ 1,000,000 × 0.40
+ 缓存写入 token ÷ 1,000,000 × 5
+ 输出 token ÷ 1,000,000 × 20

公式中的金额单位为美元。只有或 usage 明细实际报告的类别才应计入,不能把同一段输入同时当作未缓存输入、缓存命中和缓存写入重复计算。

一个标准上下文示例

假设某次请求包含 20 万未缓存输入、80 万缓存命中输入和 5 万输出,没有缓存写入,也没有额外工具费用。计算结果如下:

未缓存输入:200,000 ÷ 1,000,000 × 4 = 0.80
缓存输入:800,000 ÷ 1,000,000 × 0.40 = 0.32
输出:50,000 ÷ 1,000,000 × 20 = 1.00
合计:2.12 美元

这个示例只演示公式,不代表典型 Codex 任务用量。实际请求应读取自己的 usage 和明细。

超过 272K 输入时需要重算

官方模型页说明,当提示输入超过 272K token 时,整次请求按两倍输入费率和 1.5 倍输出费率计价。阈值判断针对整次请求,不是只给超过阈值的那部分加价。

在当前标准价格下,未缓存输入的有效费率变为每百万 8 美元,输出变为每百万 30 美元。缓存与缓存写入的具体仍应以该请求的官方 usage 和明细为准,避免根据简化展示自行推断。

长上下文示例

假设某次请求有 30 万未缓存输入和 2 万输出,因此越过 272K 阈值:

输入:300,000 ÷ 1,000,000 × 8 = 2.40
输出:20,000 ÷ 1,000,000 × 30 = 0.60
合计:3.00 美元

如果错误地按标准费率计算,会得到 1.60 美元,明显低估该请求。大型仓库任务应特别坚控输入规模。

什么是未缓存输入

未缓存输入包括本次无法匹配缓存的指令、对话、文件内容和工具结果。新项目、变化频繁的提示开头、首次请求以及缓存失效后,未缓存比例通常更高。

Codex 任务中一次读取大量代码或完整构建日志,会直接增加输入 token。应选择相关文件、限制命令输出,并排除依赖目录和生成产物。

什么是缓存输入

缓存输入是服务识别为可复用前缀的 token,按较低费率计价。保持稳定系统说明、工具定义和项目背景在提示前部,将动态任务内容放在后部,有助于提高命中机会。

缓存由服务端规则决定,不能仅凭两次请求看起来相似就假定命中。实际值应读取 usage 中的缓存 token 明细。

缓存写入为何单独计算

首次建立可复用缓存可能产生缓存写入费用。官方 GPT-5.6 Sol 页面目前说明其费率是未缓存输入的 1.25 倍。一次冷启动可能比随后多次缓存命中更贵,因此评估长期工作流时要观察完整请求序列。

缓存写入与保留行为可能受接口配置和产品更新影响。预算前应重新查看官方文档,并以实际字段为准。

输出 token 包含什么

输出不仅是用户最终看到的文字。对于支持推理 token 的模型,usage 可能在输出明细中列出推理 token。代理执行任务时,还可能多次生成工具调用参数和后续分析。

因此,最终回答很短不代表输出成本一定低。需要读取完整响应的 usage,而不是对屏幕中文字数做估算。

多轮 Codex 任务要逐请求相加

Codex 完成一次任务可能发出多次模型请求:探索仓库、运行测试、处理错误、修改代码和最终总结。每次请求都有自己的输入、缓存、输出和阈值状态。

不能把整场任务的输入 token 合并后只判断一次 272K 阈值,也不能只计算最后一次回复。正确做法是逐请求计算,再汇总为任务成本。

工具费用在公式之外

官方模型页说明,搜索、计算机操作等特定工具可能按调用收费。工具产生的文本还可能成为后续模型输入,同时形成 token 成本;两者属于不同项目。

账本应分别保存模型 token 成本、工具调用成本和其他基础设施费用,避免重复或遗漏。

API 价格不等于 Codex 订阅额度

上述公式适用于官方 API 定价口径。Codex 产品内的订阅、组织额度、速率限制或用量显示可能采用不同规则,不能直接用 API 美元价格解释界面中的剩余额度。

分析产品内用量时,应查看对应计划的官方说明和账户用量页面;通过 API 密钥调用模型时,再使用模型页和明细计算。

建立可审计的成本记录

请求标识与时间
模型完整名称
输入、缓存命中、缓存写入 token
输出与推理 token
是否超过长上下文阈值
工具名称与调用次数
任务是否成功及返工次数

保留模型名称很重要,因为别名可能路由到特定模型,价格也可能更新。预算报告同时记录查询价格的日期和来源版本。

如何降低成本而不牺牲质量

优先删除无关上下文、压缩重复日志、提高缓存前缀稳定性,并避免一次请求越过长上下文阈值。为简单任务降低推理强度,为复杂故障保留足够推理预算。

最终使用“每个成功任务的总成本”比较方案。一个便宜但需要多次返工的请求,可能不如一次完成且验证充分的请求经济。

价格会变化。官方页面目前注明 GPT-5.6 Sol 的促销价格至少持续到 2026 年 11 月 21 日,生产预算和公开文章都应标注核验日期。掌握分类计价、逐请求汇总和长上下文倍率,才能把 Codex 的 token 用量转换成可复算、可解释的真实成本。

热门栏目