一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

便宜大模型为何不一定降低任务的实际推理成本?

时间:2026-09-16 09:26:01 编辑:袖梨 来源:一聚教程网

选择推理模型时,开发者常把输入价和输出价相加,再按每百万 Token 的标价排序。但这种比较忽略了一个关键变量:不同模型完成同一任务所消耗的 Token 和交互轮数并不相同。单价较低的模型如果思考更久、反复调用工具或多次纠错,最终可能高于单价更高但更高效的模型。

什么是价格反转

论文《The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More》把这种现象称为价格反转:模型 A 的公开 API 单价低于模型 B,但在相同任务上的实际总成本反而更高。它类似按小时收费的工作,高时薪专家如果更快完成,最终费用可能低于低时薪但耗时更长的人。

研究评估了 8 个前沿推理模型和 12 类任务,覆盖竞赛数学、科学问答、代码生成、知识问答、网络安全、终端操作与通用 Agent。作者对所有模型对和任务进行比较,在 336 个成对结果中发现 106 个价格反转,占 32%。

论文报告的最大反转幅度达到 28 倍。汇总全部任务时,某个低标价模型虽然标价比另一模型低 80%,实际成本却高 38%。这不是说该模型在所有场景都更贵,而是说明仅按价目表排名会频繁得到错误结论。

实际成本由哪些变量决定

单轮调用的基本成本由新输入 Token、输出 Token 和各自单价决定。推理模型的输出还包含内部思考 Token;在代理任务中,每轮历史上下文可能命中缓存,因而又有缓存写入和读取价格。总成本是所有交互轮次费用之和。

论文把差异拆成八个可观测因素:总轮数、每轮新输入、每轮普通输出、每轮缓存 Token、每轮思考 Token,以及新输入、输出和缓存各自的价格。作者使用 Shapley 值框架,将两个系统的成本差公平归因到这些因素。

这种拆分很重要,因为单价只覆盖八项中的三项。剩余的 Token 数量和轮数由模型行为、问题难度、提示词与 Agent 框架共同决定。模型选择不能脱离完整运行轨迹。

单轮任务为何会反转

在数学、科学问答和代码等单轮任务中,最主要原因是“过度思考”。同一道题,不同模型使用的推理 Token 可能相差巨大。论文给出的极端示例中,一个模型为某道 MMLU Pro 问题使用超过 6 万个思考 Token,另一个模型只用了 25 个。

研究发现,在发生价格反转的单轮模型对中,超过 95% 的成本差可归因于思考 Token。即使每个输出 Token 很便宜,当输出数量增加数十或数百倍,单价优势也会被完全抵消。

困难任务会放大差异。容易问题多数模型都能以较短推理完成,成本差不大;难题会诱发长时间探索、回溯和自我校正。低单价模型若缺乏高效推理策略,就可能用更多计算换取答案。

Agent 任务为何更容易失控

Agent 不只生成答案,还要与环境反复交互。它可能搜索文件、运行命令、读取错误、修改代码并重新测试。每增加一轮,都要重新发送系统提示、历史消息和工具观察,缓存虽能降低部分单价,却不能消除全部费用。

论文展示了同一安全任务中,不同模型可能分别使用 7 轮和 57 轮环境交互,相差超过 8 倍;总体上,模型间交互轮数可相差约 10 倍。对多轮任务,轮数和缓存输入成为价格反转的重要来源。

研究还指出,在一个模型对的网络安全任务中,轮数对成本反转的贡献超过 80%。这说明 Agent 的成本优化首先要减少无效动作,而不是只寻找更低 Token 报价。

为什么成本不能用单个平均数表示

同一个模型对同一个提示词重复运行,也可能产生不同推理路径。有时一次找到答案,有时绕路、重试或调用更多工具。论文观察到相同查询的思考 Token 最多相差 9.7 倍,表明每次请求成本具有明显随机性。

因此,平均成本可能隐藏尾部风险。两个模型平均费用接近,但其中一个的高分位成本很高,大规模运行时更容易出现预算尖峰。企业应记录中位数、百分之九十和百分之九十九分位,而不只报告均值。

成本预测也不能只输出一个确定数字。更合理的目标是估计分布:某类任务通常花费多少,最坏情况下可能达到多少,以及超过预算的概率。预印本把成本分布预测列为开放问题。

任务相关性为何重要

论文发现,没有一个模型在所有任务中始终最便宜或始终最贵。一个模型在知识问答上很高效,到了网络安全或终端任务中可能因交互轮数增加而变贵。用单一排行榜选择全公司默认模型,会掩盖这种任务差异。

模型评测需要复制真实工作流。若生产系统使用检索、浏览器、终端和特定重试策略,测试也应使用相同 Agent 框架。只运行单轮基准,无法估计多轮历史、缓存和工具错误带来的成本。

质量同样不能忽略。论文主要研究实际费用,未把输出质量纳入统一成本排名。企业若只选择最低模型,可能得到更多错误并增加人工返工。更完整的指标是每个成功任务成本。

如何做可靠的模型成本评估

  • 从真实流量抽取覆盖简单、中等和困难任务的测试集。
  • 对每个模型重复运行同一批任务,保留完整轨迹。
  • 分别记录新输入、缓存读写、普通输出和思考 Token。
  • 统计交互轮数、工具调用、重试、成功率和人工复核。
  • 报告平均值与多个成本分位数,关注长尾预算风险。
  • 按任务类型排名模型,不使用一个全局价格排行榜。
  • 在模型、价格或 Agent 框架变化后重新评测。

实验还应固定质量与服务等级。不同模型使用供应商推荐的推理配置可能更贴近默认体验,但采购评估还要测试企业自己的延迟目标、最大输出和工具权限。在相同成功率和时限下比较,结果才具备决策价值。

停止条件也必须一致。如果一个 Agent 首次得到可用答案就结束,另一个仍被要求继续验证,轮数差异来自测试设计而不完全是模型。应统一最大步骤、成功判定、超时和失败处理,并公开记录提前终止原因。

怎样减少价格反转风险

首先为推理长度和 Agent 轮数设置上限。超过预算后可以请求模型总结当前进度、切换更强模型,或交给人工,而不是无限重试。其次压缩历史上下文,只保留后续步骤需要的观察,降低每轮缓存和输入成本。

模型路由应参考预测任务成本,而非静态单价。简单任务使用低价模型,困难或高错误代价任务直接使用更高效的强模型;运行中若检测到长思考或重复动作,也可以动态升级。

可观测性必须落到请求级。聚合到供应商和月份后,无法判断是哪个任务、提示词或 Agent 循环导致异常。每条轨迹应关联业务结果、模型版本、Token 分类、轮数和费用,使团队能够回放并修正。

研究结论的适用边界

这项研究是 2026 年发布的 arXiv 预印本,模型版本、API 定价和服务实现会变化。论文覆盖的 8 个模型和 12 类任务不能代表所有语言、行业和私有部署。某个模型在实验中的价格反转,也不意味着它将永久维持同样排名。

但方法论具有普遍意义:总成本是单价、Token 数量和轮数共同作用的结果,且请求成本具有随机性。无论价格如何变化,只依据价目表推断实际费用都缺少关键证据。

结论

便宜大模型不一定降低实际推理成本,因为低单价可能被更多思考 Token、更长 Agent 轨迹和重复上下文抵消。论文在 336 组比较中观察到 32% 的价格反转,说明这不是偶发边缘现象。

正确做法不是寻找永久“最便宜”的模型,而是对真实任务重复测量成本分布,并把质量、轮数和所有 Token 类型纳入评估。企业只有以每个成功任务成本进行路由和治理,才能避免低标价模型在生产环境中形成更高。

热门栏目