AI Agent为什么越跑越贵:拆解Token成本与降本路径

AI Agent的Token成本并不只取决于一次模型调用,而是由上下文累积、工具返回、循环推理、失败重试和多智能体协作共同放大。建立按任务核算的成本模型,并从上下文、流程和模型路由三个层面优化,才能在不明显牺牲效果的前提下降低支出。

与普通聊天机器人相比,AI Agent能够规划任务、调用工具、读取资料并根据结果继续行动。这种自主性提升了任务完成能力,也让成本结构变得更复杂:用户看到的可能只是一条最终答案,系统背后却可能已经完成多轮模型调用,并反复传入系统提示词、历史对话、检索材料和工具执行结果。

因此,评估AI Agent的成本不能只看单次请求使用了多少Token,也不能简单地用模型标价乘以最终回答长度。更有意义的指标是每个任务的总成本、成功任务成本,以及完成一个业务结果所需要的平均Token数量。

AI Agent的Token成本从哪里产生

一次Agent任务通常由多个步骤组成。模型先理解目标并生成计划,再选择工具、构造参数、读取工具返回结果,随后判断任务是否完成。如果结果不符合预期,Agent还会修改计划并进入下一轮。每一轮都可能产生新的输入Token和输出Token。

成本来源主要内容常见放大原因
系统提示词角色定义、规则、工具说明、安全要求和输出格式提示词过长,并在每次模型调用中重复传入
对话与任务历史用户请求、模型回复、中间决策和状态信息历史记录持续累积,缺少摘要或裁剪机制
检索上下文知识库文档、网页内容、数据库记录和搜索结果召回文档过多、切片过长或相关性不足
工具调用结果接口响应、日志、代码执行结果和结构化数据原始结果未经筛选,完整回填到模型上下文
模型输出计划、分析、工具参数、中间结论和最终答案要求冗长解释,或模型在多轮中重复表达
重试与纠错格式修复、调用失败重试和结果校验工具不稳定、提示词含糊或缺少明确终止条件
多智能体协作角色之间的任务分派、消息传递和结果汇总多个Agent重复读取相同背景并交叉讨论

为什么Agent成本容易被低估

普通大模型应用往往接近“一次输入、一次输出”,而Agent更像一个循环系统。假设某项任务进行了多轮决策,每轮都重新携带大部分历史上下文,那么后续调用的输入Token会越来越多。即使每轮只新增少量内容,累计成本也可能呈现明显增长。

Agent还经常把工具返回的原始内容直接放入上下文。例如,搜索接口可能返回多篇网页,数据库查询可能产生大量记录,代码执行环境可能输出冗长日志。真正有助于下一步决策的信息只占其中一小部分,但模型仍需读取全部内容并按输入Token计费。

另一个容易忽略的问题是失败任务。一个任务即使最终没有生成可用结果,过程中消耗的Token、检索费用和工具调用费用仍然存在。因此,只统计成功请求的平均模型账单,会掩盖重试、超时和人工接管带来的真实成本。

如何计算一次Agent任务的真实成本

基础模型费用可以概括为:输入Token数量 × 输入单价 + 输出Token数量 × 输出单价。如果服务商对缓存输入、批处理请求或不同上下文长度采用不同价格,还需要分别计算。对于完整的Agent任务,则应汇总全部模型调用,并加入模型之外的运行费用。

更完整的任务成本可以表示为:模型调用成本 + 检索成本 + 工具与第三方API成本 + 计算与存储成本 + 失败重试成本 + 人工审核成本。其中只有第一部分直接由Token数量决定,但其他部分往往与Agent调用轮次同步增长。

核算指标计算口径管理价值
单次调用Token成本一次模型请求的输入费用与输出费用之和适合比较模型和单个节点
单任务总成本任务内所有模型、工具、检索和基础设施费用之和反映Agent完整运行成本
成功任务成本总运行成本除以成功完成的任务数量将失败与重试纳入经营评估
单位业务结果成本总成本除以有效线索、完成工单或合格报告等业务结果数量用于判断商业投入产出
成本分位数统计任务成本的中位数及高分位数识别少数超长任务造成的成本风险

一个简化的成本测算示例

以下示例仅用于说明计算方法,不代表任何模型或供应商的实际价格。假设一个研究型Agent需要进行规划、两次资料分析和一次结果汇总,并采用统一的假设单价。

调用阶段输入Token输出Token输入单价输出单价阶段成本
任务规划4,000800每百万Token 20元每百万Token 60元0.128元
第一次资料分析12,0001,200每百万Token 20元每百万Token 60元0.312元
第二次资料分析18,0001,500每百万Token 20元每百万Token 60元0.450元
结果汇总24,0002,500每百万Token 20元每百万Token 60元0.630元
合计58,0006,000按相同假设计算按相同假设计算1.520元

这个示例说明,最终汇总阶段虽然只生成一份答案,却可能因为携带了此前的任务历史、检索材料和中间结果而成为最昂贵的环节。如果任务发生一次完整重试,模型成本可能接近翻倍;如果还调用付费搜索、浏览器、数据库或代码执行服务,总成本会进一步增加。

降低Token成本的核心方法

缩短重复出现的系统提示词

系统提示词应保留真正影响行为的规则,删除重复背景、宽泛描述和可以由程序保证的约束。工具说明也不应一次性全部加载,可以根据当前任务动态提供可用工具。若模型服务支持提示词缓存,应重点缓存长期不变且频繁复用的内容。

把完整历史改为结构化状态

Agent不必在每一轮重新阅读全部对话。系统可以将已完成步骤、关键事实、待办事项、约束条件和错误信息压缩为结构化状态,只向模型提供当前决策所需内容。对于长任务,可定期生成摘要,但应保留关键数据的原始引用,避免摘要过程造成事实丢失。

控制检索材料的数量和长度

知识库检索并不是返回越多越好。更有效的方式是先提高召回质量,再通过重排、去重和片段裁剪减少无关上下文。面对长文档时,可以先用成本较低的模型提取与问题相关的段落,再交给能力更强的模型完成推理和生成。

压缩工具返回结果

数据库、搜索接口和执行环境应尽量返回模型真正需要的字段,而不是完整原始响应。对于表格数据,可以先在程序侧完成筛选、聚合和排序;对于运行日志,可以只保留错误行、关键状态和必要的上下文。确定性的处理交给代码,通常比让模型读取大量Token更稳定。

采用模型分层与动态路由

并非所有步骤都需要使用高成本模型。意图识别、字段提取、文本分类、结果去重和格式检查等任务,可以交给较小模型或传统程序;复杂规划、跨文档推理和高风险决策再调用能力更强的模型。路由策略应依据任务难度、风险等级和历史成功率动态选择,而不是简单固定模型。

限制循环、重试和输出长度

Agent需要明确的最大步骤数、超时规则、重试次数和终止条件。工具调用失败时,应根据错误类型决定是否重试,避免对权限错误、参数错误等不可恢复问题进行无意义重复。输出侧则可以通过结构化格式、字数边界和停止条件减少冗余生成。

降本不能只追求更少Token

减少Token并不必然降低总体成本。如果上下文被压缩得过度,模型可能因为缺少关键信息而频繁重试;如果盲目切换到能力不足的模型,任务失败率和人工审核量也可能上升。真正合理的目标不是让每次调用最便宜,而是让每个成功业务结果的综合成本最低。

优化时还应同时观察质量指标,包括任务成功率、事实准确率、工具调用正确率、平均完成时间和人工接管率。任何降本实验都应使用相同任务集进行对照,避免因任务难度差异得出错误结论。

建立可持续的成本治理机制

企业应为每次Agent运行记录任务标识、模型名称、调用阶段、输入与输出Token、缓存命中情况、工具费用、重试原因、最终状态和质量评分。只有把成本数据与任务链路关联起来,才能判断高消耗究竟来自提示词、检索、工具输出还是循环失控。

预算控制也应设置在任务层,而不只是账户层。系统可以为不同业务配置单任务预算、最大Token、最大步骤数和允许调用的模型范围;当消耗接近阈值时,自动压缩上下文、切换模型、请求用户补充信息或转交人工处理。

AI Agent的成本优化,本质上是减少无效上下文、无效推理和无效行动,同时保留完成任务所必需的信息与能力。

随着Agent从实验环境进入规模化生产,Token价格只是成本管理的起点。真正决定经济性的,是任务如何拆分、上下文如何流转、工具如何返回数据、模型如何分工,以及失败是否能够被及时终止。把核算单位从“单次调用”升级为“成功业务结果”,才能准确判断一个AI Agent是否值得长期运行。