AI 编程智能体的预算应按“一个已验证结果”制定,而不是按“发送一次提示词”制定。预算要允许完成调查、实现、测试和一次必要修复;真正该削减的是重复上下文、无关工具、宽泛搜索与可避免返工。一个迫使任务重启的过小上限,往往比一次完整运行更贵。

为整个执行循环做预算

一次有效运行至少包括:

  • 理解任务与当前系统;
  • 读取最小相关上下文;
  • 完成改动;
  • 运行验证;
  • 修复一次失败检查;
  • 报告证据与剩余风险。

如果只计算生成代码的成本,审查和修复就会被藏到其他地方,形成虚假的低价。

建立自己的项目基线

记录模型和工具成本、总耗时、人工主动时间,以及结果是否一次通过。把相似结果放在一起比较。完成五到十项后,可用中位数作为方向性基线,不要让某个特别简单或特别困难的任务直接变成政策。

OpenAI 的 GPT-5.6 效率分析同时比较质量、token 和延迟,展示了合理的评估形状。供应商基准不能替代你的项目数据,但可以借鉴测量方式。

把上下文花在会改变结果的地方

提供当前任务契约、相关代码路径、有效决策和验证命令。不要反复粘贴旧聊天、完整日志或整个仓库。Anthropic 的上下文工程指南说明,选择高信号内容比单纯填满上下文窗口更重要。

持久的仓库指令和项目记忆可以减少重复准备,但它们必须简洁且保持最新。过时记忆不仅浪费 token,还会把执行带偏。

先限制工具宽度,再限制任务完成

过宽工具权限会鼓励过宽探索。先开放相关仓库范围的读取能力,只有任务确实需要时才接入外部系统。部署、删除、计费和公开消息应有明确授权。

不要设置一个明知会在验证前中止的硬超时。先缩小任务或工具。若一次完整运行被拆成三次重启,且每次都重复调查,所谓成本控制已经失败。

优先消灭返工循环

反复失败通常是最大可避免成本。记录第一次为什么没有通过:

  • 完成条件含糊;
  • 缺少当前状态证据;
  • 产品约束没有写出;
  • 只验证模板,没有验证最终生成物;
  • 任务过大,跨越了无关边界。

修正反复出现的输入或反馈问题。换模型应有证据支持,不能替代任务设计。

用停止条件保护价值

同一阻塞反复出现却没有新证据、缺少必要授权,或任务前提已被证伪时,应暂停。失败测试仍在提供新信息,而且下一步仍在授权范围内时,应继续推进。

目标既不是“把 token 全花完”,也不是“越早停止越好”,而是用可预期成本买到可信结果。

SoloMap 把路线图步骤、本地项目记忆、运行证据和交接留在仓库附近,减少每次会话重建同一背景的消耗。可以用一个聚焦的 Solo 任务承载一个结果,并把验收检查与它放在一起。中断后继续 AI 编程项目和本地优先项目记忆进一步说明了如何在不外包项目知识的前提下减少重复准备。

常见问题

编程智能体任务设置多少 Token 合适?

没有通用数字。先测量几项相似任务,再为完整的调查—实现—验证循环和一次小修复预留空间。

更便宜的模型一定降低总成本吗?

不一定。更多重试、更长提示词或更重审查可能抵消单价优势。应比较单个已验证结果的总成本。

一超过预算估算就应该停止吗?

不应自动停止。先看运行是否仍在产生新证据、是否接近验证。该停止的是无解释的重复循环,而不是为了任意上限放弃接近完成的可信结果。