让 AI 自动改代码,贵的不只是“想答案”:它还会反复读代码、调用工具、检查结果并重试。规模一大,每轮都重复发送上下文,Token——模型处理文字和代码的计费单位——很快堆成账单。Uber披露,从2026年2月至8月中旬,其每周Agent请求量增至9.4倍,但AI总支出自4月以来相对稳定。
Uber的做法不是单纯限制使用,而是逐项削掉浪费:主模型负责拆解和验收,边界清楚的子任务交给更便宜的模型;长对话提前压缩,并按会话节奏设置缓存;工具也不再全部塞进提示词,而是让Agent需要时再查找和调用。此前预载100多个工具,会让每轮多带约5万至7万Token;改用脚本批量执行后,5条相同SQL查询的Token消耗降低超过50%。
据Uber自述,在固定模型的对照测试中,每1000次请求成本较峰值下降近34%,单次会话成本较6月峰值下降52%。具体降幅会随代码库、团队和工作流变化,但这套思路很直接:先测清每个环节花在哪里,再让贵模型只做真正需要它的事。