
Uber写代码的活,现在超过七成已经交给AI Agent接管了。
在Uber内部,工程师们构建了超过3600个AI Agent技能,每天执行超过3万次。越来越多的任务不再需要人类去启动,而是由全自动的管理型Agent自主搞定,包括代码审查、CI故障自愈、带视觉验证的端到端PR、值班告警排查、线上Bug调试以及各种日常代码维护。
在2026年2月到8月中旬期间,Uber内部所有Agent产品的周活跃用户增长了7倍,每周Agent请求量激增了9.4倍。
在这种爆发式增长下,Uber的AI总支出自4月以来却基本保持平稳。

为了排除模型升级和业务结构变化带来的干扰,Uber在2月到7月期间固定使用同一模型进行测试,结果显示:每1000次模型请求的成本相比峰值下降了近34%,每个会话的平均成本更是从6月的峰值暴跌了52%。

调用量涨上天,成本却被按在地上,Uber到底是怎么做到的?
Uber将内部的AI使用场景从专用到通用划分为四个层级。越往顶层,团队对成本、输出质量以及模型选择的掌控力就越强。

这四个层级分别是:
不论处于哪一层,整个Agent会话的支出都可以拆解为一个由六个因子相乘的成本公式:
总支出 = 用户数 × 每用户会话数 × 每会话交互轮数 × 每轮请求数 × 每次请求Token数 × 单Token价格

前两项代表业务采纳度与活跃度,这是需要持续扩大的指标。
中间的三项代表优化空间,反映了Agent在工程师实际诉求之外自主执行的额外工作,这也是Uber团队集中发力的核心。通过优化这几项指标,可以帮助Agent更快规划路径、减少无效轮次与报错,并压缩输入的Token体积。
为了做好长期与短期的开销预测,Uber建立了一套完整的周级与月级跟踪指标体系。

围绕这套成本公式,Uber实施了一系列针对性的降本优化手段。

大模型单Token的单价由供应商决定,但选择让哪款模型去跑哪项业务,主动权在企业自己手里。
Uber的核心策略是针对不同工作负载,挑选帕累托最优的模型。这里的最优涵盖三个维度:单任务完成成本、输出质量与模型稳定性。
模型选型的具体落地分为四步:
以Uber内部负责所有PR代码审查的AI工具uReview为例。团队基于包含已知缺陷的真实PR构建了测试集,并划分为简单、中等和困难三个等级,综合评估精确率、召回率、F1分数、单次审查成本、延迟、超时率和误报噪音。

测试结果显示,切换到更优模型后,在大幅降低单个PR审查成本的同时,F1分数反而得到了显著提升。此外,Uber还依托超大单体代码库中数以千计的真实PR,构建了Uber内部专属的SWE基准测试,用来指导所有研发流程托管Agent的模型选型。
在交互式界面中,单Token单价虽然固定,但可以通过默认设置来引导Token在不同模型间的分布。
最见成效的举措是子Agent的默认模型策略。随着多Agent协作普及,启动子Agent的会话比例不断攀升。由于子Agent通常只负责执行输入明确的具体子任务,并不需要顶级模型的复杂推理能力,Uber将子Agent默认指定为更便宜的轻量模型,同时保留手动切换权限。主模型专注于任务拆解与评估,执行过程则由轻量级子Agent完成。
在多轮对话中,每一次交互都会重复发送完整的历史记录、项目上下文和工具执行结果。单个请求载荷的缩减,会在整个会话生命周期中产生复合放大效应。
Uber首先在所有交互工具环境的统一封装层中推行了标准化默认配置:
在Prompt缓存策略上,供应商对缓存读取通常只收取0.1倍的标准输入价格,但缓存写入会收取溢价。5分钟TTL的写入费用为1.25倍,1小时TTL的写入费用为2倍。

工程师在交互式会话中经常会出现超过5分钟的操作停顿。此前使用默认的5分钟TTL会导致缓存频频失效,每次继续对话都需要全额重新构建上下文。Uber将交互式会话的缓存时间调整为1小时,消除了频繁失效带来的重建成本。至于子Agent,因其聚焦于生命周期极短的单一任务,依然保持5分钟TTL配置。
在工具调用方面,Uber通过统一网关接入了超过1000个内部及第三方SaaS的MCP服务,用以集中管控鉴权与策略。
然而,标准MCP协议会将所有工具的Schema定义全部塞进每一次会话。如果挂载100个工具,每次对话在未输入内容前就要背负5万到7万Token的Schema包袱,并在后续每一轮重复传输。

为了解决上下文膨胀,Uber上线了两套互补机制:
第一是CLI命令行化工具解析。用执行Shell命令替代原生的MCP集成,CLI在调用发生时动态解析网关对应的工具并执行,直接从会话上下文中移除了所有内部MCP的Schema定义,网关内上千个MCP工具均被映射为CLI命令。
第二是工具搜索。模型先去检索工具目录,按需加载真正需要的工具定义,避免海量定义长期驻留上下文。
针对频繁调用的工具交互,Uber引入了代码模式(Code-Mode)。
在原生MCP工作流下,每个动作都需要模型生成请求、接收原始返回、再串行处理下一轮。例如查询一次SQL,需要经历提交查询、轮询状态2到5次、获取数据等多个回合,每一次轮询结果都会挤占上下文。
代码模式允许模型将一系列操作打包成一段Python脚本放入子进程执行,只有最终摘要返回给模型上下文,轮询过程全部移至模型外部。

在一组对比测试中,同样执行5次SQL查询:

测试数据显示,即便是数据量远低于响应限制的极小结果集,代码模式也能减少50%以上的Token消耗。对于批量操作场景,原本需要N轮对话的流程被浓缩为单次脚本运行,节省幅度超过90%。目前Uber已为高频MCP服务器部署了超过25个预置的代码模式技能。
对于第三方SaaS提供的MCP,例如协同办公或项目管理类工具动辄自带几十个接口,动辄占用数万Token。Uber同样将这些SaaS MCP接入统一网关,转换为CLI接口暴露给Agent,并编写专属的代码模式插件技能封装常见工作流。

缺乏全局视野的Agent在遇到信息缺失时,往往会不断扩大搜索范围、反复尝试并持续消耗Token。提前为其提供充足的上下文,是压缩无效搜索轮次的关键手段。
Uber的代码量达数亿行,内部数据表数以千计。Agent在生成代码前,大部分时间都在查找关联信息。
为此,Uber构建了企业级的AI上下文图谱。该图谱包含2400万个节点和800万条边,涵盖86种节点类型和117种边类型,打通了内部30多个系统的数据,包括微服务、研发团队、事故日志、PR历史、架构设计文档、部署状态、数据集以及历史表查询记录,并支持Agent直接通过自然语言进行查询。

在同一Prompt的实测对比中:接入图谱的Agent通过查询历史使用情况,精准找到了50多位分析师常用的一张数据表,在38秒内完成了任务。未接入图谱的Agent无法直接定位该表,耗费了20分钟查阅服务源码,衍生出2个子Agent并遭遇3次报错,最终得出了该数据集不可查询的错误结论。
为了帮助工程师和Agent减少试错周期,Uber在开发者终端的状态栏中嵌入了实时成本计数器,展示当前会话以及跨会话的累计开销。

在管控体系上,Uber放弃了一刀切的限额,转而采用实时追踪与柔性分级提醒:
同时,Uber在运行时中内置了会话分析看板。该功能无需开发者额外配置,可自动分析用户在本地和云端沙箱中的所有会话轨迹,精准识别16类开销反模式并给出优化建议,其中包括:

Uber后续的技术迭代重点集中在五个方向:
从零散的交互式开发者终端逐步转向完全托管的自主Agent,是Uber控制大模型研发成本的核心路径。将软件生命周期的工作负载转入托管环境,让平台对模型路由、运行环境和整体开销拥有了全局掌控力。为每个专门用途的托管Agent配置专属基准与最优模型,在扩展性和投资回报率上,远胜于对数千名工程师的终端使用习惯进行逐一微调。
source:
https://x.com/UberEng/status/2093444169037762840
文章来自于微信公众号 “AI寒武纪”,作者 “AI寒武纪”
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0