
当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。
过去,智能体的技能(Skill)大多依赖人类专家手动撰写,不仅耗时费力,更难以覆盖海量复杂的真实场景。为此,借助大模型“自动化生成与优化技能”,成了让 Agent 迈向自主进化的新范式。
然而,摆脱了人工编写的束缚,却撞上了高昂的 Token 账单。要验证一个自动生成的技能到底管不管用,必须让智能体带入真实任务中落地执行。每一次试错,都是实打实的 Token 消耗与多轮交互的时间成本。
更棘手的是,许多候选技能在刚生成时就自带缺陷。但在现有框架下,我们缺乏“事前筛选”的能力,只能任由大量预算被这些低质候选无意义地吃掉。同时,后续的精炼流程也在频繁调用高阶 LLM,哪怕缺乏有效的新证据,这种“反思—重写”的流水线依然在机械重复。
评估贵,精炼也贵,两笔账算下来,技能优化的效率就成了绕不开的瓶颈。
针对这一痛点,来自香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队,在论文《COBRA-SKILLS: Contextual Bandit-Guided Evolution for Agent Skill Optimization》中提出了一种全新的破解思路。

论文链接:https://arxiv.org/abs/2609.11682
COBRA-Skills 摒弃了盲目堆叠 Token 的演化路线,巧妙地将技能优化转化为一个带预算控制的情境多臂老虎机(Contextual Bandit)问题。
它在真实评估前增加了一道“收益预判”机制,确保只有最具潜力或探索价值的候选技能才会进入实际演练,并结合精细化算子迭代种群。凭借这套高效的筛选策略,COBRA-Skills 仅用 50 个优化样本,就将优化成本降低了 55%~58%,并在 6 个跨领域 Benchmark 上实现了对现有主流方法的全面超越。
AI 科技评论近日独家对话了论文第一作者卢平琛。在交谈中,他向我们还原了团队如何将“情境多臂老虎机”引入 Agent 技能演化,以及这套低成本范式背后的真实踩坑经历与工程抉择。
COBRA-Skills 的设计可以概括成:老虎机负责“选”,进化负责“改”,两者形成一个持续运转的闭环。
具体而言,系统维护着一个固定规模的技能种群。在日常迭代中,流程分为三步:
1.筛选评估。由老虎机算法为种群中的每个技能打分,挑选出得分最高者;
2.实战检验。目标智能体搭载该技能在优化集上执行任务,并返回对应的奖励与执行轨迹;
3.反馈更新。将评估结果写入历史数据,用于更新打分模型。此外,种群会定期触发进化更新,淘汰低分技能并生成新技能填补空缺。

这两大机制紧密结合。老虎机依据历史数据预测技能潜力,而进化生成的新技能则会回流至老虎机的候选池;反过来,进化机制所依赖的改进证据,来自执行老虎机精细挑选后的技能后留下的执行轨迹。
论文第一作者卢平琛在接受AI科技评论采访时透露:
在最开始复现同类工作时,我们发现总 Token 量看似还好,但账单却高得吓人。
团队深入分析后发现,核心瓶颈在于教学模型(Teaching Model,如 GPT-5.5 类高阶模型)调用次数过多,且单次调用的上下文极长。因此,团队在设计初期就明确将目标定为控制实际经济成本(Cost),而非简单统计 Token 数量。
▎两层 MLP 收益预测:为未评估技能精准打分
最直接的做法,是基于历史评估数据,预判候选技能在未评估时的预期得分。
COBRA-Skills 借助一个轻量级的两层 MLP 来实现这一点:先将每个技能转化为语义嵌入向量,再由 MLP 输出一个标量奖励预测值。
随着评估数据的积累,预测精度会稳步提升。每完成一次技能评估,最新的“技能—奖励”数据就会被纳入历史库,用于重新拟合预测模型。
然而,单纯依赖预测收益往往会带来局限。若某种技能当前的预测得分最高,算法就容易陷入对它的持续选择,导致其他有潜力的技能永远得不到评估机会。这便是经典的“探索与利用”困境。
▎LinearUCB 空间探索:破除“只选高分”的贪婪困境
在探索策略的选择上,团队曾经历过严谨的实证对比。
据卢平琛介绍,团队最初曾尝试过 NeuralUCB,但发现其特异性筛选能力较弱。
比如连续两轮选中同一个技能,系统对该技能不确定性的衰减幅度与其他技能几乎没有区别;此外,NeuralUCB 的计算量极其庞大,在做对角化近似时还会牺牲部分精度。
相比之下,LinearUCB 则展现出了极高的性价比与精准度。仿真实验表明,以技能嵌入向量为输入、对应奖励为输出时,LinearUCB 能非常灵敏地识别出哪些语义区域已被充分探索,进而精准压低该区域的探索奖励,实现了轻量与高效的兼得。
因此,团队最终采用了 “神经网络预测收益 + LinearUCB 量化探索” 的轻量高效组合。
最终优先级分数 = 预测奖励 + 探索奖励
在运行逻辑上,系统每轮仅挑选得分最高者送入评估,而综合分值垫底的技能则会在后续进化中被淘汰。
这种设计将有限的评估预算精准引导至两类技能:要么预测表现极佳(利用),要么信息增量巨大(探索)。至于那些既无性能优势、又处于已探明区域的低质技能,则会被彻底过滤,不再浪费任何 Token。

图:LinearUCB 探索系数v对系统平均性能的影响分析(当v=0.1时达到最优性能 73.5%)
老虎机算法解决了“选谁评估”的效率问题,但候选技能本身并不会凭空变强。
真正推动技能质变的是进化机制。它立足于评估所产生的实战证据,负责对候选技能进行持续的生成、重组与精炼。
▎攒够证据再动刀,避免频繁消耗 Token
为了避免高频调用高昂的 LLM 去频繁重写技能,进化机制并非逐轮触发,而是采用了对数调度策略,例如在第 3、6、9、13、19……次迭代时按需触发。
据卢平琛介绍,随着演练推进,老虎机本身已能建立起相对准确的预测逻辑,老虎机的预测结果也能逐渐收敛到好的候选技能上,因此后期并不需要高频补充新技能。
这种“前期密集、后期稀疏”的演化节奏,让团队得以在积攒了足够的实战轨迹证据后才精准“动刀”,从而大幅降低了 Teaching Model 的调用频次与 Token 消耗。
▎三种演化算子:保守微调与结构保护
每次进化更新时,算法淘汰评估得分最低的m个技能,并由以下三种算子生成新技能填补空缺:
1.再生算子(Regeneration):直接从初始无技能的执行轨迹中归纳全新的独立策略,不依赖现有父代,为种群引入全新的探索方向。
卢平琛提到:
若整个框架只能保留一个算子,再生算子无疑是绝对核心,因为初始技能种群正是基于它构建而来的。
2.轨迹变异(Rollout Mutation):针对当前轮次评估的技能,采样其最新的成功与失败案例,仅做局部的针对性修正。
3.交叉重组(Crossover):对比历史高绩效与低绩效技能,以其中一个高分技能为“骨架”,吸收成功经验并规避已知失败模式。该过程无需目标智能体重新评估,属于“零成本”重组。
除了算子设计,团队在技能的修改幅度上也展现出了极强的工程克制。
不同于许多同类工作让 LLM 对技能进行全局重写或过度融合,团队在实验中发现,大面积修改极易破坏原技能中已生效的优良结构,从而引发性能震荡。
卢平琛强调:
对于轨迹变异与交叉重组算子,我们以现有技能或高分技能为骨架,进行少量、保守的局部修改,这样才是稳定可控的。
为了全面验证 COBRA-Skills 的泛化能力,论文在 6 个异构的智能体基准上进行了评估。这些任务覆盖的维度相当广泛:
这些任务不仅横跨单轮与多轮交互,更涵盖了外部文件处理、工具调用以及与持久化环境的持续互动。
在实验配置上,团队选用了三个不同能力梯队的目标模型(Qwen3.6-35B-A3B、GPT-5.4-Nano、Gemma-4-26B-A4B-it),并统一采用 GPT-5.5 作为教学模型。
所有方法均共享同一个 100 例的留出测试集,且该测试集全程严格绝缘于技能的构建与筛选过程。
▎突破性能上限,中小模型“补强效应”尤为突出
在三个不同能力梯队的目标模型上,COBRA-Skills 均取得了最高平均性能。相比无技能基线,它在 Qwen、GPT-Nano 和 Gemma 上分别大幅提升了 13.1、26.9 和 22.5 个百分点。数据表明,优质技能对于能力相对较弱的小模型,具有更显著的“补强效应”。

图:COBRA-Skills 与主流方法在不同目标模型上的平均性能(上)及性能与优化成本对比(下)
对比实验还显示,即便仅做初始化、不做后续优化的“证据锚定技能基线”,其表现也能稳定超出无技能基线,而 COBRA-Skills 则在此基础上实现了进一步的跨越。
值得一提的是,在三个目标模型的实验结果种,COBRA-Skills 并非在所有单项基准上都拔得头筹(例如在Qwen3.6-35B上,SearchQA 上略低于 SkillOpt;在Gemma4-26B上,DocVQA 上优势不明显)。但它的核心优势在于极高的综合鲁棒性。无明显短板,也没有在任何模型上失灵。

表:COBRA-Skills 与主流方法在 6 个 Benchmark 上的详细性能对比数据
在复杂的异构任务场景中,这种“不偏科”的综合稳定性,远比单一任务上的单点突破更具实用价值。
▎教学 Token 节省八成,50 样本撬动高稳定泛化
在成本控制上,与最强基线 SkillOpt 相比,COBRA-Skills 的总优化成本降低了 55%–58%,教学模型的 Token 消耗大幅缩减了 67%–80%,每单位性能提升的成本降低了 60%–69%。

表:COBRA-Skills 与主流方法在 Token 消耗、优化总成本及单位性能成本上的量化对比
传统方法往往依赖庞大的样本集进行训练与验证。例如在 SearchQA 上,SkillOpt 官方配置包含 400 个训练样本和 200 个验证样本;SpreadsheetBench 的 Trace2Skill 也使用了 200 个样本。相比之下,COBRA-Skills 在所有基准上统一仅使用 50 个优化样本。
针对这 50 个样本的设计考量,卢平琛解释道:
样本太少(如 20 个)会导致分数反馈剧烈震荡,而 50 个样本能提供非常稳定的反馈信号。在具体进化时,我们每次从 50 个样本中随机抽取 8 条执行轨迹作为证据;C₅₀⁸构成了极其庞大的组合空间,既保证了证据的针对性,又为技能生成保留了丰富的多样性与探索空间。
这 50 例样本在“评估可靠性”与“任务覆盖度”之间取得了极佳平衡:每个候选技能均在这 50 例上完整评估,以获取可靠的排序信号;同时,样本完整保留了基准任务的真实构成,能暴露出多样化的重复模式供技能归纳。样本少不等于信息少,关键在于利用效率。

论文还设计了两组消融实验:
1.w/o Bandit(移除老虎机):保留进化机制,但候选筛选改为随机选择,平均性能下降 2.2 分。
2.w/o Evolution(移除进化):保留老虎机机制,但在固定的 30 个技能池中挑选,不生成新技能,平均性能下降 2.4 分。
两者均造成 2 分以上的性能衰退,可见选择性评估分配与候选空间演化互为补充、缺一不可。
此外,论文还设置了 Best-of-30 基线(用同样的证据锚定机制生成 30 个技能,全量评估后取最优解)。结果显示,Best-of-30 比完整方法低了 2.5 分。

图:消融实验与 Best-of-30 结果对比(上表)及 36 组跨模型技能迁移矩阵热力图(下图)
▎无惧接口切换、离线自教学与跨模型迁移
论文从三个层面进一步验证了方法的泛化韧性。
1.框架适配:将 Qwen 移植至 Claude Code 和 Codex 框架下运行,COBRA-Skills 依然分别取得 68.2 和 72.4 的最高平均分,证明其效果不依赖特定的智能体接口。

表:COBRA-Skills 在 Claude Code 与 Codex 框架下的跨平台适配性能对比
2.自教学进化:若以目标模型自身取代 GPT-5.5 进行技能生成与精炼,系统平均分仅由 73.5 微降至 72.5,却实现了成本减半,且性能远超同等设置下的 SkillOpt(68.4),展现了离线低成本自教学的巨大潜能。

图:迭代收敛过程(左)及自教学模式下的性能与成本对比(右)
3.跨模型复用:将 GPT-5.5 优化的技能库迁移至其他目标模型,36 次迁移中 34 次成功超越基线。这有力地说明,COBRA-Skills 提取的是高泛化性的任务层解题范式,而非与特定模型绑定的 Prompt 技巧。
过去一段时间,Agent 领域隐约浮现出一种“大模型全包”的迷信:从任务理解、技能生成,到诊断反思与重写进化,全盘交给 LLM 端到端解决。但这篇论文用一组直观的账单数据,直白地戳破了这种“全能幻觉”。
大模型固然具备惊人的符号生成与语义理解能力,但在处理带预算约束的序列决策、估计统计不确定性,以及计算“算力回报率”这类问题时,它不仅价格昂贵,而且缺乏天然的概率把控力。
COBRA-Skills 最耐人寻味的设计,恰恰在于它的“复古”。团队没有强求大模型凭空判断哪个技能更有价值,而是优雅地引入了决策理论中经过数十年验证的“上下文老虎机”。
这种“传统 ML 负责量化与控本,LLM 负责生成与提纯”的范式融合,为下一代 Agent 的架构设计提供了清晰的示范。
▎AI科技评论:在跨模型迁移实验中,36 次迁移有 34 次成功超越了基线,但有 2 次表现欠佳。这两次“例外”是什么原因造成的?
卢平琛:这两次例外的幅度其实都很小,分别只比对应的无技能基线低约 0.3 和 1.7 个百分点。一个更可能的原因是,不同模型的能力结构、推理习惯和错误模式并不完全一致,因此在一个模型上优化出的 Skill,未必能完全匹配另一个模型最需要的指导方式。当然,这其中也包含少量的随机因素。但总体来看,超过 94% 的成功率证明,优化出的技能抓取的是通用的任务级策略,具备极强的跨模型通用性。
▎AI科技评论:从工程落地的角度看,目前 COBRA-Skills 最大的局限性是什么?
卢平琛:目前我们主要聚焦于任务层(Task-level)的技能演进化。从技能自身的结构来看,我们尚未覆盖过于复杂的多技能联动场景。比如像 Claude Code 提出的某些 Skill 结构中,会在执行 SQL 的同时动态调用 Python 脚本,或者通过索引去关联其他 SQL 技能。这种跨工具、多层级的复杂技能联动结构,是我们目前尚未覆盖、也是下一步需要探索的方向。
▎AI科技评论:如果将这种“老虎机 + 进化”的思路延伸到其他场景(如 Agent 工具调用、RAG 检索等),你觉得哪种最有可能率先落地?
卢平琛:RAG 领域的相似度检索最有可能率先落地。因为 Skill 的标准结构本身就包含 Title(标题)、简短 Description(描述)以及 Body(正文)三部分。在实际业务中,大量 Agent 正是依赖那句简短 Description 进行索引与匹配的,这与我们当前的优化框架天然契合。
▎AI科技评论:如果用一句话来概括这篇论文最核心的贡献,你会怎么总结?
卢平琛:高效、低成本地优化 Agent 的 Skill,让智能体演化不再被昂贵的账单拖垮。
文章来自于"AI科技评论",作者 "张璐"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0