让智能体完成一次任务已经不难,难的是让它从每一次任务中学会改进。当前多数智能体还是 "交付即定型":遇到失败,需要人工复盘日志、修改提示词、补充工具、再重新测试。调优成本高、周期长,有效经验也难以积累。
这正是 RSI(Recursive Self-Improvement,递归自我改进)要解决的问题。 它不是让模型自己训练自己,而是让智能体从真实任务反馈中生成改进方案、执行验证、保留有效改进,帮助智能体持续优化。
早在今年 6 月,由华为 2012 实验室、华为云、终端、计算等团队联合构建的开源 AI Agent 平台 openJiuwen 即发布了 Auto Harness 能力,让智能体能够自动优化自己的一整套 "工作装备"。这一次,openJiuwen 把完整的 RSI 框架落地到了 WorkSwarm 蜂群办公智能体上,率先支持 "可插拔的 Harness + Artifacts" 双维度优化,Artifact 当前包含科研论文和算法程序两类交付产物优化,同时结合 openJiuwen 的算力亲和能力,把多轮优化的成本和耗时压了下来。
对于横跨文档、代码、数据和工具的办公任务,这意味着工作方法可以改进,交付物可以持续打磨,成功与失败的经验也能为后续任务所用。用户像创建普通任务一样发起实验,就能查看优化过程,获得经过验证的成果。

openJiuwen RSI 框架:让自我迭代真正跑起来的工程闭环
openJiuwen RSI 不是一套固定的优化算法,而是让不同自我迭代任务都能稳定运行的工程框架。它以版本化优化对象、可验证的执行证据和可扩展的算法为核心,通过四层协作,把任务目标转化为可执行、可评估的改进过程。

任务层定义 "优化什么、如何评价、能用多少资源";迭代优化层决定 "下一步试什么、哪些改进可以采纳";执行层负责 "真正跑起来并返回证据";基础框架层提供运行、模型与上下文、沙箱隔离、状态恢复和可观测性等统一能力。
整个流程串起了六阶段闭环:评测与验证建立基线;分析与优化定位从失败、轨迹和指标中找到原因;提案与构建生成候选,再按同一标准重新评测;采纳与融合消解冲突、组合有效改进,形成新版本;RSI 经验沉淀提炼方法及适用条件;最后通过归档与停止保存结果、判断是否结束。只要还有预算和改进空间,就会选择父版本继续迭代。
可靠性来自明确的分工。AgentLoop 负责单次任务的 “推理 — 行动 — 观察 — 反馈”,控制器负责跨版本优化,避免用生成者的主观判断代替验证。每份证据都绑定版本和评价上下文,候选经过过滤、融合或配置变更后必须重测;执行失败、证据无效和效果不佳也会分别记录。问题、假设、改进点及采纳或未采纳的原因都会保留,让下一轮既能借鉴成功,也能避开无效方向。
在统一的任务表达、阶段接口和生命周期下,不同对象可以采用各自的算法:
这套框架已经做进 WorkSwarm:新增的 "实验" 模式下,用户可以像创建普通任务一样发起 Harness 优化或产物优化,查看每一轮的改进过程和搜索路径,最终拿到经过验证的 Harness 插件或论文、程序产物。下面分别看三类优化在 WorkSwarm 里的实战案例。
1、Harness 优化:四步把失败案例变成即装即用的新能力
Harness 是智能体的 “工作装备”:Prompt 决定如何理解任务,Skill 提供专业方法,Tool 负责实际操作,Rail 则约束执行过程。当问题出在这些环节时,WorkSwarm 可以直接从失败案例入手,帮助用户改进装备。
1)构建优化数据。准备一份 JSON 评测集,每条用例包含用例标识、任务要求、评测方式,以及参考答案和评分规则。建议优先选真实失败过的任务。
[
{
"id": "case_001",
"input": "需要 Agent 完成的任务",
"judge_method": "llm",
"reference": {
"solution": "参考答案",
"judge_rubrics": "评分规则"
}
}
]
2)创建实验。进入 WorkSwarm 的 "实验" 页面选择 "Harness 优化",填写实验名称,选择优化模型、测试模型和初始插件,再选择评测集、评测方式和最大迭代轮次,即可创建。
3)自动迭代。WorkSwarm 先运行当前 Harness 建立基线,再从失败用例和执行轨迹中定位问题,围绕 Prompt、Skill、Tool 和 Rail 生成候选修改。候选先验证目标用例确实修好,再回放完整评测集确认整体有提升、没有改坏原本通过的任务。页面持续展示得分、迭代轮次、模型用量和搜索树,哪些方案试过、哪些被采纳,一目了然。
4)安装使用。实验产出有效版本后,点击 "安装插件",最优 Harness 即作为插件包导入并热加载,不用手工复制任何内容;版本信息保留,需要时可以回退。
在 DeepSeek-V4-Flash 任务模型、最多 5 个 Epoch 的配置下,Harness 优化在 SWE-bench Lite Dev 全部 23 道题上的通过率由 61.0% 提升至 87.0%;冻结优化后的 Harness 后,在 Evo-Bench General 64 道独立评测题上的单次执行通过率由 60.9% 提升至 71.9%。结果表明,优化收益不仅覆盖参与迭代的任务,也能泛化到未参与优化的任务。

2、科研论文产物优化:从研究构想到论文成稿,持续打磨
在 WorkSwarm 中,既可以从一个科研构想出发生成科研论文,也可以提交已有科研论文继续优化。
在 "实验" 页面依次选择 "产物优化" 和 "论文",填写优化指令(研究主题、目标问题或重点改进方向)或选择本地论文文件夹,设置最大迭代轮次,即可创建。
运行期间,详情页展示当前分数、最优论文、模型用量和迭代轮次;论文优化树记录每一轮产生的版本,点击节点可以看到本轮改动、评测结果以及未被采用的原因。实验完成后,预览当前最优产物,确认后一键下载完整论文。
3、科研算法程序产物优化:提交任务包,寻找更优版本
对于可以运行和评价的算法程序,WorkSwarm 支持从现有实现出发自动尝试多个版本,交付最优结果。
首先准备待优化的初始科研算法程序及其评价配置。推荐预先安装并调用 rsi-program-dataset-creator Skill,生成包含初始程序、scorecard 等运行和评价信息的任务包,再在 "实验" 页面依次选择 "产物优化" 和 "程序",选择任务包文件夹,即可创建与启动优化。
优化过程中详情页展示当前最优分数、模型用量和程序优化树,每个节点是一个候选程序,点击可查看改动、评测结果和失败原因;中途可以暂停,之后再继续。实验完成后,一键下载经过多轮尝试和评测筛选的最优程序,用于后续验证、集成或开发

4、算力亲和:把 RSI 多轮优化的成本降下来
RSI 的本质是拿算力换智力:反复生成候选、执行任务、评测结果,一次完整实验动辄成千上万次模型调用;优化过程中,提示词、工具描述和任务材料会反复使用,工具调用、评测和重试又带来频繁的暂停与恢复。如果每轮都重新计算相似上下文,优化规模越大,等待和资源开销就越高。
openJiuwen 算力亲和依托昇腾算力基础设施,让推理引擎 "读懂" 智能体的任务状态,框架通过 Agent Hint 把任务运行、等待、恢复和结束等信息传给引擎,帮助引擎在昇腾 NPU 显存、鲲鹏 CPU 内存和远端缓存池之间主动调度上下文缓存(KV Cache):等待时卸载到低成本存储,恢复前提前预取,结束后及时释放。从而降低多轮优化的时延与资源开销,让智能体在持续改进的同时更高效地使用算力。
在科研算法程序优化的实验中也验证了这一收益,开启算力亲和后,TTFT(首 Token 时延)均值下降 15.83%、P90 下降 19.16%;Token 加权 KV Cache 命中率由 7.53% 提升至 14.36%;HBM 与 DDR 峰值使用率分别下降 22.82% 与 30.74%。重复 Prefill 少了,首 Token 更快,存储压力也更低。

结语
openJiuwen RSI 已经形成一条从创建实验到获得优化结果的完整链路:
从 Harness 到 Artifacts 的双维度优化,openJiuwen RSI 让优化成为用户可以发起、观察和复用的持续流程:每次改变都有证据,每次采纳都经验证,每轮经验都能帮助下一轮。
后续框架将继续丰富搜索、评测与融合算法,增强跨任务经验复用,并沿统一架构接入模型优化与混合优化,让 Harness、Artifacts 和 Models 在明确的评价标准、预算与安全边界内协同迭代。
RSI 实验模式已在 WorkSwarm 上线,感兴趣的用户可前往官网一键下载,立即体验:
文章来自于微信公众号 “机器之心”,作者 “机器之心”
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0