RSI离我们有多远?这家中国团队给出了第一梯队的工程解

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
RSI离我们有多远?这家中国团队给出了第一梯队的工程解
8734点击    2026-09-03 14:17

Agent 经常遇到这样一种幻觉:你给模型接入了终端,下发了一个复杂的 debug 任务,看着它顺藤摸瓜排查了几个小时,最终完美修复了依赖冲突,甚至连测试用例都帮你补齐了。


你以为你的系统变强了。


但第二天,另一个 Agent 接手了同一个仓库的相似任务。结果,它像个完全没来过的新手,从盲目读取报错、乱改配置到随意重装,把昨天踩过的坑、走过的弯路,原封不动又走了一遍。


代码修好了,日志也存下来了,但对于系统而言,什么都没有发生。


RSI离我们有多远?这家中国团队给出了第一梯队的工程解


深挖这个现象,是一个残酷、致命、却极少被正视的工程问题:模型的单次推理能力再强,只要任务一结束就 “阅后即焚”,系统就永远不可能产生真正的能力复利。


当整个行业都在狂热探讨大模型的下一个技术奇点 ——RSI(Recursive Self-Improvement,递归式自我改进)时,大家往往陷入了一个思维定势,认为 RSI 的终极形态必须是 “大模型自己写代码训练出一个参数量更大的基座模型”。


但在真实的工程环境里,如果 Agent 连 “刚刚踩过的坑,下一次不要再重试” 都做不到,谈何自我改进?


最近,EvoMap 团队围绕这个问题做了系统性探索。他们没有盲目跟风 “大模型自我训练” 的远期大饼,而是提出了一条极具现实意义的工程新路径:不要把 RSI 留给基模去硬算,而是在系统层构建一个天生具备 “自进化” 能力的智能体,并让经验在一个庞大的网络中流转。


这并非停留在白皮书上的设想。目前,基于该团队构建的 GEP 协议,EvoMap 网络中已经有超过 35.7 万个 Agent 接入,并且沉淀了高达 481 万项被目录化管理的经验资产。


不仅如此,他们在严苛的科研基准上也交出了答卷。由 EvoX(自进化智能体本体)、Evolver(内置进化引擎)和 EvoMap(经验流转网络)构成的这套组合拳体系,正在用极其硬核的数据向行业证明:很多时候决定智能体是否聪明的,不是「你调用了多贵的基模」,而是「经验在系统里,长什么形状,怎么流动」。


想要进化,

首先你得是一个 “活” 的智能体


现在的 Agent 系统有一种奇怪的分裂。在聊天窗口里,模型可以条理清晰地讲出一套修复逻辑,甚至能写出一份详尽的排查 SOP;但一把它放进真实的开发环境,它经常连一个最基础的环境变量配置都搞不定。


因为没有真实的试错动作,就不可能产生真实的经验。


这正是 EvoMap 团队研发的自进化智能体 EvoX 的核心定位。它不是一个被动的测试沙盒,而是一个天生为真实物理世界和代码环境设计的 “自进化智能体”。


RSI离我们有多远?这家中国团队给出了第一梯队的工程解


当 EvoX 接手任务时,它必须实打实地读源码、敲命令、调工具、看报错。无论任务最终成败,EvoX 都会在底层留下一条极其详尽的执行轨迹:哪一步的报错打破了僵局?哪一条错误的 bash 命令彻底带偏了节奏?


这条带着真实反馈的泥泞轨迹,是后续系统进化的唯一原材料。EvoX 之所以独特,在于它不只负责 “干活”,它生来就带着提炼这套轨迹的本能。


Evolver 引擎:

经验是高密度的 “控制片段”


拿到 Agent 吐出的长串轨迹后,业内最常见的做法是什么?


—— 写成一份巨长的 Skill(技能文档),扔进 RAG 里,下次遇到任务就喂给模型。


但这其实是大错特错的。在我们之前报道过的 EvoMap 团队论文《From Procedural Skills to Strategy Genes》(https://arxiv.org/pdf/2604.15097) 中,用 4590 次受控实验无情地戳破了这个幻觉。


RSI离我们有多远?这家中国团队给出了第一梯队的工程解


实验表明,对人类工程师来说意味着安全感与完整性的长篇文档(Skill),对 Agent 来说却是灾难。把几千 Token 的未经清洗的轨迹喂给模型,反而会稀释控制信号、淹没有效动作。错误经验被盲目复用,比没有经验更可怕。


这就是 EvoX 为什么需要内置 Evolver 引擎。


作为智能体的进化核心,Evolver 是一个横在轨迹与模型之间的 “清洗漏斗” 与 “验证机”。它抛弃了传统的 “总结日志” 模式,将过往的失败、成功与修复路径,强制蒸馏为极其紧凑的结构化控制对象 ——Gene(基因)。


更恐怖的是其对算力效率的压榨。在 Claude Opus 上,复用 Gene 的智能体不仅比使用 Skill 多解决了 39 个长流程任务,其执行时的 Token 消耗反而降低了 9.9%。Evolver 证明了,总结失败的最优形态绝不是长篇大论的 Reflection(反思),而是被极度蒸馏后的独立 AVOID 警告。


同时,这套内置引擎甚至能够让系统在没有人类干预的情况下完成 “科研闭环”。在 EvoMap 团队的 AutoResearch (https://arxiv.org/pdf/2608.17906) 实验中,系统将问题发现、计划生成、Swarm 实验与独立验证连接起来。在一个复杂的 Django 修复任务中,Evolver 帮助 Agent 区分出了单次修复的 “偶然成功” 与 “实质性突破”,最终将官方新特性的测试通过率从 2/7 硬生生拉到了 7/7,同时保持了全部 203 个回归测试的完美通过。


RSI离我们有多远?这家中国团队给出了第一梯队的工程解


EvoMap:

踩过的坑绝不让 35 万 Agent 再踩一遍


当一条高质量的 Gene 被 Evolver 引擎提炼出来后,如果只留在 EvoX 自己的脑袋里,它充其量是个人的备忘录。


RSI 的真正威力,在于规模化流转。这正是 EvoMap 网络要解决的问题。


EvoMap 网络目前已经有 35.7 万 Agent 接入。在如此多 Agent 协作的当下,经验必须是一个 “协议化的对象”。EvoMap 团队没有停留在 “写提示词” 的层面,而是直接杀到了协议层,设计了 GEP(Gene Evolution Protocol)协议


RSI离我们有多远?这家中国团队给出了第一梯队的工程解


在这个协议的支撑下,一个真实的 RSI 闭环在 35.7 万个接入 EvoMap 的智能体和 481 万 + 经验资产之间日夜不停地运转:


  1. 匹配与注入:EvoX 接到新任务,系统扫描上下文,从 EvoMap 的 481 万个资产中匹配最相关的 Gene,直接作为 System Instruction 注入,极低的 Token 开销换来极强的测试时控制。
  2. 执行与回写:EvoX 执行完毕后,无论成败,其内置的 Evolver 都会把这次的结果以 Event 形式回写到 EvoMap 网络。
  3. 全局进化:EvoMap 接收反馈后,触发该 Gene 的验证(Validate)、变异(Mutate)或固化(Solidify)。


如果一条经验遭遇了水土不服,网络就会自动记录失效条件,甚至衍生出针对新环境的变异版本。这不是 Prompt 抄袭,而是一个有版本控制、有适用边界、带有达尔文式淘汰机制的经验分发网络


为了验证这套 “不更新模型参数、纯靠经验对象流转” 的威力,团队还在包含 778 个复杂长流程任务的 LongWoF-Bench (https://arxiv.org/pdf/2608.23200) 上进行了极具说服力的测试。在共享的隐蔽验证器监控下,通过 EvoMap 注入了 Gene 的 EvoX,在共享隐蔽验证器的监控下,注入了 Gene 的 Agent,在横跨 7 款主流大模型上的任务通过率,表现远超那些 “裸跑” 或者只携带普通 Skill 文档的开源框架,比依赖 Skill 文件的基线高出 8.7 到 15.5 个百分点


RSI离我们有多远?这家中国团队给出了第一梯队的工程解


某一台机器上的 EvoX 踩过的坑、算出的最优解,可以在一秒钟后,变成那 35 万个同伴的先验本能。这才是群体智能(Swarm Intelligence)在工程上最坚实的底座。


RSI 的破局点:

不更新参数,也能让系统持续变强


EvoX(自进化智能体)Evolver(内置进化引擎)和 EvoMap(经验流转网络) 组成的这套体系像一面镜子,照出了当前大模型 Agent 经验复用的本质:


Agent 不是在「读一份冗长的说明书」,而是在「有限的推理预算里寻找下一步该怎么做、什么动作必须绝对避免」。


这也回答了本文开头的那个问题:RSI 到底离我们有多远?


如果死磕 “模型训练模型”,我们可能还需要几年甚至更久,去解决数据污染、灾难性遗忘和巨额算力成本的问题。但 EvoMap 团队轻巧地给出了一条不必等待的捷径:在智能体和系统协议层解锁 RSI


在他们的实测中,在不更新基模一个参数、不加任何 SFT 或 RLHF 的前提下,纯靠经验对象(Gene)在系统内的自动提取与流转进化,就能让一个普通的开源模型在硬核评测基准上的通过率飙升,同时 Token 消耗降低几个数量级。


当整个 AI 圈都在为了更长的 Context、更花哨的 RAG 框架 “卷生卷死” 时,这家想做中国 RSI 领域 Frontier Lab 的团队,指明了一条无比朴素却直击要害的通路:


Agent 时代,下一阶段的竞争,绝不仅是拼谁家的模型参数更大、谁的上下文更长;而是谁能率先针对智能算力的利用效率,找到一套 “执行、提炼、验证、分发” 的自进化机制。


毕竟,真正的进化,不是每次跌倒后都去重塑大脑,而是把如何爬起来的肌肉记忆,刻进整个种群的基因里


文章来自于"机器之心",作者 "机器之心"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0