迈向长程智能体,人大高瓴发布149页全景综述

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
迈向长程智能体,人大高瓴发布149页全景综述
8129点击    2026-07-26 11:28

过去几年,大模型已经从单轮聊天机器人,快速演变为软件工程、深度检索、计算机操作、多模态交互与科学发现中的决策核心。新的问题随之出现:一个智能体即使单步表现足够聪明,能否在数百、数千次相互依赖的行动中始终记得目标、修正错误、管理上下文,并可靠安全地把任务做完?


这正是长程智能体(Long-Horizon Agents)研究要回答的问题。在智能体能力快速演进的今天,长程能力正日益成为其进入真实生产环境的核心瓶颈。依据 METR 的测量:在约 50% 成功率下,前沿智能体完成软件工程类任务的 “人类专家等效时长” 已从早期模型的秒级提升到十余小时。如图 1 所示,该时间跨度大约每 7 个月翻一倍;从 2023 年后,翻倍周期进一步缩短至约 4 个月,这说明智能体的长程能力仍处在高速扩展阶段。


迈向长程智能体,人大高瓴发布149页全景综述


图 1 前沿智能体可完成任务的时间跨度持续增长


在本文中,我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。为理理清这一局面,这篇 149 页综述系统梳理超过 900 项研究、系统与工程实践,首次以「外部脚手架工程 × 内部模型优化」的协同演化视角,给出长程智能体的统一定义、完整分类与未来路线图。


迈向长程智能体,人大高瓴发布149页全景综述


  • 论文标题:Towards Long-Horizon Agents: A Survey


  • 项目主页:https://long-horizon-agents.github.io/


  • 论文链接:https://openreview.net/forum?id=HyhfhlbWGh


  • 项目仓库:https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents


目前该综述刚发布就在小红书、GitHub、X 等社交平台上收获极高的关注度与反响!


迈向长程智能体,人大高瓴发布149页全景综述


为什么长程任务难:


单步错误的积累会导致整条轨迹失控


长程任务的难点并不只是某一步是否答对,而是大量紧密耦合的步骤必须组成一条连贯轨迹。单步看似微小的偏差,在长链条中会被反复继承和放大。论文将典型失败归纳为三类:


  • 目标漂移与误差累积:执行数千步后,Agent 逐渐偏离最初目标;局部错误不断叠加最终把整条轨迹带向错误方向。
  • 上下文腐化与窗口压力:上下文并非越长越好。随着历史推理轨迹和工具输出的不断堆积,模型可能会出现性能骤降,也可能因感知到窗口将满而过早结束任务。
  • 稀疏、延迟奖励与不可逆行动:很多任务只在最后给出奖励信号,这使得中间决策难以获得准确归因;而任务执行过程越长,出现误删数据、错误授权或错误操作等不可逆操作的风险越高。


这意味着,单纯扩大参数量或上下文窗口并不能解决全部问题。一个模型即使拥有更强推理能力,如果缺少计划维护、状态持久化、工具治理、验证和恢复机制,仍可能在长轨迹中迅速失控。


核心论点:


智能体外部和内部协同进化


基于上述挑战,本综述提出的核心论点:“长程智能体能力” 是系统级能力,它源于外部 “脚手架工程(Harness Engineering)” 与内部 “模型优化(Model Optimization)” 的协同演进。


理解长程智能体的关键是把视线从模型单体移向由模型与 Harness 共同构成的完整系统。模型提供推理和行动的策略;而 Harness 则负责进一步支持模型决策的执行,包括组织上下文、维护状态、调度工具、编排流程,并对关键步骤进行验证与恢复。二者共同决定智能体能否沿着一条漫长而相互依赖的轨迹稳定前进。因此,长程能力应被视为整个 Model-Harness 系统的属性,而不是基础模型的一项孤立指标。


论文进一步提出一条双向演化路径:如图 2 所示,Harness Engineering 先把计划、记忆、工具和验证等能力外置,用工程手段迅速拓展模型的能力边界;系统在真实交互中积累的轨迹与反馈,再通过 Model Optimization,用数据 / 环境构造、微调、强化学习、蒸馏和自进化等策略逐步沉淀到模型内部。模型变强后,又能驾驭更复杂的 Harness。外部能力扩展与内部能力吸收由此形成持续循环。


迈向长程智能体,人大高瓴发布149页全景综述


图 2 长程智能体研究全景:外部脚手架工程与内部模型优化共同进化


三层长程阶梯:从长窗口推理,


到跨会话记忆,再到跨任务泛化


本论文不以 “运行时长” 作为长程任务的唯一标准,而是考察任务是否包含大量相互依赖的逻辑决策,以及这些依赖需要跨越多大的执行边界。如图 3 琐事,本文提出 H1 - H3 三层任务与 C1 - C3 三层能力的阶梯框架:


任务层级:


  • H1|窗口内任务:上下文窗口内完成,但不是一次回答就结束;须在持续交互中,把相互依赖的决定组成连贯轨迹。
  • H2|跨窗口 / 跨会话任务:远超单窗口或单会话(常持续数小时至数天);须压缩上下文,并在中断或交接后恢复进度。
  • H3|跨任务流:任务持续到来,总目标跨越多个子任务与环境;要求持久运行,而非封闭的一次性回合。


能力层级:


  • C1|交互式推理(对 H1):规划 — 行动 — 观察 — 修正,维持连贯路径。
  • C2|状态与记忆(对 H2):在 C1 之上,读写记忆、建检查点、可靠恢复。
  • C3|经验积累(对 H3):在 C1/C2 之上,沉淀可复用技能,从经验中泛化并持续改进。


可以看出,三个能力层级并不是彼此割裂的:C2 以 C1 为前提,C3 又建立在 C1 与 C2 之上。一个能够长期成长的 H3 智能体,仍必须在每个具体任务中维持稳定推理和可靠记忆。


迈向长程智能体,人大高瓴发布149页全景综述


图 3 三类长程任务及其对应能力,任务跨度越大,能力要求越高


从 Prompt 到 Harness:


智能体控制面的三次跃迁


如图 4 ,本综述将大模型系统的演进概括为三个阶段。变化的关键不是 “提示词越来越长”,而是可被工程化控制的范围不断向外扩展。


迈向长程智能体,人大高瓴发布149页全景综述


图 4 长程智能体跨越三个阶段的演进概览


阶段一:Prompt Engineering(2020 - 2023)。通过指令、思维链、任务分解和自我修正等提示策略,引导模型在单次调用中产生更可靠的推理。控制主要集中在输入文本。


阶段二:Context Engineering(2023 - 2025)。系统开始主动组织检索结果、工具返回、对话历史与压缩摘要。重点从 “如何写一个好提示” 转向 “每一步究竟让模型看到什么上下文”。


阶段三:Runtime Harness(2025 至今)。控制面扩展到智能体运行脚手架:Harness 不仅组织上下文,还管理工具、记忆、工作流、权限、验证、恢复和多智能体协作。Agent 由一次模型调用,演化为可持续运行的智能体系统。


这一演进也解释了为什么当下的 Agent 竞争越来越像系统工程竞争:同一个基础模型,在不同 Harness 中可能呈现截然不同的任务上限、成本和可靠性。


六维图谱:


把碎片化智能体研究放进统一坐标系


本综述从 Foundation、Evolution、Harness、Optimization、Application 和 Frontier 六个视角下,如图 5 所示,论文将分散在记忆、工具学习、多智能体、强化学习、上下文工程、安全治理等方向的工作放入同一张图谱。其价值不仅是 “列出更多论文”,更在于回答每项改进究竟发生在哪里:是基础策略更强,还是 Harness 更完善;是提升单窗口推理,还是解决跨会话状态;是任务成功率更高,还是成本和安全边界得到改善。


迈向长程智能体,人大高瓴发布149页全景综述


图 5 长程智能体研究的统一分类框架:从演化、Harness、模型优化和应用,延伸至开放前沿


外部 Harness:


让长程能力可控制、可验证、可恢复


如图 6 所示,本综述把 Harness 拆为六个相互连接的核心组件,覆盖从目标设定到最终交付的完整生命周期:


  • 循环与工作流包括线性执行、Plan—Execute 和分支搜索。它们负责显式分解任务、追踪子目标,并在失败时重规划或回退。
  • 上下文与记忆对工作上下文执行丢弃、压缩和选择,将长期有效的信息写入持久记忆,避免上下文无限膨胀。
  • 工具、MCP 与技能:连接外部能力,支持工具接口与协议、主动工具发现以及可复用技能库。工具越多,选择、描述和安全治理也越重要。
  • 编排:完成任务分解、角色分配、协作拓扑和通信协议管理,使多个模型或智能体能够协同,而不是互相制造噪声。
  • Hooks 与中间件:在输入、工具调用和协议边界执行规则、权限、监控与安全策略,并可根据风险动态调整。
  • 验证:从步骤级到任务结束级检查正确性、安全性和目标一致性,并用外部信号驱动修正,而非依赖模型自我认可。


值得注意的是,Harness 并不只是 “给模型套一层壳”。它承担的是长期执行中的状态机、控制器和安全边界:当模型出现短视、遗忘或误判时,Harness 必须能让系统停下来、检查、切换路径或恢复。


迈向长程智能体,人大高瓴发布149页全景综述


图 6 Agent Harness 全景:六个核心组件贯穿从目标设定、规划执行到反思恢复、验证交付的完整生命周期。


内部优化:


把外化长程能力逐步写回模型内部


如果说 Harness 解决的是 “运行时怎样把事情做完”,内部模型优化解决的则是 “如何让策略本身越来越适合长程任务”。综述沿完整训练链路梳理了七类方向:


  • 架构底座显式长上下文、压缩状态、混合架构与高吞吐机制,使长轨迹可表示、可训练、可负担地解码。
  • 任务、环境与轨迹合成:构建规模化、可验证、足够真实的交互环境,并生成包含成功与失败经验的长轨迹数据。
  • 预训练与中期训练注入推理先验、长上下文状态、多模态感知和合理数据配比。
  • 微调:通过指令选择、课程学习与蒸馏,让模型先掌握基础交互,再逐步面对更长、更难的任务。
  • 智能体强化学习:处理长轨迹中的信用分配、策略优化、采样策略与多轮交互,使稀疏终局奖励能够指导中间步骤。
  • On-Policy Distillation:从模型自己生成、且不断变化的分布中学习,缩短教师策略与部署策略之间的偏差。
  • 自进化:从离线经验整理走向在线自我改进,进一步探索智能体与环境共同演化。


这条链路强调:训练数据不能只包含最终答案,还需要真实的环境反馈、过程状态、工具结果与错误恢复轨迹;优化目标也不能只看单步准确率,而要关注整条轨迹是否高效、可恢复且满足最终约束。


迈向长程智能体,人大高瓴发布149页全景综述


图 7 长程智能体能力的训练管线:以架构底座为基础,通过数据与环境合成、预训练、微调、强化学习、在线策略蒸馏和自进化,将运行时能力逐步内化进模型


长程智能体的形态:


以接口为线索的五类应用


如图 8 所示,论文按 Agent 与环境交互的接口,将实践形态归纳为五类。看似不同的应用,背后都承受目标漂移、状态持久化、反馈利用和验证恢复等共同压力:


  • 软件工程:理解大型代码仓库,维护跨文件计划,根据测试与评审反馈反复修复。
  • 信息检索:执行深度或广度搜索,整合多源证据,在长链检索保持结论可追溯。
  • 计算机操作:在浏览器、桌面和移动端持续感知界面状态,完成真实操作。
  • 多模态智能体:在图像、视频、音频等高成本信息中主动选择观察对象,并完成跨模态理解与生成。
  • 通用智能体:面向个人助理、具身系统和生产力任务,在多工具、多环境和长期目标之间切换。


相应地,评测也必须从一次性问答升级为 “面向时间跨度的评测”:任务是否真正包含长依赖?中间步骤能否检查?失败后是否恢复?系统在不同预算和 Harness 下的能力是否可归因?这些问题将直接决定榜单结果能否反映真实部署价值。


迈向长程智能体,人大高瓴发布149页全景综述


图 8 长程智能体的五类代表性应用形态


未来展望:


长程智能体的四个前沿方向


论文最终将开放问题归纳为四个轴、九个具体方向。随着任务跨度继续增长,研究重点将从 “能不能跑起来” 转向 “能否长期有效、经济并且可信地运行”。


  • Evolution泛化与持续学习。让 Harness 自身能够演化、迁移和复用,并支持持续学习与终身学习。关键问题是:外置流程如何自动优化,又如何把经验稳定地内化为长期能力。
  • Effectiveness进入真实环境。构建既可验证又足够真实的训练环境,提高昂贵真实交互的样本效率,并推动数字 Agent 向具身智能体迁移。论文认为,下一阶段的限速因素可能不再只是模型规模,而是环境构建。
  • Efficiency学会花预算。未来 Agent 需要感知任务难度、剩余 token、时间和金钱预算,动态决定何时深思、何时压缩上下文、何时切换模型。多模态场景还要决定保留哪些帧、音频或视觉证据。
  • Trustworthiness:可恢复且可治理的自治。长轨迹会放大错误与权限风险,因此需要更早识别失败路径,以外部验证锚定反思,并通过最小权限、审批门、沙箱、来源追踪和独立审计保护安全不变量。


其中,一个重要判断是:生产环境中的安全与权限边界,主要落在 Harness,而非模型权重中。模型侧对齐必要但不充分;真正决定哪些工具可调用、哪些行动需审批、哪些经验可复用的,是运行时控制层。


总结:迈向长程智能体


过去的大模型 Scaling 围着参数、数据和算力而优化;进入智能体后,时间跨度成为另一条轴线:衡量的不是系统能跑多久,而是能否在更长、更复杂、更真实的依赖链上持续有效行动。这篇综述的核心判断很明确:长程智能体不是 “更聪明” 的单点升级,而是 Harness 工程与模型优化共同演化 的结果。从基础、演化、Harness、优化、应用到前沿,我们把分散研究收进同一张地图,也把开放问题落在演化、有效性、效率与可信性四条轴上。在梳理既有工作之外,我们还提炼若干将定义下一阶段长程智能体研究的新兴方向。希望本文能为后续研究奠定坚实基础,并为研究者与实践者提供有用参考。随着智能体系统不断成熟,长程智能体仍将是一个核心而开放的问题,并很可能在构建稳健、通用、持久的人工智能中发挥决定性作用。


作者信息:本文由中国人民大学、北京大学、清华大学、中山大学、香港科技大学和新加坡国立大学的研究者联合完成。论文的核心贡献者为董冠霆宋晓帅扈煜阳金佳杰张宬浩,通讯作者为中国人民大学高瓴人工智能学院窦志成教授


文章来自于微信公众号 “机器之心”,作者 “机器之心”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

5
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

6
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0