LSTM之父最新97页综述:Agent如何真正学会「自我进化」?
LSTM之父最新97页综述:Agent如何真正学会「自我进化」?过去两年,self-reflection、self-correction、self-play、agentic RL、skill learning、test-time adaptation、open-ended evolution、self-evolving agent等概念不断涌现。
搜索
过去两年,self-reflection、self-correction、self-play、agentic RL、skill learning、test-time adaptation、open-ended evolution、self-evolving agent等概念不断涌现。
世界模型是物理原生智能(Physics-native Intelligence,Phi)重要的组成环节。
2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境,开创了 Agent 桌面工作台这一形态;4 月,FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络,任务可以跨人、跨 Agent 交接而上下文不断;5 月,FloatSchedule 让 Agent 不必等人下指令,按日程自己开工。
由上海交大人工智能学院、深势科技、上海算法创新研究院组成的无尽前沿团队发布BigBang-V1——这是首个基于recursive self-improving原生方式训练出的基座模型。
近日,浙江大学 OmniAI 团队在 《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》 中提出 ProVisE,让图像生成模型直接在图中回答空间问题,并将视觉答案还原为原 benchmark 可以评分的结构化预测。
这个框架名叫 Prime Agent,由 Prime Intellect 发布。官方对它的定义是:一个面向编程、研究和长时间自主任务的「自我改进 RLM harness」。RLM 是 MIT 博士生 Alex Zhang 等人去年 10 月发布的一项工作(参见《递归语言模型登场!MIT华人新作爆火,扩展模型上下文便宜又简单》)
近日,由华为2012实验室、华为云、终端、计算等团队联合构建的openJiuwen开源AI Agent平台发布了企业级分布式蜂群架构,把JiuwenSwarm蜂群能力,扩展到企业级分布式集群。
近日来自南京大学模式识别实验室(PRLab)的梁嘉骏、廖宇程,在司晨阳教授的指导下,联合新加坡南洋理工大学、英国帝国理工学院,提出连续扩散语言模型 AURORA-LM(Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling),对连续空间下的语言建模作出了更多的思考和发现。
LightX2V团队面向Wan2.2-A14B推出LightWan2.2-A14B,以步数蒸馏、NVFP4量化感知训练和动态稀疏注意力压缩计算量,再用高效算子、细粒度卸载和多卡通信优化打通整条推理链路。
千诀科技联合清华大学团队,为神经网络提出了一把新的 “复杂度标尺”。
当下计算机视觉长期陷入“一任务一专用模型”内卷: 做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。
我们如何判断人工智能是否已经足够聪明,能够从事科学研究,实现端到端的自主科学发现?
你有没有想过,有一天你买东西,不再需要打开购物软件挨个搜索,而是直接对你的AI助手说一句“我想买一把适合初学者的吉他”,它就能跑遍全网,把最好的几个选项摆在你面前,还附带理由?
作为具身智能最主流的路线之一,VLA 快速发展的同时也因为其各种问题被诟病。其中最主要的痛点之一便是指令泛化能力。
2026 年被业内普遍视作 AI4S(AI for Science)的「智能体元年」。
让机器人把一只虾夹起来,再放进锅里。
Transformer 的上限在哪里?这个问题从 2022 年 ChatGPT 问世起,就开始被广泛讨论。
随着 AI 生图能力不断提升,如何让 AI 真正进入创作流程成为新的行业问题。兔展智能基于 UniWorld-Design 视觉 AI 大模型推出 RabbitVis,尝试推动视觉 AI 从图片生成走向可编辑、可交付的创作流程。
从 2D 像素到 3D 场景 Query,影溯正在尝试把三维内容生产推向可规模化调用的新阶段。
人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。
当下,一个逐渐清晰的共识是,具身智能的叙事正由「会不会做一个动作」,转向「能不能在真实世界里稳定完成复杂任务」。尤其是在刚刚过去的 WAIC2026 现场,这一点尤为明显,机器人不再满足于表演式的单动作演示,而是被期待走进产线、仓储和酒店客房,真正「做事」。
通过重写 Python、魔改 WebRTC 握手,GPT-Live 让Agent从单向对话进入「实时交互」时代。
多模态基础模型可以通过互联网规模的图像与语言学习「看」和「说」,但具身智能没有同样的捷径。机器人必须进一步理解物理状态与动力学,判断动作如何改变环境,并在真实世界中执行连续行为;这要求训练数据同时连接观察、状态、动作与物理后果。
想象一个刚上岗的实习生。教他做A任务,他学得很好;接着教他做B任务,他又学会了——但回过头再让他做A,他却忘得七七八八。
OpenAI宣称下一代AI模型解决了10个世界级难题,其中包括推翻了Connes刚性猜想。
2026年已过去七个月,中国AI创业市场出现了一个值得关注的现象:在世界模型赛道,新成立的公司数量持续攀升,截至8月初已达到23家。这个数字意味着什么?作为对比,2025年全年新成立的世界模型公司是20家,2024年只有10家。2026年用7个月就超过去年全年总量。
过去,LlamaFactory 让每个人都能微调大模型;现在,PenguinHarness 希望让每个人都能构建自进化 Agent。
视觉问答模型的准确率不断提高,但高分未必来自视觉理解 —— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。
7 月初的时候,我照着 Karpathy 那套 LLM Wiki(简单说就是让 AI 帮你把资料编译成一个能长大的百科)搭了个本地知识库。
一片龟甲或牛肩胛骨摆在案头,裂纹穿过刻辞,几个字还缺了笔画。