AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
从炒虾到通用“大脑”,Mobile ALOHA作者带来新模型

从炒虾到通用“大脑”,Mobile ALOHA作者带来新模型

从炒虾到通用“大脑”,Mobile ALOHA作者带来新模型

近期,由斯坦福大学计算机科学博士符梓鹏(Zipeng Fu)联合创立的新团队Reward AI,正式发布通用机器人策略OM-1(Omnibody Model 1),并公布了完整的Omnibody技术栈。

来自主题: AI技术研报
6304 点击    2026-09-16 15:34
Minimax H3 之后,又来了一位狠角色:智象 HD-V1 发布,视频模型开始理解现实世界!

Minimax H3 之后,又来了一位狠角色:智象 HD-V1 发布,视频模型开始理解现实世界!

Minimax H3 之后,又来了一位狠角色:智象 HD-V1 发布,视频模型开始理解现实世界!

最近几个月,AI 视频赛道开始热起来了: Seedance2.0 发布后,AI 视频进入可用阶段,MiniMax H3 发布后,以 1/4 的价格,把 Seedance 2.0 的成本打了下去,AI 视频成本进入平价时代。

来自主题: AI技术研报
8980 点击    2026-09-16 15:10
逆天,Pixmax 把AI视频里的打斗动作终于攻克了

逆天,Pixmax 把AI视频里的打斗动作终于攻克了

逆天,Pixmax 把AI视频里的打斗动作终于攻克了

Seedance 2.5 让我这个半吊子的AI视频创作者都能上瘾玩上一个多月,就不用再多余说表现有多强了吧。

来自主题: AI技术研报
7235 点击    2026-09-16 14:42
换题还是第一!DM0.5横扫RoboColiseum四榜

换题还是第一!DM0.5横扫RoboColiseum四榜

换题还是第一!DM0.5横扫RoboColiseum四榜

具身智能最近又多了一张榜单,而排在第一的,还是一个熟悉的名字:原力灵机 DM0.5。

来自主题: AI技术研报
9210 点击    2026-09-16 14:41
自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动

自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动

自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动

当大模型已经能够快速生成文案、图片和视频,一个更进一步的问题是:Agent 能否从执行过的任务中积累经验,并在持续交互中改进后续行为?

来自主题: AI技术研报
9338 点击    2026-09-16 14:40
复杂的Harness Evolution,甚至不如多跑几遍

复杂的Harness Evolution,甚至不如多跑几遍

复杂的Harness Evolution,甚至不如多跑几遍

一个 Agent 第一次没把任务做对。

来自主题: AI技术研报
6224 点击    2026-09-16 14:40
复旦发布以人为中心的复杂场景音视频追踪基准 | ICML 2026

复旦发布以人为中心的复杂场景音视频追踪基准 | ICML 2026

复旦发布以人为中心的复杂场景音视频追踪基准 | ICML 2026

想象一下这个场景:一场多人线上会议,有人说话时画面自动聚焦到发言者;一段综艺素材,后期系统能自动识别谁在讲话并生成字幕;一段监控录像,系统能在人群中持续追踪正在说话的那个人。

来自主题: AI技术研报
7448 点击    2026-09-16 10:36
高德联合南大、清华、北大发布WorldRoamBench,定义交互式世界模型长时漫游评测新范式

高德联合南大、清华、北大发布WorldRoamBench,定义交互式世界模型长时漫游评测新范式

高德联合南大、清华、北大发布WorldRoamBench,定义交互式世界模型长时漫游评测新范式

随着 Genie 3 的发布,可交互世界模型真正走到台前:用户不再只是观看生成视频,而是可以输入动作实时改变一个持续演化的世界。世界模型开始从「生成一段视频」走向「模拟一个可交互世界」,但能走进去,不等于经得起探索。模型能否持续响应控制、维持视觉与空间一致、遵守物理规律并记住来路,仍缺少系统评测。

来自主题: AI技术研报
8868 点击    2026-09-16 10:35
别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透

别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透

别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透

北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。

来自主题: AI技术研报
8337 点击    2026-09-16 10:07
华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下

华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下

华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下

“智能并不局限于大脑内部。当我们使用纸笔或地图来梳理复杂问题时,这些外部工具就成为了我们‘延展的心智’。”

来自主题: AI技术研报
9623 点击    2026-09-16 10:07
清华团队再探 On-Policy Distillation:数据撑死,算法饿死

清华团队再探 On-Policy Distillation:数据撑死,算法饿死

清华团队再探 On-Policy Distillation:数据撑死,算法饿死

把 On-Policy Distillation(在线策略蒸馏,OPD)的训练集从 17000 道题删到 1 道,会发生什么?

来自主题: AI技术研报
9969 点击    2026-09-16 10:06
从Chat、Code到Discovery,AI开始学着做科学家

从Chat、Code到Discovery,AI开始学着做科学家

从Chat、Code到Discovery,AI开始学着做科学家

成立才一个多月,估值就要冲到 500 亿美元。

来自主题: AI技术研报
7698 点击    2026-09-15 14:32
Vidu S2:实时数字人,实时改视频

Vidu S2:实时数字人,实时改视频

Vidu S2:实时数字人,实时改视频

刚刚,生数上线了最新的 实时视频模型 S2,输出提高到 720p,保持 25—42 FPS,包含下面两款:

来自主题: AI技术研报
7064 点击    2026-09-15 14:32
Meta新研究:字节模型蒸馏后,天花板破了

Meta新研究:字节模型蒸馏后,天花板破了

Meta新研究:字节模型蒸馏后,天花板破了

Token词元替代了Byte字节,但不意味着大模型都得是Token。

来自主题: AI技术研报
5863 点击    2026-09-15 13:59
ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

真实家庭任务往往从「不完整的信息」开始:机器人不知道目标在哪里,用户也未必能一次说清自己想要什么。面对「帮我从餐桌上拿点零食」这样的模糊指令,机器人不仅要主动寻找候选物体,还要在发现面包和多个甜甜圈后进一步询问用户,确认究竟该拿哪一个。

来自主题: AI技术研报
6277 点击    2026-09-15 13:36
3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路

3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路

3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路

多轮智能体任务只有一个终点奖励,但在一条包含搜索、工具调用和多轮决策的轨迹里,决定成败的往往是一个不起眼的查询词、动作或对象选择。

来自主题: AI技术研报
8451 点击    2026-09-15 13:35
「人类造的最后一个AI」还有多远?一张图看懂OpenAI、Anthropic等大厂的RSI进度

「人类造的最后一个AI」还有多远?一张图看懂OpenAI、Anthropic等大厂的RSI进度

「人类造的最后一个AI」还有多远?一张图看懂OpenAI、Anthropic等大厂的RSI进度

「人类造的最后一个 AI」还有多远?OpenAI、Anthropic 等头部厂商进度如何?定义中国 RSI 的 roadmap——前沿 AI 研究机构 Theseus Labs 结合 72 家产业实践,推出「RSI 五级框架」

来自主题: AI技术研报
6912 点击    2026-09-15 10:35
网页藏毒,劫持Agent?你需要会「追凶」的自进化女警系统

网页藏毒,劫持Agent?你需要会「追凶」的自进化女警系统

网页藏毒,劫持Agent?你需要会「追凶」的自进化女警系统

今天的AI Agent,已经不只是聊天窗口里「会说话」的模型。它们正在接入浏览器、文件系统、终端、API、MCP服务和各种自动化工作流,开始真正替用户执行任务。

来自主题: AI技术研报
9202 点击    2026-09-15 09:44
一个月 20 刀的 Antigravity CLI,可能被很多人低估了

一个月 20 刀的 Antigravity CLI,可能被很多人低估了

一个月 20 刀的 Antigravity CLI,可能被很多人低估了

众所周知,现在的大模型基本每隔 35 天左右就会换一轮。

来自主题: AI技术研报
7060 点击    2026-09-14 15:32
AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI

AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI

AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI

让模型自己生成训练数据、自己改写提示词、自己修复代码,这条路线被称为: 递归自我改进(Recursive Self-Improvement,RSI)。

来自主题: AI技术研报
10098 点击    2026-09-14 15:30
告别「只会相似度检索」:腾讯最新T-Mem让AI学会「联想回忆」

告别「只会相似度检索」:腾讯最新T-Mem让AI学会「联想回忆」

告别「只会相似度检索」:腾讯最新T-Mem让AI学会「联想回忆」

大语言模型智能体正越来越多地进入长期陪伴聊天这类场景 —— 不再答完一个问题就走,而是和用户处成一段长久的关系。

来自主题: AI技术研报
8164 点击    2026-09-14 15:04
视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM

视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM

视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM

理解生成统一模型(Unified Multimodal Models, UMMs)正在成为多模态模型的重要发展方向。相比传统的理解模型 + 生成模型,UMM 希望在同一个模型中同时完成视觉理解和图像生成,让文本和图像能够在统一上下文中被理解、推理和生成。

来自主题: AI技术研报
6680 点击    2026-09-14 15:03
Astra写的代码,人类已经看不懂了

Astra写的代码,人类已经看不懂了

Astra写的代码,人类已经看不懂了

Astra,每天都有新新闻。昨天攻克 A,今天攻克 B,明天可能要一起解决 CDE……进步之快,让人目不暇接。而就算你目力过人,你可能也看不懂 Astra 在做啥了。

来自主题: AI技术研报
8818 点击    2026-09-14 10:22
全网震撼!菲奖得主未解难题,竟被两名高中生用AI攻破了

全网震撼!菲奖得主未解难题,竟被两名高中生用AI攻破了

全网震撼!菲奖得主未解难题,竟被两名高中生用AI攻破了

新智元报道 你敢信? 人没上大学,研究已经接上了「菲尔兹奖得主」的工作了。 就在今天,UCLA数学圈传出了一条让所有人震惊的消息—— 两名高中生Aayush Bathija和Prince Rohatg

来自主题: AI技术研报
5920 点击    2026-09-14 10:22