AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4

LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4

LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4

过去一段时间,很多人对大模型都有一个明显感受:token 总是不够用。

来自主题: AI技术研报
6851 点击    2026-05-19 15:32
伯克利神作背刺OpenAI:持续学习才是真神!

伯克利神作背刺OpenAI:持续学习才是真神!

伯克利神作背刺OpenAI:持续学习才是真神!

伯克利等发布FST框架:通过快慢分层解决大模型持续学习死局。

来自主题: AI技术研报
7858 点击    2026-05-19 15:31
你的AI Agent越用越蠢?港中大、浙大戳破「记忆」的谎言

你的AI Agent越用越蠢?港中大、浙大戳破「记忆」的谎言

你的AI Agent越用越蠢?港中大、浙大戳破「记忆」的谎言

你是否在使用Agent工作或者写代码时,总感觉上下文不够用?或者感觉反复使用Agent时并没有变得更聪明?感觉目前的记忆方案仍然不够用?今日,香港中文大学联合浙江大学发布的一篇论文关注了这个问题,并引起了学术界广泛讨论:你以为Agent在「记忆」,其实只是在记备忘录。

来自主题: AI技术研报
8278 点击    2026-05-19 15:00
Agent Harness Engineering:Agent的底盘工程综述|CMU、耶鲁、Amazon

Agent Harness Engineering:Agent的底盘工程综述|CMU、耶鲁、Amazon

Agent Harness Engineering:Agent的底盘工程综述|CMU、耶鲁、Amazon

经常切换使用CC、Codex、OpenClaw这类Agent的人会发现:同一个模型,放进不同系统里,表现可能完全不同。

来自主题: AI技术研报
6002 点击    2026-05-19 14:58
ICML 2026 | 突破3DGS光度多义性瓶颈:北航/新国立提出AmbiSuR,重塑高保真3D几何重建

ICML 2026 | 突破3DGS光度多义性瓶颈:北航/新国立提出AmbiSuR,重塑高保真3D几何重建

ICML 2026 | 突破3DGS光度多义性瓶颈:北航/新国立提出AmbiSuR,重塑高保真3D几何重建

近年来,3D 高斯泼溅(3D Gaussian Splatting, 3DGS)凭借其卓越的新视角合成能力和实时的渲染效率,极大地推动了神经渲染技术的发展。然而,当研究者试图直接从 3DGS 中提取精确的 3D 几何表面(Mesh 等)时,往往会面临严重的几何失真问题。

来自主题: AI技术研报
6911 点击    2026-05-19 14:57
谷歌搜不到的80%互联网,AnySearch全打通了!开发者连夜接入

谷歌搜不到的80%互联网,AnySearch全打通了!开发者连夜接入

谷歌搜不到的80%互联网,AnySearch全打通了!开发者连夜接入

传统API集成已死!在这个Agent满地跑的时代,被低估的搜索终于迎来了第四次范式转移。AnySearch的问世,让Agent告别了单一的网页总结功能,转而通过获取可信的结构化信息,真正具备触达并连接现实世界的能力。

来自主题: AI技术研报
5310 点击    2026-05-19 10:59
字节会师何恺明!开源连续扩散语言模型Cola DLM

字节会师何恺明!开源连续扩散语言模型Cola DLM

字节会师何恺明!开源连续扩散语言模型Cola DLM

大语言模型真的只能走“预测下一个token”的路子吗?

来自主题: AI技术研报
9830 点击    2026-05-19 10:31
红杉 xbench:AI 去药企做实习,遥遥领先了人类

红杉 xbench:AI 去药企做实习,遥遥领先了人类

红杉 xbench:AI 去药企做实习,遥遥领先了人类

xbench,就是红杉自己弄的那个中立评测lab,刚刚又整了个新活:让 AI 做药企的数据分析,跟人类实习生比个高低,然后遥遥领先的赢了

来自主题: AI技术研报
5945 点击    2026-05-19 10:30
ICML 2026|告别「单线程」思维,智能体进化出了原生的并行推理大脑

ICML 2026|告别「单线程」思维,智能体进化出了原生的并行推理大脑

ICML 2026|告别「单线程」思维,智能体进化出了原生的并行推理大脑

近年来,大语言模型在「写得长、写得顺」这件事上进步飞快。但当任务升级到真正复杂的推理场景 —— 需要兵分多路探索、需要自我反思与相互印证、需要在多条线索之间做汇总与取舍时,传统的链式思维(Chain-of-Thought)往往就开始「吃力」:容易被早期判断带偏、发散不足、自我纠错弱,而且顺序生成的效率天然受限。

来自主题: AI技术研报
8916 点击    2026-05-19 10:01
ICML 2026 | 只用少量Thinking Tokens,大模型依然能深度思考

ICML 2026 | 只用少量Thinking Tokens,大模型依然能深度思考

ICML 2026 | 只用少量Thinking Tokens,大模型依然能深度思考

近年来,Chain-of-Thought(CoT)推理已经成为提升大语言模型和多模态大语言模型复杂问题求解能力的重要技术路径。

来自主题: AI技术研报
6520 点击    2026-05-19 10:01
花了1000倍的token,效果可能却没有更好:AI Agent的“隐性账单”长什么样

花了1000倍的token,效果可能却没有更好:AI Agent的“隐性账单”长什么样

花了1000倍的token,效果可能却没有更好:AI Agent的“隐性账单”长什么样

如今的 AI Agent 正在大规模落地,其中应用最广且最受关注的当数 Claude Code,Codex,Cursor 这类 coding agent。过去的一年里,这类 coding agent 产品迭代迅速,在一年内将在 swe-bench- verified 的准确率提高到了 78%+。

来自主题: AI技术研报
6480 点击    2026-05-19 10:00
24小时从零写一个GBA模拟器!GPT-5.5跑出53分登顶,Gemini得了0.8分,底部还有两家交白卷

24小时从零写一个GBA模拟器!GPT-5.5跑出53分登顶,Gemini得了0.8分,底部还有两家交白卷

24小时从零写一个GBA模拟器!GPT-5.5跑出53分登顶,Gemini得了0.8分,底部还有两家交白卷

Mechanize 发布了一项硬核测试:给前沿 AI coding agents 24 小时,用 Rust 从零写一个完整的 Game Boy Advance 模拟器,再和顶级开源模拟器 Mesen2 逐帧对比打分。

来自主题: AI技术研报
7649 点击    2026-05-18 16:48
「世界模型」究竟是什么?一文看懂其前世今生与百亿赌局

「世界模型」究竟是什么?一文看懂其前世今生与百亿赌局

「世界模型」究竟是什么?一文看懂其前世今生与百亿赌局

世界模型(World Model),想必你已经在很多场合听过这个术语了。它有时出现在视频生成领域,有时又出现在具身智能领域;它们的含义还有所差别,甚至看起来像是完全不同的概念。

来自主题: AI技术研报
6136 点击    2026-05-18 16:48
CVPR 2026 Oral | 清华+阿里发布ViT³:解锁「视觉TTT」新架构,突破Transformer复杂度瓶颈

CVPR 2026 Oral | 清华+阿里发布ViT³:解锁「视觉TTT」新架构,突破Transformer复杂度瓶颈

CVPR 2026 Oral | 清华+阿里发布ViT³:解锁「视觉TTT」新架构,突破Transformer复杂度瓶颈

序列建模是大语言模型、计算机视觉等领域的基础共性问题。当前通用的 Transformer 模型计算复杂度随序列长度平方增长,在长序列任务中面临显著的计算挑战。因此,研究者们一直在探索具有线性计算复杂度的高效序列建模方法。

来自主题: AI技术研报
5484 点击    2026-05-18 15:30
LLM助力突破尘封60年数学猜想!北大王立威团队大幅刷新斯坦纳比下界

LLM助力突破尘封60年数学猜想!北大王立威团队大幅刷新斯坦纳比下界

LLM助力突破尘封60年数学猜想!北大王立威团队大幅刷新斯坦纳比下界

近期,LLM 已经在 IMO 上取得了很好的成绩,在一些研究级数学上(如短程证明、组合构造)也有所进展。但如果真正让 LLM 去处理提出数十年的数学猜想,结果会是如何?

来自主题: AI技术研报
5159 点击    2026-05-18 15:29
信通院&清华提出FedRE:用「纠缠」搞定联邦学习三难困境 | CVPR 26

信通院&清华提出FedRE:用「纠缠」搞定联邦学习三难困境 | CVPR 26

信通院&清华提出FedRE:用「纠缠」搞定联邦学习三难困境 | CVPR 26

在联邦学习中,如何同时兼顾模型性能、数据隐私和通信开销,是一个亟需解决的挑战。

来自主题: AI技术研报
9793 点击    2026-05-18 15:29
ICML 2026 | 华为GTS提出AI训练数据新方法,Amazon/Google作者团队「光速跟进」:难度自适应训练正在成为新范式

ICML 2026 | 华为GTS提出AI训练数据新方法,Amazon/Google作者团队「光速跟进」:难度自适应训练正在成为新范式

ICML 2026 | 华为GTS提出AI训练数据新方法,Amazon/Google作者团队「光速跟进」:难度自适应训练正在成为新范式

在大模型后训练中,数据不再只是 “越多越好”,而是要像人类学习一样,动态选择最合适难度的样本。华为提出的 EDCO 方法,将样本难度估计与动态课程编排引入领域大模型微调;数月后,由 Rutgers、Amazon、Google 等作者参与的 DARE 论文即引用 EDCO,并将其作为难度感知强化学习训练的重要对比基线。

来自主题: AI技术研报
5224 点击    2026-05-18 15:29
DAG革新时间序列预测,代码、数据、排行榜全开源 | ICML'26

DAG革新时间序列预测,代码、数据、排行榜全开源 | ICML'26

DAG革新时间序列预测,代码、数据、排行榜全开源 | ICML'26

DAG框架利用时间与通道双重相关网络,有效整合历史与未来外生变量信息,提升时间序列预测准确性。通过发现并注入相关关系,充分利用未来协变量,显著优于现有方法。

来自主题: AI技术研报
6667 点击    2026-05-18 15:28
ICML 2026 |让大模型边想边说:这篇文章把「何时开口」变成可学习策略

ICML 2026 |让大模型边想边说:这篇文章把「何时开口」变成可学习策略

ICML 2026 |让大模型边想边说:这篇文章把「何时开口」变成可学习策略

用过推理型大模型的人,大概率都熟悉这种体验:模型似乎在认真思考,但屏幕上长时间没有真正有用的内容;如果让它一开始就输出,又很容易出现仓促判断,后面的推理还要被早期错误牵着走。

来自主题: AI技术研报
9452 点击    2026-05-18 15:27
「具身大一统」不是口号:北京人形再度登顶WorldArena,拿下双冠王

「具身大一统」不是口号:北京人形再度登顶WorldArena,拿下双冠王

「具身大一统」不是口号:北京人形再度登顶WorldArena,拿下双冠王

最近,全球的网民都化身「监工」,围观了 Figure AI 的人形机器人直播在物流传送带上连续几十个小时,不间断地分拣包裹。

来自主题: AI技术研报
8154 点击    2026-05-18 10:24
Agent Skills的表示、获取、检索和进化看这一篇综述就清楚了|香港中文大学最新

Agent Skills的表示、获取、检索和进化看这一篇综述就清楚了|香港中文大学最新

Agent Skills的表示、获取、检索和进化看这一篇综述就清楚了|香港中文大学最新

早在2024年,人们还倾向于给Agent提供海量的工具(例如通过MCP协议连接的API、搜索引擎、代码解释器等)。但是,“拥有工具”并不等于“知道如何使用工具”。当任务变得复杂且长周期时,要求Agent每次都从头开始推理“该用哪个工具、何时用、怎么组合、出错怎么办”,会导致系统极度脆弱、延迟极高且不可靠。

来自主题: AI技术研报
6180 点击    2026-05-18 09:55