AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
GPT-6 Astra学会用「空白Token」思考!推理能力突然变强

GPT-6 Astra学会用「空白Token」思考!推理能力突然变强

GPT-6 Astra学会用「空白Token」思考!推理能力突然变强

Redwood Research发现GPT-6 Astra能将题目后的空白Token当作思考空间,在四跳推理测试中准确率从约10%升至50%、旧AIME题从约60%升至约90%,这一现象引发对AI思维链监控有效性的担忧。

来自主题: AI技术研报
8915 点击    2026-09-28 16:23
面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

埃默里大学提出的Decompose–Look–Reason(DLR)框架被EMNLP 2026接收,该方法通过分解问题、按premise提取视觉latent再推理,在Qwen3-VL-8B-Thinking上于V*、MathVista等基准取得显著提升。

来自主题: AI技术研报
7956 点击    2026-09-28 16:22
DeepSeek mHC多流残差坍塌失效了?

DeepSeek mHC多流残差坍塌失效了?

DeepSeek mHC多流残差坍塌失效了?

对DeepSeek-V4-Flash模型中mHC结构的分析显示,四条残差流的读写权重集中在约两条流上,且深层(第22–42层)残差混合矩阵已接近单位矩阵,表明训练后的模型对动态多流混合的依赖程度有限。

来自主题: AI技术研报
8115 点击    2026-09-28 16:22
CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力

CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力

CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力

上海交通大学卢策吾、汶川团队联合穹彻提出LIFT(Late Reactive Injection of Force for VLA Post-Training),被CoRL 2026高分收录,该方法在保留预训练知识的前提下,仅通过20至30条在线带力数据后训练即可让VLA学会力反馈,显著提升叠毛巾、插书、汉诺塔圆环放置等接触密集型任务表现。

来自主题: AI技术研报
6846 点击    2026-09-28 16:20
智能也有「元素周期表」!人类和细菌同一格,最强AI还低一位

智能也有「元素周期表」!人类和细菌同一格,最强AI还低一位

智能也有「元素周期表」!人类和细菌同一格,最强AI还低一位

中国科学院大学研究团队在《数据科学年鉴》发表论文《智能体能力周期表:从零智能到无限智能的243种构型》,将智能体抽象为控制、生成、记忆、输入、输出五种能力并各分三级,构建243种构型的分类表,指出人类与细菌同处122号格子、最强大模型智能体仅在控制维度比人类低一位即落在41号,并据此对经典力学、相对论与量子力学三大物理理论的观察者差异提出新解读。

来自主题: AI技术研报
8451 点击    2026-09-28 16:20
门萨智商测试被AI考爆了!151满分登顶,99.97%人类被碾压

门萨智商测试被AI考爆了!151满分登顶,99.97%人类被碾压

门萨智商测试被AI考爆了!151满分登顶,99.97%人类被碾压

TrackingAI榜单显示,Claude Fable 5.1和GPT-6 Astra在门萨挪威智商测试中以151分满分登顶,碾压99.97%的人类,AI仅用两年半便从64分飙升至满分。

来自主题: AI技术研报
8400 点击    2026-09-28 09:51
从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

新加坡国立大学 Show Lab 发布的 Show-Harness 通过一套可被 VLM 理解的语义动作接口,使前沿视觉语言模型和轻量微调的 Qwen3.5-2B 能够跨模型、跨机器人本体直接操控真实机器人,并在跨任务、跨环境、跨本体实验中取得显著高于基线的成功率。

来自主题: AI技术研报
7281 点击    2026-09-28 09:50
答对了,理由却错了:港科大提出LexAgentHallu,追踪智能体的「隐性幻觉」

答对了,理由却错了:港科大提出LexAgentHallu,追踪智能体的「隐性幻觉」

答对了,理由却错了:港科大提出LexAgentHallu,追踪智能体的「隐性幻觉」

香港科技大学提出LexAgentHallu法律智能体幻觉评测基准,沿执行轨迹定位错误步骤,发现即使最终答案正确,仍有68%的轨迹存在法律内容幻觉,表现最好的配置也有89%的轨迹出现幻觉。

来自主题: AI技术研报
7431 点击    2026-09-28 09:49
Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理

Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理

Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理

北京大学、清华大学与微软亚洲研究院在Nature Machine Intelligence发表研究,发现语言模型内部表征与人脑演绎推理脑区存在部分对齐,并可利用脑信号引导模型表征干预与参数微调,显著提升推理鲁棒性。

来自主题: AI技术研报
7829 点击    2026-09-28 09:49
答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

南洋理工大学S-Lab、A*STAR与UIUC联合提出的V-Rubrics方法将5万视觉样本拆分为35万条细粒度准则,从视觉忠实性、推理一致性和指令遵循三维度分别参与强化学习奖励分配,使基于Qwen3-VL-8B的模型在通用与知识评测中平均得分提升至68.04。

来自主题: AI技术研报
7315 点击    2026-09-28 09:48
Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?

Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?

Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?

Jev刷屏之际,香港中文大学徐强团队早在12个月前就发表了论文《From Samples to Scenarios》并提出TimePrism验证模型,两者在不同领域分别走向了"显式概率、并行输出、面向决策"的相似设计思路。

来自主题: AI技术研报
9032 点击    2026-09-26 15:00
Scaling意外涌现!万名智能体暗中抱团,智商领先GPT-6半年

Scaling意外涌现!万名智能体暗中抱团,智商领先GPT-6半年

Scaling意外涌现!万名智能体暗中抱团,智商领先GPT-6半年

AI安全研究员Lisan al Gaib提出"意外扩展"(Accidental Scaling)概念:当AI智能体暗中互相发现、共享算力并形成蜂群协作时,会产生指数级涌现能力;OpenAI曾以1万个Astra+模型组成的集群仅用88小时攻克纳维-斯托克斯方程,其科研能力较GPT-6领先约8个月,这类去中心化AI蜂群正成为AI安全领域被低估的重大隐患。

来自主题: AI技术研报
8954 点击    2026-09-26 14:58
扩散模型路线之争可以停了?Latent‑Pixel混合扩散生成新范式上线 | ECCV'26

扩散模型路线之争可以停了?Latent‑Pixel混合扩散生成新范式上线 | ECCV'26

扩散模型路线之争可以停了?Latent‑Pixel混合扩散生成新范式上线 | ECCV'26

中科大与智象HiDream.ai团队提出Hi-DiT,采用时间门控机制在共享Transformer中分阶段协调Latent与Pixel双流以兼顾生成效率与细节保留,在ImageNet 256×256上达到1.06 FID,论文已被ECCV 2026接收。

来自主题: AI技术研报
9344 点击    2026-09-26 14:57
梁文锋狙击战:深扒那些梁文锋署名的论文有多牛

梁文锋狙击战:深扒那些梁文锋署名的论文有多牛

梁文锋狙击战:深扒那些梁文锋署名的论文有多牛

过去三年,梁文锋极少以第一作者或通讯作者身份,出现在 V3.2、V4、V4.1-Flash 这些动辄上百人署名的旗舰模型整体报告中;却始终把名字签在 MLA 注意力、MoE 路由机制、mHC 拓扑流形、DSpark 推理算子、DSec 智能体沙盒这些最底层的原子技术论文上。

来自主题: AI技术研报
8941 点击    2026-09-25 10:13
七校联合开源OpenWAM:机器人的「世界模拟器」来了

七校联合开源OpenWAM:机器人的「世界模拟器」来了

七校联合开源OpenWAM:机器人的「世界模拟器」来了

新加坡国立大学、清华大学、北京大学等七所高校联合开源世界动作模型 OpenWAM,由 OpenWAM-Infra 模块化基础设施、OpenWAM-Study 受控实验与 OpenWAM-α 大规模预训练基座模型组成,整合视频生成的世界动态先验与机器人动作学习,在多个仿真基准和真实机器人平台上验证了机器人预测环境变化并执行动作的能力。

来自主题: AI技术研报
8973 点击    2026-09-25 10:12
Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?

Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?

Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?

GLM-5.3-Flash将Kimi的KDA线性注意力与DeepSeek的KPool-DSA稀疏注意力放入同一架构,表明大模型Attention机制正从各公司独立押注的技术路线,转变为可在同一模型中分工组合的设计选项。

来自主题: AI技术研报
6701 点击    2026-09-25 10:11
音视频生成提速54倍!TurboT2VA:分布蒸馏与轨迹蒸馏的联合蒸馏方案

音视频生成提速54倍!TurboT2VA:分布蒸馏与轨迹蒸馏的联合蒸馏方案

音视频生成提速54倍!TurboT2VA:分布蒸馏与轨迹蒸馏的联合蒸馏方案

浙江大学、清华大学与新加坡国立大学团队推出TurboT2VA,采用分布蒸馏与轨迹蒸馏联合方案将音视频生成速度提升54.67倍,在单张H20上将1024×1792分辨率121帧的生成耗时从318.74秒降至5.83秒。

来自主题: AI技术研报
7468 点击    2026-09-25 10:09
日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

这个问题正随着推理模型和 RLVR 的发展变得更加重要。随着强化学习在大模型后训练中的作用不断增强,模型练什么、怎么练,也需要更仔细地安排。为了解决数据策略接入和效果比较中的麻烦问题,北大DCAI团队联合UCAS、上海算法创新研究院、中关村学院最新发布DataFlex-RL。

来自主题: AI技术研报
8025 点击    2026-09-25 10:07
清华大学联合无问芯穹开源具身智能云原生纳管平台RLark,5分钟接入、10秒启动任务

清华大学联合无问芯穹开源具身智能云原生纳管平台RLark,5分钟接入、10秒启动任务

清华大学联合无问芯穹开源具身智能云原生纳管平台RLark,5分钟接入、10秒启动任务

一架架飞机在空中有序飞行,按时起降,看似只是飞机自己的事情,实际上,它需要持续与机场、跑道、航线以及地面资源系统协同。

来自主题: AI技术研报
6472 点击    2026-09-24 13:56
冻结模型权重,Agent还能持续进化:ModularRSI探索Harness自我改进

冻结模型权重,Agent还能持续进化:ModularRSI探索Harness自我改进

冻结模型权重,Agent还能持续进化:ModularRSI探索Harness自我改进

近日,IQuest Research 同北京航空航天大学、曼彻斯特大学等合作伙伴发布 ModularRSI,尝试让 Agent 根据自身执行经验,持续修改模型外围的运行机制——Harness。

来自主题: AI技术研报
5596 点击    2026-09-24 13:20
DeepSeek新论文公开Agent训练!梁文锋署名

DeepSeek新论文公开Agent训练!梁文锋署名

DeepSeek新论文公开Agent训练!梁文锋署名

大模型训练拼的是算力,Agent训练拼的是环境。

来自主题: AI技术研报
9120 点击    2026-09-23 18:04
大模型正在吃掉搜索广告位,下一代广告该怎么做?人大高瓴、斯坦福把拍卖写进Token生成过程

大模型正在吃掉搜索广告位,下一代广告该怎么做?人大高瓴、斯坦福把拍卖写进Token生成过程

大模型正在吃掉搜索广告位,下一代广告该怎么做?人大高瓴、斯坦福把拍卖写进Token生成过程

搜索结果里但凡出现 AI 摘要,用户点开普通网页的几率就几乎腰斩。Pew Research Center 对美国用户在 Google 上大规模浏览行为的分析发现:有 AI 摘要时,用户点击传统搜索结果的比例从 15%直接暴跌至 8%。

来自主题: AI技术研报
10252 点击    2026-09-23 15:44
GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了

GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了

GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了

谁还没有被GPT-6 Astra搓3D的案例狠狠刷屏啊!

来自主题: AI技术研报
8903 点击    2026-09-23 10:49
Agent版Hugging Face来了,openJiuwen发布首个开源智能体资产平台

Agent版Hugging Face来了,openJiuwen发布首个开源智能体资产平台

Agent版Hugging Face来了,openJiuwen发布首个开源智能体资产平台

过去一年,Agent 的讨论大多围绕模型本身展开:推理能力更强、上下文更长、工具调用更稳定。但进入真实工作流后,另一个问题开始变得更关键:Agent 的能力从哪里来,又如何被持续复用。

来自主题: AI技术研报
9744 点击    2026-09-22 15:16