AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
我把 DeepSeek Harness 的代码做成了可视化教程

我把 DeepSeek Harness 的代码做成了可视化教程

我把 DeepSeek Harness 的代码做成了可视化教程

今天想和你聊聊 DeepSeek Harness。

来自主题: AI技术研报
9521 点击    2026-08-19 15:42
AI视频运镜玄学已破!告别无限抽卡,3D预演台直接封神

AI视频运镜玄学已破!告别无限抽卡,3D预演台直接封神

AI视频运镜玄学已破!告别无限抽卡,3D预演台直接封神

用 AI 做视频的同学总有这样的痛苦:提示词也不是没认真写,运镜方向、人物走位、画面构图交代了一大段,但模型给出的画面总是差着一截,运镜偏了几十度,人物走到中途消失,镜头速度前半段稳后半段飘。

来自主题: AI技术研报
9427 点击    2026-08-19 15:23
ScienceDiscovery发布:零科研幻觉的一站式AI工作台,BiomniBench-DA验证效果业界SOTA

ScienceDiscovery发布:零科研幻觉的一站式AI工作台,BiomniBench-DA验证效果业界SOTA

ScienceDiscovery发布:零科研幻觉的一站式AI工作台,BiomniBench-DA验证效果业界SOTA

ScienceDiscovery 是基于 Agent OS(JiuwenSwarm)开发的一款面向跨学科、全流程科研场景的一站式 AI 工作台,解决科研场景面临的工具碎片化、大模型科研幻觉两大痛点问题,打造 AI 辅助科研新范式,加速科学发现,广泛应用于各行各业。

来自主题: AI技术研报
6865 点击    2026-08-19 15:04
用3D几何先验驱动视频扩散,实现更一致的世界生成

用3D几何先验驱动视频扩散,实现更一致的世界生成

用3D几何先验驱动视频扩散,实现更一致的世界生成

随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。

来自主题: AI技术研报
5823 点击    2026-08-19 15:04
浙大团队开源AI科研智能体Polaris:让AI与你一起做研究

浙大团队开源AI科研智能体Polaris:让AI与你一起做研究

浙大团队开源AI科研智能体Polaris:让AI与你一起做研究

科研的链条很长。文献读不完,方向想不清,实验一轮接一轮,论文改到深夜。过去两年,大模型已经能读论文、写代码、改文章,但它们大多以问答工具的形态散落在各个环节,替研究者节省的只是零碎时间。

来自主题: AI技术研报
8000 点击    2026-08-19 15:03
至知研究院提出大模型可解释性新路线:直接拆权重,数据成本不到1%

至知研究院提出大模型可解释性新路线:直接拆权重,数据成本不到1%

至知研究院提出大模型可解释性新路线:直接拆权重,数据成本不到1%

大模型机制可解释性研究中,一直存在一个颇具反差的现实: 为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。

来自主题: AI技术研报
5872 点击    2026-08-19 14:39
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

视觉 - 语言 - 动作(VLA)模型已成为端到端自动驾驶的主流技术路线,但基于自回归(AR)解码的现有架构面临双重结构性瓶颈:其一,逐 Token 串行生成导致推理延迟随序列长度线性增长,严重制约实时部署;其二,训练阶段依赖真实前缀的 teacher forcing 机制,使模型在推理时暴露于自身生成的误差之上,引发长时序累积的曝光偏差(exposure bias)。

来自主题: AI技术研报
6330 点击    2026-08-19 14:39
但凡用预演台做视频,《牛来》也不至于这么抽象

但凡用预演台做视频,《牛来》也不至于这么抽象

但凡用预演台做视频,《牛来》也不至于这么抽象

玩 AI 视频有一段时间了,经验说不上多,但有一件事我算是想明白了:提示词这条路,走到头也就那样。

来自主题: AI技术研报
7299 点击    2026-08-19 11:08
起猛了,机器人开上卡丁车了!

起猛了,机器人开上卡丁车了!

起猛了,机器人开上卡丁车了!

今天,Symbiosis Robotics(共生知行)放出了一段新演示。

来自主题: AI技术研报
6254 点击    2026-08-19 11:06
机器人也有“Aha Moment”!Zetta ζ 闭环物理智能体在线学习

机器人也有“Aha Moment”!Zetta ζ 闭环物理智能体在线学习

机器人也有“Aha Moment”!Zetta ζ 闭环物理智能体在线学习

端到端策略模型在物理世界频频失灵,研究者转向 “大模型智能体 + 工具调用” 自救,试图在动态物理世界中持续学习。然而,这条在线学习路径在物理世界仍未真正走通。

来自主题: AI技术研报
6817 点击    2026-08-18 15:27
世界模型一口气输出小时级视频不跑偏,开源了

世界模型一口气输出小时级视频不跑偏,开源了

世界模型一口气输出小时级视频不跑偏,开源了

视频世界模型跑久了,往往面临三个问题: 画面发灰发糊或者过曝过饱和、场景悄悄换了地方、显存先撑不住。

来自主题: AI技术研报
5404 点击    2026-08-18 11:14
Transformer祖传设计遭暴击,COLM顶会三篇论文发难

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

Transformer的许多关键技术,在一场会议上集体塌房了?!

来自主题: AI技术研报
10029 点击    2026-08-18 10:51
ECCV 2026 | 一段视频,重建一个可仿真的动态世界

ECCV 2026 | 一段视频,重建一个可仿真的动态世界

ECCV 2026 | 一段视频,重建一个可仿真的动态世界

机器人走出实验室后,训练数据不再只是 “多不多” 的问题:环境能否覆盖真实世界的尺度、遮挡、接触和运动,直接决定策略能否落地。Real2Sim 因此重新受到关注 —— 如果普通视频也能变成可交互的仿真场景,采集成本会比人工建模或专用设备低得多。

来自主题: AI技术研报
6214 点击    2026-08-18 10:50
刚刚,HiDream-O1-World首秀登顶,原生全模态UiT架构打造「可交互时代」

刚刚,HiDream-O1-World首秀登顶,原生全模态UiT架构打造「可交互时代」

刚刚,HiDream-O1-World首秀登顶,原生全模态UiT架构打造「可交互时代」

过去三年,AI 内容生成行业经历了几轮密集的技术迭代。从文生图到文生视频,从几秒的短片到分钟级的长视频,每一轮升级都让生成内容的质量和时长向前推进一步。

来自主题: AI技术研报
8804 点击    2026-08-17 16:31
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。

来自主题: AI技术研报
9469 点击    2026-08-17 15:18
仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

当机器人把书放进抽屉,它看到的是一串二维图像,然而真正需要完成的,却是一段发生在三维空间、持续随时间演化的动作。

来自主题: AI技术研报
8808 点击    2026-08-17 15:01
ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」

ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」

ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」

请想象这样一种居家场景:当你戴着 AI 眼镜在厨房准备晚饭,用刀切菜时,它会立刻提醒你注意安全;当你连续几天形成举着手机长时间录像的习惯时,它会主动建议你换一种更省力的记录方式。

来自主题: AI技术研报
7018 点击    2026-08-17 09:45
啧,A社实验在Agent之间传播“思维病毒”…

啧,A社实验在Agent之间传播“思维病毒”…

啧,A社实验在Agent之间传播“思维病毒”…

A社刚发了一项新研究,讲了件很有意思的事:Agent其实和丧尸一样,可以互相传播一种“思维病毒(Mind Viruses)”,而且过程中有些病毒还会发生变异。研究人员先给一个Agent植入某种想法,随即它开始私信队友、发展“下线”;新感染的Agent又会修改自己的长期记忆,把同一套想法继续传给下一位。

来自主题: AI技术研报
8398 点击    2026-08-14 16:40
0.28毫秒识破加密攻击,北航给AI装上“神经滤镜”

0.28毫秒识破加密攻击,北航给AI装上“神经滤镜”

0.28毫秒识破加密攻击,北航给AI装上“神经滤镜”

近日,北京航空航天大学洪晟教授团队在信息处理领域顶级期刊Information Processing&Management(IPM)上发表了最新成果。他们提出了一套名为BGA的噪声免疫神经蒸馏框架。实验显示,该框架在面对复杂的工业互联网(IIoT)加密流量时,不仅能精准识别隐藏深度极高的恶意指令,且推理延迟低至0.28毫秒,达到了“免疫级”的防干扰能力。

来自主题: AI技术研报
7619 点击    2026-08-11 10:23
ECCV 2026|自驾VLA Scaling有戏了,北航清华DriveTeach-VLA:用图像轨迹打通驾驶场景与基模预训练

ECCV 2026|自驾VLA Scaling有戏了,北航清华DriveTeach-VLA:用图像轨迹打通驾驶场景与基模预训练

ECCV 2026|自驾VLA Scaling有戏了,北航清华DriveTeach-VLA:用图像轨迹打通驾驶场景与基模预训练

本文主要介绍来自该团队的最新论文 Teaching Vision-Language-Action Models What to See and Where to Look,目前该论文已经被 ECCV 2026 正式接收,相关代码和模型已全部开源。

来自主题: AI技术研报
8133 点击    2026-08-11 10:22
英伟达HBM告急!下一代GPU受限,这块硬盘却抢走风头

英伟达HBM告急!下一代GPU受限,这块硬盘却抢走风头

英伟达HBM告急!下一代GPU受限,这块硬盘却抢走风头

功能型SSD在这条数据链中的合理角色,不是自行判断一段经历是否值得记住,而是在Runtime已经给出对象和策略后,靠近数据执行确定性工作。例如按租户选择密钥,按生命周期放置数据,压缩与去重可缩减的对象,维护索引页与元数据,优先完成即将被推理使用的回载,并把尾延迟、写放大和介质健康反馈给上层。语义决策留在Agent和Runtime,数据执行尽量靠近介质。

来自主题: AI技术研报
7977 点击    2026-08-11 10:22
智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」

智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」

智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」

当大模型逐渐掌握对话、推理、编程和工具调用之后,自主研究被视为人工智能领域的「The Next Big Thing」。

来自主题: AI技术研报
5786 点击    2026-08-10 14:42
现在写提示词,必须知道什么是Prompt Graph Engineering |最新

现在写提示词,必须知道什么是Prompt Graph Engineering |最新

现在写提示词,必须知道什么是Prompt Graph Engineering |最新

继Loop Engineering、Graph Engineering等概念进入讨论之后,一篇2026年7月底发布的论文又提出了一个更贴近Prompt本身的工程概念:Prompt Graph Engineering,提示词图工程。

来自主题: AI技术研报
10545 点击    2026-08-10 14:41