AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一个Skill为什么越改越好?腾讯SkillHone让Agent记住每次优化决策

一个Skill为什么越改越好?腾讯SkillHone让Agent记住每次优化决策

一个Skill为什么越改越好?腾讯SkillHone让Agent记住每次优化决策

腾讯微信在论文 SkillHone 中,将这个问题归结为优化历史丢失,进而提出了面向持续 Skill 进化的开发框架。 SkillHone 把每轮诊断、候选修改、评估证据和最终决定组织成持久决策历史。同时,持续优化的对象也从单一的 SKILL.md 文件扩展到了整个 Skill 文件夹及其修改过程。

来自主题: AI技术研报
8053 点击    2026-07-24 15:56
多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

BigMac 是原生多模场景下的流水并行训练新范式。它针对多模态大模型训练中计算效率与显存占用难以兼顾的问题,提出了依赖安全的嵌套流水线:以成熟的 LLM 流水线为主干,在不打乱 LLM 执行顺序的前提下,有序嵌入编码器和生成器计算,从而在不增加 LLM 流水线空泡、保持激活显存有界的同时,高效实现多模态流水训练。

来自主题: AI技术研报
7796 点击    2026-07-24 15:55
把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Sca

来自主题: AI技术研报
7893 点击    2026-07-24 15:54
真实工作流,正在成为下一代训练数据

真实工作流,正在成为下一代训练数据

真实工作流,正在成为下一代训练数据

数据市场的故事,正在进入新一轮周期。来自企业真实工作流的 Real-world Data,成为越来越多 AI Labs 争夺的新资源。比如 GitHub 就是典型的 Real-world Data,它几乎完整保留了一个问题从出现到解决的全过程。相比之下,今天绝大多数 Human Data 公司提供的,仍是人为构造的数据。

来自主题: AI技术研报
8344 点击    2026-07-24 11:00
让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

当大模型 Agent 被部署到工具调用、长程任务和开放环境中,一个关键问题会随之出现:能否在不更新模型参数的情况下,将执行经验沉淀下来,并在下一次做得更好?

来自主题: AI技术研报
5545 点击    2026-07-24 10:45
Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。

来自主题: AI技术研报
6456 点击    2026-07-24 10:45
139.6倍加速、100%安全约束:影眸科技提名具身顶会RSS最佳论文

139.6倍加速、100%安全约束:影眸科技提名具身顶会RSS最佳论文

139.6倍加速、100%安全约束:影眸科技提名具身顶会RSS最佳论文

在近日的具身智能顶会 RSS(Robotics: Science and Systems)2026 上,最高奖项 Outstanding Paper Award 提名名单里,出现了一个不太 “机器人” 的名字 —— 影眸科技,一家头部 3D 生成大模型公司。

来自主题: AI技术研报
9063 点击    2026-07-23 16:01
AI幻觉最可怕的人类副作用出现了

AI幻觉最可怕的人类副作用出现了

AI幻觉最可怕的人类副作用出现了

最新研究发现,AI幻觉不只会骗你了,还能喂大你的自信心、削弱你的判断力。

来自主题: AI技术研报
6104 点击    2026-07-23 16:01
ECCV 2026|把全球3D地图变成无人机训练场,国防科大AirZoo构建航拍几何3D视觉统一基准

ECCV 2026|把全球3D地图变成无人机训练场,国防科大AirZoo构建航拍几何3D视觉统一基准

ECCV 2026|把全球3D地图变成无人机训练场,国防科大AirZoo构建航拍几何3D视觉统一基准

国防科技大学虚拟现实与视觉计算团队(SAW Lab)联合先进制导与控制技术国家级重点实验室等推出面向航拍几何 3D 视觉的统一大规模数据集与评测基准 「AirZoo」。

来自主题: AI技术研报
5890 点击    2026-07-23 15:36
分享一个Skill,帮你把电影画面拆成可复用的视觉系统。

分享一个Skill,帮你把电影画面拆成可复用的视觉系统。

分享一个Skill,帮你把电影画面拆成可复用的视觉系统。

嗨大家好!我是阿真! 刷短视频就是这点不好,上次看到一个 AI 视频拆解分析的教程,感觉很有意思,刷完了过两天忘记在哪里刷的了。

来自主题: AI技术研报
6519 点击    2026-07-23 15:23
视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。

来自主题: AI技术研报
9456 点击    2026-07-23 10:39
纠偏率98.15%!方向感觉醒,第一视角认路的国产AI开挂了

纠偏率98.15%!方向感觉醒,第一视角认路的国产AI开挂了

纠偏率98.15%!方向感觉醒,第一视角认路的国产AI开挂了

商业地图可以告诉机器人「前方右转」,却无法直接告诉它眼前应该从哪里转、沿哪一侧通过;即使已经生成路线,控制误差、地面变化和动态障碍,也可能让机器人在行进过程中逐渐偏离。

来自主题: AI技术研报
7050 点击    2026-07-23 10:38
打通感知-理解-交互链路,全栈视频理解大模型VideoChat3开源了

打通感知-理解-交互链路,全栈视频理解大模型VideoChat3开源了

打通感知-理解-交互链路,全栈视频理解大模型VideoChat3开源了

视频是描述物理世界的重要数据形态,更是人类与物理世界交互的重要载体,视频理解大模型是让 AI 从数字世界走向物理世界最基础、最原生的组成部分。

来自主题: AI技术研报
7464 点击    2026-07-23 10:37
花几百万买的H100在「摸鱼」?英伟达:别怪显卡,是你的模型「长得丑」

花几百万买的H100在「摸鱼」?英伟达:别怪显卡,是你的模型「长得丑」

花几百万买的H100在「摸鱼」?英伟达:别怪显卡,是你的模型「长得丑」

就在最近,英伟达亲自下场,发布了一篇名为《AI Model Co-Design: Hardware-Friendly LLM Design》的技术博客。整篇文章洋洋洒洒,其实就想点醒行业一件事:别光顾着堆算力了,来看看你们是怎么把顶级显卡逼成“磨洋工”的吧。

来自主题: AI技术研报
9012 点击    2026-07-22 15:21
小红书引擎架构团队OSDI 2026新成果:HELMSMAN重塑大规模向量检索基础设施

小红书引擎架构团队OSDI 2026新成果:HELMSMAN重塑大规模向量检索基础设施

小红书引擎架构团队OSDI 2026新成果:HELMSMAN重塑大规模向量检索基础设施

近日,围绕搜索、推荐、广告等核心业务中的大规模向量检索成本与性能问题,小红书引擎架构团队在 OSDI 2026 会议上发表了论文《The Clustering Strikes Back: Building Cost-Effective and High-Performance ANNS at Scale with HELMSMAN》。

来自主题: AI技术研报
9409 点击    2026-07-22 10:35
5.83倍加速!PolicyTrim:让VLA机器人少走弯路、更快完成任务

5.83倍加速!PolicyTrim:让VLA机器人少走弯路、更快完成任务

5.83倍加速!PolicyTrim:让VLA机器人少走弯路、更快完成任务

VLA模型已经会做任务,但真实机器人还是慢!PolicyTrim是一种优化VLA机器人执行效率的方法,无需重新训练。它通过扩展可靠动作序列并减少冗余步骤,帮助机器人更直接完成任务,提升整体速度。

来自主题: AI技术研报
5936 点击    2026-07-22 10:09
多模态迎来「架构换代」:商汤连出两张牌,划定大一统基座新标准

多模态迎来「架构换代」:商汤连出两张牌,划定大一统基座新标准

多模态迎来「架构换代」:商汤连出两张牌,划定大一统基座新标准

刚刚结束的 2026 年世界人工智能大会(WAIC) ,具身智能与 AI 终端占据了最显眼的位置,人形机器人、灵巧手和各类智能硬件吸引了大量目光。

来自主题: AI技术研报
7391 点击    2026-07-22 10:08
ICML 2026 | 多智能体系统也能搭积木?Agent Primitives让MAS走向模块化复用

ICML 2026 | 多智能体系统也能搭积木?Agent Primitives让MAS走向模块化复用

ICML 2026 | 多智能体系统也能搭积木?Agent Primitives让MAS走向模块化复用

多智能体系统(Multi-Agent Systems,MAS)展示了令人印象深刻的能力:一个模型负责提出方案,另一个模型进行批评,还有模型承担投票、规划或执行。通过角色分工和多轮协作,系统能够解决单个模型难以稳定完成的数学推理、代码生成和知识问答任务。

来自主题: AI技术研报
7465 点击    2026-07-21 17:05
经得起观众「刁难」,扛得住宁德「检验」:WAIC后重新认识苏度

经得起观众「刁难」,扛得住宁德「检验」:WAIC后重新认识苏度

经得起观众「刁难」,扛得住宁德「检验」:WAIC后重新认识苏度

外界第一次认识苏度,是在今年 4 月。彼时,sudo R1 的开放物体抓取能力给行业留下深刻印象:在开放环境中面对随机物体,机器人能够稳定完成抓取。抓取,这是一个足够基础、又足够难的技能。

来自主题: AI技术研报
8220 点击    2026-07-21 17:04
视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」

视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」

视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」

针对这一挑战,腾讯内容服务部 BAC 提出了一个名为 ProLaViT(Progressive Latent Visual Thought) 的全新框架。它的核心思想是:别急着下结论,先在连续隐空间里像人一样「步步推导」。 即让模型遵循 「定位 → 聚焦 → 分离」(Locate → Focus → Isolate) 的因果链,逐步收紧视觉注意力,最终精准锁定目标。

来自主题: AI技术研报
8408 点击    2026-07-21 16:55