AI资讯新闻榜单内容搜索-模型训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 模型训练
ICML 2026 | 图像编辑进入「交互理解」时代,北大提出HOI-Edit基准与SCPE自纠错框架

ICML 2026 | 图像编辑进入「交互理解」时代,北大提出HOI-Edit基准与SCPE自纠错框架

ICML 2026 | 图像编辑进入「交互理解」时代,北大提出HOI-Edit基准与SCPE自纠错框架

本文发现图生视频(I2V)模型天然适合重构动态交互过程,并提出 SCPE(Self-Correcting Process Editing) 多智能体系统自纠错框架:利用视频生成过程暴露失败原因,再通过分析、反思和工具书更新迭代增强提示,使 I2V 模型在复杂 HOI 编辑中显著提升交互准确性与推理能力。

来自主题: AI技术研报
8963 点击    2026-07-11 11:15
跟AI说“出片穿搭”,它真能听懂!淘宝ShopX让大模型直接“卖货”了

跟AI说“出片穿搭”,它真能听懂!淘宝ShopX让大模型直接“卖货”了

跟AI说“出片穿搭”,它真能听懂!淘宝ShopX让大模型直接“卖货”了

团队提出了ShopX:一个面向agentic shopping的电商大模型。它不仅仅是在搜索框外面套一个会“说话”和“调用工具”的LLM,而是赋予模型直接进入商品空间的能力,让大模型成为商品履约的核心,学会在商品空间中规划、检索、排序、组合和生成结果,进而减少接口损耗。

来自主题: AI技术研报
9536 点击    2026-07-11 11:14
ACL 2026 | 用图异常检测抓出多智能体网络中的内鬼!XG-Guard:首个无监督、可解释、细粒度的MAS安全防线

ACL 2026 | 用图异常检测抓出多智能体网络中的内鬼!XG-Guard:首个无监督、可解释、细粒度的MAS安全防线

ACL 2026 | 用图异常检测抓出多智能体网络中的内鬼!XG-Guard:首个无监督、可解释、细粒度的MAS安全防线

研究团队提出了 XG-Guard (eXplainable and fine-Grained safeGuarding framework), 一个基于 GAD 且兼具可解释性和细粒度检测能力的无监督安全防护框架。目前工作已被 ACL 2026 Main Conference 接收。

来自主题: AI技术研报
7963 点击    2026-07-11 11:07
最适合机器人的视频基座模型,被中国团队开源了

最适合机器人的视频基座模型,被中国团队开源了

最适合机器人的视频基座模型,被中国团队开源了

蚂蚁灵波选择了后一条路:开源 LingBot-Video。这是一个面向具身智能的视频生成基座模型,也是一套专为机器人场景设计的 DiT 视频预训练范式。通用视频模型更多学习画面变化、镜头运动和视觉风格;LingBot-Video 则把重点放在动作、任务、交互和物理环境变化上,面向世界预测、动作理解和机器人训练构建视频生成基座。

来自主题: AI技术研报
8533 点击    2026-07-10 10:41
你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

有没有一种更为合适的 OPSD 范式?近期,清华大学和马普所等机构的研究者们联合推出的 d-OPSD,给这一问题提供了完美的答案。这是第一个针对扩散大语言模型的 OPSD 范式,无需参考解,无需额外的教师模型,只需要 RL 十分之一的训练步数,便可以达到或超出 RL 的后训练效果。

来自主题: AI技术研报
8175 点击    2026-07-10 10:41
Zero-Shot、长记忆、抗干扰,DM0.5把VLA带进真实世界

Zero-Shot、长记忆、抗干扰,DM0.5把VLA带进真实世界

Zero-Shot、长记忆、抗干扰,DM0.5把VLA带进真实世界

今天原力灵机正式发布的 DM0.5 往前推进了一步。它不只是继续提高某些固定任务上的表现,而是围绕真实世界里的泛化问题做了一次系统突。 如果深入分析,就会发现 DM0.5 这几个核心提升,都是想解决一个问题:如何让具身模型从可控环境里的能力演示,走向开放环境里的稳定执行。

来自主题: AI技术研报
7782 点击    2026-07-10 10:40
不用人工标注,GUI Agent跑起「数据飞轮」:快手、浙大开源MobileForge

不用人工标注,GUI Agent跑起「数据飞轮」:快手、浙大开源MobileForge

不用人工标注,GUI Agent跑起「数据飞轮」:快手、浙大开源MobileForge

来自浙江大学 APRIL 实验室、快手主站技术部和清华大学的研究团队提出了 MobileForge,试图把手机 GUI Agent 的适配过程变成一个 “无标注、自探索、自反馈、自优化” 的闭环系统。

来自主题: AI技术研报
8090 点击    2026-07-10 10:40
ICML 2026 Spotlight | 直面「模态缺失」挑战:北大彭宇新团队联合福大柯逍团队提出LIMSSR,面向训练阶段不完整观测的精准评价

ICML 2026 Spotlight | 直面「模态缺失」挑战:北大彭宇新团队联合福大柯逍团队提出LIMSSR,面向训练阶段不完整观测的精准评价

ICML 2026 Spotlight | 直面「模态缺失」挑战:北大彭宇新团队联合福大柯逍团队提出LIMSSR,面向训练阶段不完整观测的精准评价

本文是北京大学彭宇新教授团队联合福州大学柯逍教授团队在细粒度多模态动作质量评价领域的最新研究成果,相关论文已被 ICML 2026 接收为 Spotlight,并已开源。真实世界中的多模态数据往往并不完整。在动作质量评价任务中,视频、光流、音频等模态能够从不同角度描述动作执行过程,但在实际采集时,传感器故障、环境噪声、隐私限制等因素都会导致模态缺失。

来自主题: AI技术研报
8252 点击    2026-07-10 10:40
多模态 Agent 记忆,为什么不能当成升级版多模态RAG?

多模态 Agent 记忆,为什么不能当成升级版多模态RAG?

多模态 Agent 记忆,为什么不能当成升级版多模态RAG?

多模态 Agent 的记忆系统,过去很容易被理解成一个升级版 RAG:图片、图表、PDF 进来之后,先抽取内容、做 embedding、写进向量库;用户提问时,再用 query 做检索,把命中的top-k图片、文档页或图表一并塞进上下文,再交给多模态模型回答。整个过程中,所有原始模态信息都会不加选择的塞给大模型。

来自主题: AI技术研报
8293 点击    2026-07-10 10:39
现代AI之父新作:13个大模型实测,检索agent真的可信吗?

现代AI之父新作:13个大模型实测,检索agent真的可信吗?

现代AI之父新作:13个大模型实测,检索agent真的可信吗?

近日,来自KAUST生成式AI卓越中心、吉林大学、浙江大学、瑞士人工智能实验室等机构,由包括「现代人工智能之父」Jürgen Schmidhuber在内的研究者组成的团队,发布了一篇回答这个问题的研究论文。

来自主题: AI技术研报
8338 点击    2026-07-09 16:52