AI资讯新闻榜单内容搜索-训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 训练
北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning, PIRL,以及对应的落地算法 PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?

来自主题: AI技术研报
8313 点击    2026-07-12 10:44
ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。

来自主题: AI技术研报
8668 点击    2026-07-11 11:16
ICML 2026 | 图像编辑进入「交互理解」时代,北大提出HOI-Edit基准与SCPE自纠错框架

ICML 2026 | 图像编辑进入「交互理解」时代,北大提出HOI-Edit基准与SCPE自纠错框架

ICML 2026 | 图像编辑进入「交互理解」时代,北大提出HOI-Edit基准与SCPE自纠错框架

本文发现图生视频(I2V)模型天然适合重构动态交互过程,并提出 SCPE(Self-Correcting Process Editing) 多智能体系统自纠错框架:利用视频生成过程暴露失败原因,再通过分析、反思和工具书更新迭代增强提示,使 I2V 模型在复杂 HOI 编辑中显著提升交互准确性与推理能力。

来自主题: AI技术研报
9195 点击    2026-07-11 11:15
跟AI说“出片穿搭”,它真能听懂!淘宝ShopX让大模型直接“卖货”了

跟AI说“出片穿搭”,它真能听懂!淘宝ShopX让大模型直接“卖货”了

跟AI说“出片穿搭”,它真能听懂!淘宝ShopX让大模型直接“卖货”了

团队提出了ShopX:一个面向agentic shopping的电商大模型。它不仅仅是在搜索框外面套一个会“说话”和“调用工具”的LLM,而是赋予模型直接进入商品空间的能力,让大模型成为商品履约的核心,学会在商品空间中规划、检索、排序、组合和生成结果,进而减少接口损耗。

来自主题: AI技术研报
9841 点击    2026-07-11 11:14
ACL 2026 | 用图异常检测抓出多智能体网络中的内鬼!XG-Guard:首个无监督、可解释、细粒度的MAS安全防线

ACL 2026 | 用图异常检测抓出多智能体网络中的内鬼!XG-Guard:首个无监督、可解释、细粒度的MAS安全防线

ACL 2026 | 用图异常检测抓出多智能体网络中的内鬼!XG-Guard:首个无监督、可解释、细粒度的MAS安全防线

研究团队提出了 XG-Guard (eXplainable and fine-Grained safeGuarding framework), 一个基于 GAD 且兼具可解释性和细粒度检测能力的无监督安全防护框架。目前工作已被 ACL 2026 Main Conference 接收。

来自主题: AI技术研报
8235 点击    2026-07-11 11:07
全球首个!「具身原生」世界动作模型LingBot-VA 2.0来了

全球首个!「具身原生」世界动作模型LingBot-VA 2.0来了

全球首个!「具身原生」世界动作模型LingBot-VA 2.0来了

蚂蚁集团旗下具身智能公司蚂蚁灵波,把这块最难的拼图拍上了桌:LingBot-VA 2.0——行业第一个具身原生预训练模型。所谓「具身原生」,一句话说清楚:不是拿现成的数字世界模型做嫁接,而是从数据、训练目标到模型架构,每一层都为「机器人在物理世界干活」而生—

来自主题: AI资讯
9316 点击    2026-07-10 15:14
Mecka AI:不造机器人,它怎么靠“人类动作数据”融到 6000 万美元

Mecka AI:不造机器人,它怎么靠“人类动作数据”融到 6000 万美元

Mecka AI:不造机器人,它怎么靠“人类动作数据”融到 6000 万美元

今天分享一家很新的公司,Mecka AI,Mecka AI 是一家给机器人公司提供训练数据的公司。更具体一点,Mecka AI 做的是“人类动作数据”。也就是说,Mecka 做的事情很像“机器人时代的 Scale AI”。

来自主题: AI资讯
9346 点击    2026-07-10 11:04
速递|全栈Agent开发平台Prime Intellect融资1.3亿美元,估值10亿美元,ARR破1亿美元

速递|全栈Agent开发平台Prime Intellect融资1.3亿美元,估值10亿美元,ARR破1亿美元

速递|全栈Agent开发平台Prime Intellect融资1.3亿美元,估值10亿美元,ARR破1亿美元

Prime Intellect 是一家为企业提供算力及专业软件工具、助力构建 AI Agent 的初创公司,近日完成 1.3 亿美元 A 轮融资,估值达 10 亿美元。Prime Intellect 成立于 2024 年,其目标是赋予企业自主训练 AI Agent 系统的能力,无需依赖前沿 AI 实验室。

来自主题: AI资讯
10287 点击    2026-07-10 10:42
最适合机器人的视频基座模型,被中国团队开源了

最适合机器人的视频基座模型,被中国团队开源了

最适合机器人的视频基座模型,被中国团队开源了

蚂蚁灵波选择了后一条路:开源 LingBot-Video。这是一个面向具身智能的视频生成基座模型,也是一套专为机器人场景设计的 DiT 视频预训练范式。通用视频模型更多学习画面变化、镜头运动和视觉风格;LingBot-Video 则把重点放在动作、任务、交互和物理环境变化上,面向世界预测、动作理解和机器人训练构建视频生成基座。

来自主题: AI技术研报
8773 点击    2026-07-10 10:41
你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

有没有一种更为合适的 OPSD 范式?近期,清华大学和马普所等机构的研究者们联合推出的 d-OPSD,给这一问题提供了完美的答案。这是第一个针对扩散大语言模型的 OPSD 范式,无需参考解,无需额外的教师模型,只需要 RL 十分之一的训练步数,便可以达到或超出 RL 的后训练效果。

来自主题: AI技术研报
8417 点击    2026-07-10 10:41