AI资讯新闻榜单内容搜索-模型训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 模型训练
ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

奖励模型(Reward Model, RM)是大语言模型对齐的核心组件,负责为模型输出提供符合人类偏好的评价信号。现有方法各有短板:标量判别式 RM 高效稳定但可解释性有限;生成式 judge 能给出判断理由,却需为每个样本生成长 reasoning,token 与延迟开销显著。

来自主题: AI技术研报
7369 点击    2026-07-13 14:44
世界模型应如何评估?南京大学团队发布「世界模型」评估立场论文

世界模型应如何评估?南京大学团队发布「世界模型」评估立场论文

世界模型应如何评估?南京大学团队发布「世界模型」评估立场论文

近期,围绕「世界模型」的讨论持续升温。机器人、自动驾驶、视频生成、具身智能等多个方向都在频繁使用这一概念,相关系统不断出现,演示形式日益丰富,评价指标也越来越多。伴随这一趋势,一个基础问题变得格外重要:当一个模型被称为「世界模型」时,人们究竟在评价什么?

来自主题: AI技术研报
8426 点击    2026-07-13 14:44
Agentic时代推荐系统范式认知或被颠覆?个性化推荐或将从平台中心转向用户主导

Agentic时代推荐系统范式认知或被颠覆?个性化推荐或将从平台中心转向用户主导

Agentic时代推荐系统范式认知或被颠覆?个性化推荐或将从平台中心转向用户主导

在过去二三十年的互联网发展中,个性化推荐几乎一直是平台的核心能力之一。打开视频 app,平台决定你接下来会刷到什么视频;打开购物软件,平台预测你可能会购买什么商品;打开短视频 app,平台根据你的浏览、点赞、停留和互动,不断优化信息流。某种意义上,现代互联网的用户体验本身就是由推荐系统塑造的。

来自主题: AI技术研报
9651 点击    2026-07-13 14:43
ICML 2026 | 突破极限!港大提出首个适配300+任务的持续学习架构,破解遗忘难题

ICML 2026 | 突破极限!港大提出首个适配300+任务的持续学习架构,破解遗忘难题

ICML 2026 | 突破极限!港大提出首个适配300+任务的持续学习架构,破解遗忘难题

人类可以在一生中持续学习新知识,而不会轻易遗忘已有技能。然而对 AI 模型而言,这恰恰是一道极具挑战性的难题:每当模型学习新任务时,参数更新往往会覆盖历史知识,产生经典的 “灾难性遗忘” 难题。持续学习(Continual Learning)正是为突破这一瓶颈而生的研究方向。

来自主题: AI技术研报
7428 点击    2026-07-13 14:43
Claude Code砸的坑,蚂蚁安全在尝试填上

Claude Code砸的坑,蚂蚁安全在尝试填上

Claude Code砸的坑,蚂蚁安全在尝试填上

2026年,AI安全终于被推到了台前。

来自主题: AI资讯
9226 点击    2026-07-13 09:44
AI学会了像人脑一样遗忘,可编程遗忘机制为边缘AI计算“大减负”

AI学会了像人脑一样遗忘,可编程遗忘机制为边缘AI计算“大减负”

AI学会了像人脑一样遗忘,可编程遗忘机制为边缘AI计算“大减负”

近期,美国俄勒冈州立大学研发出一种新型成像传感器,不仅可在探测光线的同时进行图像存储(近期光照信息),还能实现信息的按需“遗忘”。

来自主题: AI技术研报
6542 点击    2026-07-13 09:42
ECCV 2026 | 实时导演多镜头长视频! 港中文&快手可灵发布ShotStream

ECCV 2026 | 实时导演多镜头长视频! 港中文&快手可灵发布ShotStream

ECCV 2026 | 实时导演多镜头长视频! 港中文&快手可灵发布ShotStream

为了打破多镜头长视频面临的高延迟、零交互困境,香港中文大学与快手可灵团队联合提出了首个实时流式多镜头长视频生成框架 ——ShotStream。该研究打破了传统双向架构的限制,将多镜头合成定义为基于历史上下文的下一镜头生成任务,用户可以通过动态流式提示词在运行时动态指导叙事走向!更令人振奋的是

来自主题: AI技术研报
6574 点击    2026-07-12 10:47
给多智能体LLM装上「图记忆工作流路由器」,搞定调用、协作规划

给多智能体LLM装上「图记忆工作流路由器」,搞定调用、协作规划

给多智能体LLM装上「图记忆工作流路由器」,搞定调用、协作规划

GraphPlanner通过引入图记忆网络,将多智能体LLM的路由过程升级为动态工作流生成。不仅选择调用哪个模型,还决定每个模型应承担的角色,实现任务分解与协作规划。

来自主题: AI技术研报
7547 点击    2026-07-12 10:46
北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning, PIRL,以及对应的落地算法 PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?

来自主题: AI技术研报
8066 点击    2026-07-12 10:44
ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。

来自主题: AI技术研报
8405 点击    2026-07-11 11:16