AI资讯新闻榜单内容搜索-ICML

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: ICML
ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

过去的 Diffusion RL 多聚焦于奖励设计与优化算法,训练时的采样成本被忽视。DMSampler 指出:在在线 RL 中,限制规模化的不只是奖励信号或优化器,很多时候是 rollout 本身太贵。

来自主题: AI技术研报
7638 点击    2026-08-01 10:44
ICML 2026 | 多智能体系统也能搭积木?Agent Primitives让MAS走向模块化复用

ICML 2026 | 多智能体系统也能搭积木?Agent Primitives让MAS走向模块化复用

ICML 2026 | 多智能体系统也能搭积木?Agent Primitives让MAS走向模块化复用

多智能体系统(Multi-Agent Systems,MAS)展示了令人印象深刻的能力:一个模型负责提出方案,另一个模型进行批评,还有模型承担投票、规划或执行。通过角色分工和多轮协作,系统能够解决单个模型难以稳定完成的数学推理、代码生成和知识问答任务。

来自主题: AI技术研报
7800 点击    2026-07-21 17:05
港科大新发现:MoE路由很脆弱!重复token输入阻塞负载均衡 | ICML'26

港科大新发现:MoE路由很脆弱!重复token输入阻塞负载均衡 | ICML'26

港科大新发现:MoE路由很脆弱!重复token输入阻塞负载均衡 | ICML'26

来自港科大的研究团队提出了RepetitionCurse,这是一种针对MoE大模型服务的黑盒压力测试方法。它不需要模型权重,不需要梯度,也不需要知道后端专家如何部署,只利用高度重复的输入模式,就能诱导专家路由把大量token路由到同一小批专家上。

来自主题: AI技术研报
9195 点击    2026-07-19 10:11
提示词工程论文登上ICML 2026,网友吵翻了天

提示词工程论文登上ICML 2026,网友吵翻了天

提示词工程论文登上ICML 2026,网友吵翻了天

这年头,提示词工程也能发ICML了???

来自主题: AI技术研报
7375 点击    2026-07-15 11:11
ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

奖励模型(Reward Model, RM)是大语言模型对齐的核心组件,负责为模型输出提供符合人类偏好的评价信号。现有方法各有短板:标量判别式 RM 高效稳定但可解释性有限;生成式 judge 能给出判断理由,却需为每个样本生成长 reasoning,token 与延迟开销显著。

来自主题: AI技术研报
7446 点击    2026-07-13 14:44
ICML 2026 | 突破极限!港大提出首个适配300+任务的持续学习架构,破解遗忘难题

ICML 2026 | 突破极限!港大提出首个适配300+任务的持续学习架构,破解遗忘难题

ICML 2026 | 突破极限!港大提出首个适配300+任务的持续学习架构,破解遗忘难题

人类可以在一生中持续学习新知识,而不会轻易遗忘已有技能。然而对 AI 模型而言,这恰恰是一道极具挑战性的难题:每当模型学习新任务时,参数更新往往会覆盖历史知识,产生经典的 “灾难性遗忘” 难题。持续学习(Continual Learning)正是为突破这一瓶颈而生的研究方向。

来自主题: AI技术研报
7507 点击    2026-07-13 14:43