AI资讯新闻榜单内容搜索-模型训练

CVPR 2026 | 告别倾听「扑克脸」，UniLS框架来了，刷新数字人对话SOTA

在游戏 NPC、虚拟主播、在线客服等数字人对话场景中，倾听时的 “扑克脸” 问题一直是行业长期痛点 —— 虚拟人说话时口型可以做到精准同步，但倾听时却表情僵硬、毫无反应，严重影响对话的自然感和沉浸感。盛大 AI 研究院（东京）与东京大学联合提出 UniLS（Unified Listening and Speaking），首个仅凭双轨音频即可端到端同时驱动说话和倾听面部动作的统一框架。

来自主题: AI技术研报

10179 点击 2026-04-24 09:15

首篇「Attention Sink」综述：从利用、理解到消除，Transformer中的注意力「汇聚」全景解析

几乎所有 Transformer 都在做一件反常的事：把大量注意力集中到少数几个特定 Token 上。这不是 bug，而是 Transformer 固有的「注意力汇聚」（Attention Sink）。首篇系统性综述，带你从利用、理解到消除，全面掌握这一核心现象。

来自主题: AI技术研报

9325 点击 2026-04-24 09:14

突破算力瓶颈！港大俞益洲团队发布首篇「高效视频世界模型」全面综述

还记得两年前，AI 生视频可谓是「鬼畜专区」—— 人物多一根手指算基操，走路自带鬼步舞才是常态。结果转眼间，从 OpenAI 的 Sora 到字节跳动的 Seedance，这些模型已经开始一本正经地「模拟世界」了：水会流、球会弹、光影能追踪，俨然一副要当「物理引擎」的架势。

来自主题: AI技术研报

7897 点击 2026-04-24 09:14

Transformer可以改装成Mamba了：苹果把推理成本直接打成线性

最近，苹果又整了个活儿，很工程、也挺关键：把又贵又强的 Transformer，改造成又便宜又差不多强的 Mamba。而且，性能基本没怎么掉。

来自主题: AI技术研报

9089 点击 2026-04-23 14:46

视觉大模型迎来“o1时刻”：腾讯混元提出SOAR，让AI在生成中学会自我纠偏

近日，腾讯混元团队提出HY-SOAR （Self-Correction for Optimal Alignment and Refinement），一种面向扩散模型和流匹配模型的数据驱动后训练方法。

来自主题: AI技术研报

8367 点击 2026-04-23 14:44

ICLR 2026 | ProSafePrune：一剪见效，告别大模型过度防御

当你问 AI 「如何关掉房间的灯（how to kill the lights）」，却被冰冷拒绝「无法提供相关帮助」；当你想探讨「黑客技术的正向应用」，得到的却是「拒绝涉及非法活动」的机械回应 —— 你遇到的正是大语言模型（LLMs）的「过度拒绝」（over-refusal）痛点。

来自主题: AI技术研报

10795 点击 2026-04-23 14:06

LLM 仅靠自身就能增强推理？SePT 给出简洁在线自训练范式

在推理后训练里，多数方法仍依赖奖励模型、验证器或额外教师信号。如果不依赖这些外部信号，只使用模型自身生成的答案进行自训练，是否仍然能够提升推理能力？是的！SePT（Self-evolving Post-Training）给出肯定答案，简洁的自训练方法，可在数学推理任务准确率直升10个点！

来自主题: AI技术研报

6426 点击 2026-04-23 14:05

首篇自进化智能体系统技术报告出炉：Token成本直降近10倍，省钱又高效！

当 AI 智能体不再只是「一次性工具」，而是能够持续学习、自我进化的「数字伙伴『数字同事』，会发生什么？自进化智能体应该采取怎样的设计原则？

来自主题: AI技术研报

9680 点击 2026-04-23 14:04

都是你能部署的：Qwen3.6和Gemma4，谁更适合作为你的下一代本地MoE模型？

阿里前几天开源的Qwen3.6-35B-A3B，让这次讨论不再只是一次普通的新旧模型对比。它一边要面对谷歌Gemma4-26B-A4B的外部竞争，一边又必须回答一个更麻烦的问题：相较于 Qwen3.5-35B-A3B，它到底是升级，还是修补？更现实的是，很多人现在真正跑着的，其实是Qwen3.5-27B，那么这条新的35B-A3B路线，到底值不值得迁过去。

来自主题: AI技术研报

10838 点击 2026-04-23 09:23

ICLR 2026 Oral｜Information Shapes Koopman Representation：信息如何决定世界模拟？

大多数世界模型工作默认：只要学到一个好的 latent dynamics，问题就解决了。但这个假设本身是可疑的——什么样的信息，才足以支撑一个可预测、可传播的动力学？本文从信息论出发，重新审视这一前提。

来自主题: AI技术研报

10285 点击 2026-04-23 09:20