三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26
三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26长视频理解,正在成为多模态大模型的重要能力。
来自主题: AI技术研报
6537 点击 2026-07-30 15:57
搜索
长视频理解,正在成为多模态大模型的重要能力。
本文综合北京大学王选计算机研究所发布的 ProactiveVideoQA 和 MMDuet2 两篇论文,介绍视频多模态大模型如何实现 “主动交互”—— 在视频播放过程中自主决定何时发起回复,而非等待用户提问。ProactiveVideoQA 提出评估指标和 benchmark,MMDuet2 则通过强化学习训练方法实现了 SOTA 性能,无需精确的回复时间标注即可训练出及时、准确的主动交互模型。