将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式
将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式当你把一段长达9分钟、在“晴空万里”与“冰天雪地”间剧烈切换的冰岛旅行Vlog输入给大模型,并要求它做一份旅行攻略时,常规的视觉大模型通常只能给出一份基于字幕和画面标签拼凑的“流水账”。
来自主题: AI技术研报
8226 点击 2026-05-27 09:52
搜索
当你把一段长达9分钟、在“晴空万里”与“冰天雪地”间剧烈切换的冰岛旅行Vlog输入给大模型,并要求它做一份旅行攻略时,常规的视觉大模型通常只能给出一份基于字幕和画面标签拼凑的“流水账”。