V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间
V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文《V-RAE: Rethinking Video Latent Spaces for Generation》中提出视频表征自编码器 V-RAE。该方法以冻结的视觉基础模型为编码器,通过轻量级时间池化压缩视频特征,并将具有丰富语义和时间连续性的表征直接用于视频重建、生成与未来预测。
来自主题: AI技术研报
8672 点击 2026-08-26 10:19