视频通用模型来了!DeepMind 再证「生成即理解」,何恺明参与
视频通用模型来了!DeepMind 再证「生成即理解」,何恺明参与如果想开发一个视频理解应用,你会怎么做?
搜索
如果想开发一个视频理解应用,你会怎么做?
近日,自监督学习新工作 VISReg(Variance-Invariance-Sketching Regularization)获图灵奖得主 Yann LeCun 连续转发并给予高度认可 —— 他在转发时评价道「VICReg begat SIGReg which begat VISReg」(VICReg 孕育了 SIGReg,SIGReg 又孕育了 VISReg),
“购买使用AI时,钱可能要付两遍!”
在过去二三十年的互联网发展中,个性化推荐几乎一直是平台的核心能力之一。打开视频 app,平台决定你接下来会刷到什么视频;打开购物软件,平台预测你可能会购买什么商品;打开短视频 app,平台根据你的浏览、点赞、停留和互动,不断优化信息流。某种意义上,现代互联网的用户体验本身就是由推荐系统塑造的。
瞄准这类 “看起来做对了,物理上却没完成” 的失败。破晓智能(PHANES AI)创始人、哈工大(深圳)长聘教授杨朔及其团队发布了最新论文 TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation。
来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。
研究团队提出了 XG-Guard (eXplainable and fine-Grained safeGuarding framework), 一个基于 GAD 且兼具可解释性和细粒度检测能力的无监督安全防护框架。目前工作已被 ACL 2026 Main Conference 接收。
PJ Ace 在推文中兴奋地表示,他们借助 Utopai Studios 推出的下一代 AI 视频模型和智能体 PAI2.0, 以好莱坞灾难片大师罗兰·艾默里奇(Roland Emmerich)的视听风格,硬核「复活」了一段 250 年前激情澎湃、颠覆想象的美国独立日「真实历史影像」。
全球顶流AIGC大神、AI原生PJ Ace,近期在社交媒体上发布了最新力作,引发海外科技与电影圈的强烈关注。PJ Ace在推文中兴奋地说,他们借助Utopai Studios推出的下一代AI视频模型和智能体PAI2.0,以好莱坞灾难片大师罗兰·艾默里奇(Roland Emmerich)的视听风格,硬核“复活”了一段250年前激情澎湃、颠覆想象的美国独立日“真实历史影像”。
乐鑫信息科技 (688018.SH) 推出 ESP-VISION,一款面向 ESP32-P4、ESP32-S31 以及 ESP32-S3 系列芯片的低代码边缘 AI 与机器视觉框架。ESP-VISION 基于 MicroPython 提供统一的 sensor、image、display、espdl 等 Python API,整合摄像头采集、图像处理、视频编解码、