给AI喂“噪声”也能涨分,这项工作让噪声实现正迁移 | ICML26
给AI喂“噪声”也能涨分,这项工作让噪声实现正迁移 | ICML26迁移学习里的“源数据”,未必非得是图像、文本或音频。
搜索
迁移学习里的“源数据”,未必非得是图像、文本或音频。
7 月的上海,世博展览馆 H3 馆的过道比往年拥挤许多。 入口处停着宇树的载人变形机甲 GD01,观众排队坐进驾驶舱拍照。往里走,300 多台机器人真机散在 200 多家具身智能企业的展台之间,具身智
交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。
视频是描述物理世界的重要数据形态,更是人类与物理世界交互的重要载体,视频理解大模型是让 AI 从数字世界走向物理世界最基础、最原生的组成部分。
苏度科技联合创始人、董事长苏昊是ImageNet的核心作者之一,师从李飞飞。这家公司走了一条与硅谷主流“纯大脑黑盒大模型”不太一样的路:软硬件协同设计,上下分层架构,上层负责任务规划与环境理解,下层负责具体物体操作;Sim-to-Real作为核心训练范式,让机器人在虚拟世界里经历几百万年的进化,再迁移到现实。
最近硅谷有点魔幻。一边被中国开源模型吓得不轻,专门造了个词叫「Kimi panic」;另一边,美国最大的模型托管平台刚被自家模型攻击,救场的偏偏又是一个中国开源模型。就在这个节骨眼上,老黄又整活了。
“AI教母”李飞飞创办的World Labs正式宣布收购美国机器人仿真初创公司SceniX。这笔交易是World Labs成立以来的首笔公开收购,也标志着这家以“空间智能”为旗帜的明星创企,正式将业务边界从3D世界生成推进到物理机器人训练领域。
这家公司是Fireworks AI,按现在流行的话说,Fireworks AI是一家Token工厂。既不训练前沿大模型,也不做面向消费者的AI应用,只做推理,帮企业把开源模型微调好、托管好,然后按调用量收钱。今年GTC大会上,黄仁勋和Lin Qiao有场对谈,老黄直言,“In a lot of ways, you're the TSMC of AI factories.”
袁博地的答案是否定的。从清华大学接触计算机视觉,到 UC Berkeley 攻读 AI 博士,再到 Google X 负责机器人的视觉系统,袁博地过去十多年的研究几乎始终围绕 Pixel 展开:从图像识别,到 GAN、Diffusion,再到图像和视频生成,技术范式不断变化,研究对象却始终指向同一件事——如何让机器理解和生成视觉世界。
就在最近,英伟达亲自下场,发布了一篇名为《AI Model Co-Design: Hardware-Friendly LLM Design》的技术博客。整篇文章洋洋洒洒,其实就想点醒行业一件事:别光顾着堆算力了,来看看你们是怎么把顶级显卡逼成“磨洋工”的吧。