何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500
何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500当下计算机视觉长期陷入“一任务一专用模型”内卷: 做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。
搜索
当下计算机视觉长期陷入“一任务一专用模型”内卷: 做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。
对于具身智能行业而言,这不仅意味着一条数据处理产线效率的提升,更体现出机器人数据正在从「人工加工」走向「工业化生产」。
在模型层之外,2026 年上半年在硅谷增长最快的赛道之一是数据:Mercor 的 run rate 从去年下半年的 5 亿美元涨到今年年中的 20 亿美元;Handshake 转型 human data 后,run rate 在年初三个月内从 5.5 亿美元冲到 10 亿美元;RL 环境公司 Fleet 则在半年内从百万美元级别做到 6000 万美元 run rate,
我们如何判断人工智能是否已经足够聪明,能够从事科学研究,实现端到端的自主科学发现?
你有没有想过,有一天你买东西,不再需要打开购物软件挨个搜索,而是直接对你的AI助手说一句“我想买一把适合初学者的吉他”,它就能跑遍全网,把最好的几个选项摆在你面前,还附带理由?
作为具身智能最主流的路线之一,VLA 快速发展的同时也因为其各种问题被诟病。其中最主要的痛点之一便是指令泛化能力。
今日,Meta推出其首款编程Agent——Muse Code(测试版),以及该Agent搭载的新一代模型Muse Spark 1.2。模型一经面世便引发海外热议,核心关注点直指定价策略:比DeepSeek-V4-Flash更便宜。如果用户允许Meta用他们的数据训练模型,就能享受95折优惠。
让机器人把一只虾夹起来,再放进锅里。
Transformer 的上限在哪里?这个问题从 2022 年 ChatGPT 问世起,就开始被广泛讨论。
人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。