具身智能空间视觉死穴,终于被最新顶会彻底解决!
具身智能空间视觉死穴,终于被最新顶会彻底解决!VLA 大模型看似强大,却被一个致命弱点扼住喉咙——相机稍微挪动几毫米,操作成功率就能暴跌一半。招商局先进技术研究院下属实验室提出新的移动数据范式,首次在真实机器人系统上证明:让相机动起来采集数据,就能以极低成本破解 VLA 的空间泛化瓶颈,且效果普适于多种主流架构。被一个致命弱点扼住喉咙——相机稍微挪动几毫米,操作成功率就能暴跌一半。
搜索
VLA 大模型看似强大,却被一个致命弱点扼住喉咙——相机稍微挪动几毫米,操作成功率就能暴跌一半。招商局先进技术研究院下属实验室提出新的移动数据范式,首次在真实机器人系统上证明:让相机动起来采集数据,就能以极低成本破解 VLA 的空间泛化瓶颈,且效果普适于多种主流架构。被一个致命弱点扼住喉咙——相机稍微挪动几毫米,操作成功率就能暴跌一半。
针对这一问题,openJiuwen社区正式发布Skill-Omni——业界最早工程化落地的多模态Skill范式。 它让Agent的经验从“读得懂”升级为“看得见”,把网页和视频中的视觉知识,沉淀为Agent可复用的多模态Skill。
刚刚,翁荔(Lilian Weng)又更新博客了!距离她上一次更新《谨慎对待 Scaling Law》还不到 10 天。这一次,她书写的主题是当前大热的 Harness Engineering,聚焦的正是当下 AI 研究最前沿一个环节:当模型本身的智能已经足够强大时,真正决定它能走多远的,或许是包裹在模型外面的那层「Harness」也就是负责编排模型思考、调用工具、管理上下文、评估结果的那套系统。
刚刚,DeepSeek 在官方 API 文档里给出了一个 thinking mode 和 tool call 结合使用的样例。表面上看,这只是一个常规的工具调用演示:用户提出问题,模型判断需要调用工具,工具返回结果后,模型再继续生成答案。
General Intuition 做的事听起来有点绕:用游戏数据训练现实世界里的 AI Agent。换成更直白的话说,General Intuition 做的是让 AI 先在游戏里学会“怎么行动”,再把这种能力迁移到机器人、无人机、自动驾驶、仿真环境里。
视频虚拟试衣(VVT)作为电商展示与数字内容创作中的核心技术,已在动态人物换装、服装纹理保持和视频时序连贯性方面取得显著进展。然而,现有方法大多仍受限于固定相机视角,生成结果被动依赖源视频的原始相机轨
以 LeWorldModel(LeWM)为例,它在规划时有一个重要瓶颈:每评估一条候选动作序列,模型都要一步步自回归 rollout。也就是说,LeWM 先预测下一步 latent,再把预测出的 latent 输入 dynamics model,继续预测下一步:
手机GUI Agent正在从「看懂屏幕、点击按钮」走向更复杂的跨App自动化任务:这些任务听起来并不复杂,但对现有手机GUI Agent来说,一个核心难题始终存在:任务一长,就容易忘。
AI视频生成技术迅猛发展,生成内容的逼真度不断提升,现有检测方法已无法满足需求。最新综述提出「事实保真度验证」新目标,从视觉与语言双视角梳理出四层检测框架,涵盖底层线索、时空一致性、跨模态核验及世界知识推理,强调多层证据耦合与可解释性。
蚂蚁灵波的 LingBot-Depth 2.0,一出手就是王炸——12项世界第一!深扒内幕发现:他们竟然直接抛弃了 DINOv3,从头自研预训练基座,仅用11亿参数暴力干翻70亿大魔王,且宣布重磅开源。