ECCV 2026 | AgentVLN:让机器人导航进入Agent时代
ECCV 2026 | AgentVLN:让机器人导航进入Agent时代近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
搜索
近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
具身智能讨论的核心问题正在改变:从谁有更多数据能做出更强基础模型,转向谁能把机器人真正部署到现场,并让它持续做成任务。
近日,机器人圈知名播客节目 RoboPapers 更新了一期专访,对象是光轮智能创始人兼 CEO 谢晨博士。这期节目的采访人是 RoboPapers 播客联合主持人 Michael Cho 和新加坡国立大学(NUS)助理教授 Jiafei Duan。后者是 MolmoAct 系列机器人模型的作者,研究方向正是机器人基础模型与可扩展数据采集。
If I Had One Bet on Robot Learning, I’d Bet on Cross-Entropy. 大语言模型的成功揭示了一个适用于一维序列数据的清晰 Scaling Law:通过自回归训练,并采用交叉熵(cross-entropy)目标函数预测下一个 token 的概率分布,模型能够建模非常复杂的语义概率分布,并随着数据规模和模型规模的增长持续提升性能。
一家正在营业的超市里,一台轮式机器人正沿着货架缓慢移动。
机器人也把「我不是机器人」勾上了。
↑↑↑点击蓝字|关注我们 follow us AING硬迹 两家以虚拟内容见长的头部公司,押注“AI陪伴硬件”。 近日,游戏圈最耐人寻味的信号不是来自某款新游的预告片,而是来自两家公司的招聘页面和商标
物理AI感知公司Lyte完成1.65亿美元C轮融资,投后估值达16亿美元,由Maverick Silicon领投,该公司由前苹果Face ID工程师创立,核心产品LyteVision™为机器人提供全栈自研感知基础设施。
一项双机器人协作测试中,研究人员故意让其中一台机器人晚了 3 秒。
文章系统梳理了机器人触觉感知的压阻式、压电式、电容式、光学式和磁感应五大技术路线,结合一目科技和亚德诺半导体的研发实践,分析了触觉数据采集面临的三大难题以及T-Rex、TacSL等模型算法的路线之争,指出机器人触觉正处于爆发前夜。