WalkingLab:AI 时代的开源实验室
WalkingLab:AI 时代的开源实验室WalkingLab 是由清华大学与香港大学团队发起的开源非营利实验室,专注真实世界 AI 与项目制学习,成立五个月已推出涵盖工程实践、强化学习和大语言模型的三门核心课程,累计获超 20,000 GitHub Star 并登上 Hacker News 首页,致力于通过真实项目连接课程、论文与工程实践,加速 AGI 到来。
搜索
WalkingLab 是由清华大学与香港大学团队发起的开源非营利实验室,专注真实世界 AI 与项目制学习,成立五个月已推出涵盖工程实践、强化学习和大语言模型的三门核心课程,累计获超 20,000 GitHub Star 并登上 Hacker News 首页,致力于通过真实项目连接课程、论文与工程实践,加速 AGI 到来。
近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
If I Had One Bet on Robot Learning, I’d Bet on Cross-Entropy. 大语言模型的成功揭示了一个适用于一维序列数据的清晰 Scaling Law:通过自回归训练,并采用交叉熵(cross-entropy)目标函数预测下一个 token 的概率分布,模型能够建模非常复杂的语义概率分布,并随着数据规模和模型规模的增长持续提升性能。
当多个大语言模型(LLM)组成「招聘委员会」,共同筛选简历、讨论候选人、打分并投票时,我们通常会用最终录用率来判断系统是否公平。
Meta联合南洋理工大学等多所高校全开源HumanCLAW基准,将高层行动决策与低层运动控制分离以单独测量视觉语言模型的行动智能,九个前沿模型完整交互成功率仅16.8%,揭示出当前基础模型缺乏持续维护自身身体状态估计的具身自我感知缺口。
当我们惊叹于大语言模型能写诗、会编程时,科学家们正面临一个更棘手的问题:如何让AI像真正的科研工作者一样,去解决那些需要数月甚至数年持续思考、且充满未知的科学难题?
强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。
大视觉语言模型(LVLM)把语言理解扩展到了图像等多模态输入,同时,也带来了更隐蔽的攻击面。
扩散智能DiffuSpace与Acrab联合测试显示,扩散语言模型凭借全局并行生成机制可将端侧Agent运行速度提升约5倍,双方计划加速推进其在AI PC、智能汽车等场景落地。
如果说大语言模型拉开了本轮人工智能革命的序幕,那么今天人机交互的瓶颈,早已不再是模型的智商,而是人类接收信息的生理带宽。