用3D几何先验驱动视频扩散,实现更一致的世界生成
用3D几何先验驱动视频扩散,实现更一致的世界生成随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。
搜索
随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。
科研的链条很长。文献读不完,方向想不清,实验一轮接一轮,论文改到深夜。过去两年,大模型已经能读论文、写代码、改文章,但它们大多以问答工具的形态散落在各个环节,替研究者节省的只是零碎时间。
Stack Overflow,有「程序员圣经」之称,已经积累超过 2400 万个问题专业社区,全网最大的编程问答语料库,正在走向死亡。
27B正在成为本地AI的新选择。
大模型机制可解释性研究中,一直存在一个颇具反差的现实: 为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。
视觉 - 语言 - 动作(VLA)模型已成为端到端自动驾驶的主流技术路线,但基于自回归(AR)解码的现有架构面临双重结构性瓶颈:其一,逐 Token 串行生成导致推理延迟随序列长度线性增长,严重制约实时部署;其二,训练阶段依赖真实前缀的 teacher forcing 机制,使模型在推理时暴露于自身生成的误差之上,引发长时序累积的曝光偏差(exposure bias)。
图像生成模型正从「会创作」转向「可操作」。
Mythos玩起了“霸凌”、Opus 4.8使上了“阴招”……
8 月 13 日,DeepSeek 开源 Agent Harness dsh,将 “Harness” 这个原本更偏工程语境的概念,推到了整个 AI 行业讨论的中心。
当下,几乎所有人都在押注更大、更聪明的 AI 模型。但 AI 的下一个核心护城河到底是什么?最近,a16z 发布了一篇深度文章——《下一个 AI 护城河并非更优的模型》(The Next AI Moat Isn’t a Better Model)。