李飞飞发布世界模型这天,Visko也让AI视频开起了直播

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
李飞飞发布世界模型这天,Visko也让AI视频开起了直播
8586点击    2026-09-02 16:28

李飞飞发布世界模型这天,Visko也让AI视频开起了直播


一个不会停下的世界。


这几天,世界模型又突然热闹了起来。


9月1日,李飞飞创办的World Labs发布了新一代世界模型Atlas。


它可以同时处理文本、图像、视频和三维信息,根据相机运动补出新的视角,也可以重建真实空间,进一步用于机器人训练与测试所需要的模拟环境。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


World Labs依旧在空间智能的方向上持续推进,要做的不仅是让AI认识一张图片里的东西,还要让它理解这些东西存在于怎样的三维世界里。


而在Atlas发布的同一天,另一支团队Visko也正式推出了自己的世界模型Orbis,公司由Qing Yin创办,并完成了1000万美元Pre-seed融资。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


Orbis当前展示出来的重点则更加集中,它希望让AI生成的世界持续运行,并且可以在运行过程中不断接受新的指令。


Visko将这类模型命名为Live Model,理解它最简单的感受,就好比看一场AI直播。


普通视频模型的逻辑很固定:输入提示词,等待模型运算,最终输出一段几秒到十几秒的成品视频。Orbis这一类则不一样,画面会不间断持续生成,音频同步输出,看到一半,用户还能追加新指令,直接改写后续内容。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


最近这类体验正加速成为现实,最直接的推动因素,在于 AI 视频生成速度正在快速逼近实时播放的节奏。


MiniMax H3发布后,fal又推出了经过后训练和推理优化的H3 Max,一段五秒视频可以在三秒以内完成生成,速度已经快过视频本身的播放时间。


当生成速度达到这个区间以后,视频模型的用法也开始发生变化,最近火起来的H3 AI直播实验,本质上还是不断准备下一段视频,再把这些片段送进播放队列。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


Orbis的实现思路不一样,持续推演是模型原生能力,开启一次会话之后,画面会持续推演,用户后续给出的指令,也会作用在同一会话当中。


当然,布局实时生成路线的并不只有Visko。过去一年,国内多家视频、世界模型团队都推出了相关成果,大家解决的问题各有侧重。


昆仑万维的Matrix Game 2.0去年就已经可以根据用户的键盘和鼠标操作实时生成画面,在通用场景里持续向前推演。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


到了今年的Matrix Game 3.0,又进一步加入长期记忆,在720P下最高达到40 FPS,并尽量维持长时间运行时的空间和场景一致性。


爱诗科技的PixVerse R1今年年初就开始尝试持续运行的实时世界,用户可以在生成过程中继续输入提示词,让画面实时响应。


到了 4 月,R1 又加入多人共享世界,几个人可以在同一个实时画面里共同影响接下来的内容。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


阿里也做了Happy Oyster,它同样强调实时可交互,用户可以通过文字、语音或者图片继续改变正在生成的世界。


产品还做了导演和漫游两种形态,一种更像站在镜头外控制接下来的剧情,另一种则让用户以第一人称进入画面里继续探索。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


生数科技又公布了Vidu S1,它把实时交互进一步放到了人物身上,用户可以直接通过语音改变角色接下来的动作和行为,公开结果最高可以跑到42 FPS,也支持持续生成。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


它们背后的共同变化也很明显,视频模型开始不满足于一次生成一条成片,而是尝试让画面一直存在,并在用户输入发生变化以后继续往下走。


Orbis也在这个赛道里,Visko将更多重心放在一个很现实的问题上,当画面连续运行几十分钟,模型究竟还能留存多少过往信息。


Orbis为此做了一套多尺度记忆机制,模型会持续保留人物、场景和风格里比较重要的信息,再拿这些记忆帮助后面的画面继续生成。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


目前团队展示的结果可以维持到小时级。Visko对Live Model的构想,其实比Orbis当前展示出来的能力更大。


Orbis先把持续生成、实时交互和记忆做进视频世界里,而团队设想中的Live Model还需要持续感知外部信息,在运行过程中不断更新状态,甚至继续学习,并进一步理解现实世界里的物理变化。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


Visko会选择这样的方向,多少也和创始人的经历有关。他本科就读于天津大学土木工程相关专业,后来进入Stanford攻读博士,长期研究计算力学、材料建模和物理模拟。


完成博士训练后,他又进入Columbia相关研究团队工作,后来加入Apple,继续从事工程与研发。


进入生成式AI以后,他研究的对象变成了一个由模型创建出来的视觉世界。这个世界要持续运行,也要尽量遵循运动规律,还要记住此前发生的状态。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


Visko目前只有16名成员,团队整体也明显偏研究和工程。


哥伦比亚大学教授WaiChing Sun也在Visko的顾问阵容中,他长期研究计算力学,也是 Qing Yin 过去的学术合作者。


Orbis 1.0的另一位项目负责人Jie Yang来自Stanford,团队成员经历还覆盖苹果、Google DeepMind、Meta、亚马逊和特斯拉。


产品侧由Ying Yang负责,她此前参与过Lovart、Wanderboat,也加入过Manus Fellow Program。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


Berkeley教授Michael I. Jordan也参与公司的顾问体系,并担任Advisory Board Chairman。


Visko出现的时间也刚好踩中了一个节点。AI 视频已经经历了很长一段画质竞争,各家公司不断解决人物一致性、运动自然度和镜头控制。


直播只是最容易理解的一个例子。一个模型如果可以持续运行并接受实时指令,就可以成为虚拟主播背后的画面引擎,也可以服务互动故事。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


用户的一句话可能改变人物下一步的行动,观众的评论也可能影响接下来出现的环境。内容不需要提前全部制作完成,它可以随着参与者的行为继续生长。


游戏也很容易和这条能力联系起来。传统游戏里的场景、人物动作和剧情分支都需要提前制作,生成模型加入以后,部分视觉内容可以临时产生。问题在于游戏无法接受十几秒甚至几十秒的等待。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


这类实时世界模型如果能够保持低延迟,同时维持人物和环境的一致性,它就有机会成为实时互动内容的一部分。


当然,这些应用目前大部分仍处于演示或者早期产品阶段。实时生成需要持续消耗大量算力,长时间稳定也远没有完全解决。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


尤其是这批以实时视频为主要输出的世界模型,目前呈现给用户的核心依然是像素画面。


距离准确描述几何结构、物理状态,并稳定服务机器人训练的完整模拟环境,还有不少问题需要解决。


李飞飞发布世界模型这天,Visko也让AI视频开起了直播


Visko将自己对这类模型的理解归纳为Live Model。它的关注点是让模型启动之后持续运行,保留此前的重要状态,在新的输入到来以后继续预测并更新这个世界。


Orbis 1.0是这套理念目前最直观的落地成果,伴随实时生成技术不断成熟,视频模型需要攻克的命题也会发生转向。


往后AI视频的较量,除了单次能产出多长素材,也会落脚在虚拟世界可以持续运转的时间。


文章来自于微信公众号 “虾蛄AI”,作者 “虾蛄AI”

关键词: AI新闻 , AI视频直播 , Visko , Orbis
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
OWL

【开源免费】OWL是一个完全开源免费的通用智能体项目。它可以远程开Ubuntu容器、自动挂载数据、做规划、执行任务,堪称「云端超级打工人」而且做到了开源界GAIA性能天花板,达到了57.7%,超越Huggingface 提出的Open Deep Research 55.15%的表现。

项目地址:GitHub:https://github.com/camel-ai/owl

2
OpenManus

【开源免费】OpenManus 目前支持在你的电脑上完成很多任务,包括网页浏览,文件操作,写代码等。OpenManus 使用了传统的 ReAct 的模式,这样的优势是基于当前的状态进行决策,上下文和记忆方便管理,无需单独处理。需要注意,Manus 有使用 Plan 进行规划。

项目地址:https://github.com/mannaandpoem/OpenManus


3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

4
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales