实时视频版「Nano Banana」来了!京东开源160亿参数AI视频模型JoyAI-Video-Edit
实时视频版「Nano Banana」来了!京东开源160亿参数AI视频模型JoyAI-Video-Edit新智元报道 这个 8 月,AI 视频赛道的军备竞赛又升级了。 字节跳动发布 Seedance 2.5,把单次视频生成时长从 15 秒翻倍到 30 秒。同一天 MiniMax H3 开源,价格只要闭源旗
搜索
新智元报道 这个 8 月,AI 视频赛道的军备竞赛又升级了。 字节跳动发布 Seedance 2.5,把单次视频生成时长从 15 秒翻倍到 30 秒。同一天 MiniMax H3 开源,价格只要闭源旗
当下计算机视觉长期陷入“一任务一专用模型”内卷: 做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。
昨天躺床上刷手机,突然看到阿里计划发布他们目前最新的生视频模型:Wan3.0。在千问创作PC端(c.qianwen.com)公测,逐步开放。并且,全能参考,相比sd的视频、文本、图片、音乐4个基础模态,Wan3.0还支持了网页链接、word等文档。
这两天,AI圈百家争鸣。GPT-6曝光、DeepSeek V4 Flash公测、SD2.5发布、MiniMax多模态开源视频模型发布……
就在刚刚,字节跳动正式发布了自研视频模型Seedance 2.5,而我们熟悉的「即梦AI」作为模型的官方体验入口也第一时间妥妥接入。贴心的我呢,也直接帮友友们把这次新模型最夯夯夯夯的能力都扒好了,咱先一睹为快——
一个苹果从树上落下,今天的视频模型大多能生成一段「看起来正确」的运动:苹果向下、速度加快,最终落地。
我们先来看两个画面。
对着摄像头比了个手势,桌上凭空多了只企鹅
蚂蚁灵波选择了后一条路:开源 LingBot-Video。这是一个面向具身智能的视频生成基座模型,也是一套专为机器人场景设计的 DiT 视频预训练范式。通用视频模型更多学习画面变化、镜头运动和视觉风格;LingBot-Video 则把重点放在动作、任务、交互和物理环境变化上,面向世界预测、动作理解和机器人训练构建视频生成基座。
PJ Ace 在推文中兴奋地表示,他们借助 Utopai Studios 推出的下一代 AI 视频模型和智能体 PAI2.0, 以好莱坞灾难片大师罗兰·艾默里奇(Roland Emmerich)的视听风格,硬核「复活」了一段 250 年前激情澎湃、颠覆想象的美国独立日「真实历史影像」。