AI互动内容公司发布后训练模型 Yoroll H3 Superfast

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
AI互动内容公司发布后训练模型 Yoroll H3 Superfast
8895点击    2026-09-07 17:45

下一幕,由你的想法决定


下一个应用爆发的机会:实时视频生成来临之时


过去两年,AI 视频比的是生成质量;从过去两周起,比的是推理速度和实时性。基于 MiniMax H3 后训练视频模型的实时交互、GPT-6 和 Fable 5.1 的新一代模型跃升,在同一周撞到一起。AI 应用和模型迎来新的机会:视频不再是内容的终点,它正在变成互动娱乐的基础设施。


一、模型代有才人出,各领风骚半个月


模型层的缩圈战争仍在加速,Anthropic 和 OpenAI 相继发布 Claude Fable 5.1 和 GPT-6 Astra,GPT-6 官方把它定义为在计算机使用、软件工程等方向上的代际跨越,RSI 和 AGI 似乎不再遥远。得益于这些能力,大家纷纷开始尝试 Blender 建模和 3D 游戏开发,游戏玩法的 AI 生成第一次逼近可玩可用,Coding 和 3D 作为视频生成的参考素材也被大家纳入了新的技术方案。


而在多模态上,8 月初 MiniMax 开放 H3 的权重:一个 33B 参数的稠密视频模型,文本、图像、视频、音频在同一个上下文里,生成的视频自带对白、音效和配乐。开源的意义不在模型本身多强,而在于把“后训练”这件事交给了整个社区——LoRA、蒸馏、量化、稀疏注意力,几十个团队同时在同一个底座上做加速和后训练。


跑得最快的是 fal —— 一家领先的中转站和推理基础设施公司。它先对 H3 做了后训练,再搬上自家推理引擎,得到 H3 Max:768p 带音频的 5 秒片段,3 秒出片,成本也显著降低。


下一个应用爆发的机会:实时视频生成来临之时


社区比 fal 还快。几天之内,开发者做出了无限刷的短视频流、由 RSS 和社区讨论喂养的 24 小时 AI 新闻台、实时你画我猜、约会模拟器、分支式文字冒险。大多粗糙,但它们证明了一件事:当生成时间小于播放时间,“视频”就不再是被制作出来然后被观看的东西,它可以被当场决定。


Manus 的联合创始人张涛,也在即刻和朋友圈发文:“下一个应用爆发的机会:延迟为一秒内的 seedance 来临之时。正好是两个月前发的,再强调一次”。


下一个应用爆发的机会:实时视频生成来临之时


判断确实如此,除了社区开发者,一些公司其实已经在潜伏和发力了。AI 互动内容公司 Yoroll 刚发布了自己的后训练模型 Yoroll H3 Superfast,4 秒耗时即可推理 10 秒视频,并上线了由它驱动的实时叙事产品 YoLive


而它背后的公司,恰好也是在 AI 互动游戏和互动视频上积累最早、作品最多的公司之一。


下一个应用爆发的机会:实时视频生成来临之时


在此之前,这家公司和它平台上的创作者已经拿到过几个数字:


《丧尸清道夫》和《民国诡事》Steam 心愿单超过 5 万;《华君传:翻牌吧女帝》登陆抖音小游戏一个月,玩家达到 200 万;一位个人创作者花两天做出的《AI Odyssey》,冲上过美国 X 趋势榜第一


二、快过实时的视频做出来了,但它能被玩吗


根据官方的描述,Yoroll H3 Superfast 是基于开源 MiniMax H3 做后训练与推理加速的版本,官方定位一句话:“为游戏而生,而不只是为电影。” 数字是:10 秒、768p、24fps、带原生音频的视频,8 张 B200 上 4 秒生成,2.5 倍实时,跑在 Yoroll 自己的推理栈上,使用大量游戏录屏数据来后训练。作为对照,fal 的 H3 Max 是 5 秒片段 3 秒内出片,约 1.7 倍实时。Superfast 已在 Yoroll 创作者平台上线。


与此同时,Yoroll 还发布了基于这个模型的新产品 YoLive(yo.live[1]),产品形态非常直接:一部大家共同参与、持续向前发展的互动剧情游戏


下一个应用爆发的机会:实时视频生成来临之时


进入 YoLive,观众看到的是一个持续播放的 AI 互动剧情频道。任何人都可以提出下一幕应该发生什么——让机器人跳舞、来一场天台追逐、加一个谁都没想到的反转——其他人为这些提议投票,得票最高的方向被系统结合已经发生的剧情、人物关系、当前地点和任务状态续写成新的影像,由 H3 Superfast 模型当场生成。第一个开放的频道来自《丧尸清道夫》:机器人牛仔、模特、鸵鸟和那片原子朋克废土构成了稳定的角色与世界,观众在这个世界里决定故事往哪走。


AI互动内容公司发布后训练模型 Yoroll H3 Superfast


这让弹幕第一次有了实际参与的功能。以前大家在同一部作品旁边聊天,现在聊天进入了作品本身。一个人在意角色命运,一个人想制造笑点,还有人专门负责把故事带偏——不同意图撞在一起,成了下一幕的素材,也成了留在直播间的理由。对参与者来说,最有吸引力的瞬间是“刚才那个主意是我提的”。


下一个应用爆发的机会:实时视频生成来临之时


实时生成和直播玩法已经上线 Yoroll App 和抖音直播间


比 YoLive 更能说明“实时生成是一种玩法”的,是平台上创作者正在孵化的一批小游戏。它们的共同点是:用 Yoroll Code 写玩法,用 H3 Superfast 的 API 生成画面,实时输入直接改变剧情。目前都在开发与探索阶段,但题材已经很鲜明。


下一个应用爆发的机会:实时视频生成来临之时


在这批小游戏里,“实时”已经被放进了具体的交互设计。《相亲战士》让玩家按喜好定制相亲对象,通过自由对话和行动推动约会:一句试探、一个大胆的举动,都可能把下一幕带向不同的方向。《主播开箱模拟器》把直播间的弹幕变成送礼指令,观众决定箱子里装什么,AI 生成随之而来的开箱过程与主播反应——惊喜还是惊吓,由玩家出题。《火柴无限冒险》则让玩家自由决定纸上火柴人的行动:换一种身份,想一个出人意料的脱身办法,甚至提出预设选项之外的答案,AI 再把这些想象续写成新的画面与剧情。实时生成最直接的变化,是把玩家的想法变成游戏里接下来发生的事。


下一个应用爆发的机会:实时视频生成来临之时


基于 H3 Superfast 模型的 UGC 实时游戏《相亲战士》


这些游戏体量都不大,但它们是我们见到的第一批把“下一幕由玩家的输入决定”当核心循环、而不是当宣传噱头的作品。


下一个应用爆发的机会:实时视频生成来临之时


Yoroll Code 玩法和关卡开发工具已支持 GPT-6 Astra 和 H3 Superfast


三、AI 做出来的内容,为什么有人愿意玩


Yoroll 不是因为实时生成到来才入场的公司。正相反,它在这条赛道上做得很早、做得够多:小游戏拿到了玩家数据的验证,大型游戏已经达到精品程度,头部创作者已经进来。实时生成也好,预生成也罢,用户和玩家最关心的还是好的故事、有趣的玩法、上瘾的互动。


Yoroll 上首批创作者制作的《华君传:翻牌吧女帝》,是女性向互动内容,8 月登陆抖音小游戏后,不到一个月时间玩家就达到了 200 万,成为目前据我们所知玩家数量最多的 AI 互动影游之一。


下一个应用爆发的机会:实时视频生成来临之时


《华君传》介绍和 200 万玩家


在海外,一位北美创作者在 Yoroll 上用两天时间和大约 250 美元,做出了《AI Odyssey》——包含 140 多段视频、11 个结局的竖屏互动影游,上线了 Yoroll 平台和 TikTok Minis 小游戏。恰逢诺兰《奥德赛》电影上映的热度,这款 AI 奥德赛互动游戏一度冲上美国 X 趋势榜第一


下一个应用爆发的机会:实时视频生成来临之时


而在大型游戏上,Yoroll 也在带着几款头部 AI 游戏杀入传统大型游戏工作室的领地。


下一个应用爆发的机会:实时视频生成来临之时


上周在德国科隆,全球最大游戏展 gamescom 的 Yoroll 展台,坐到电脑前的玩家,大多以为自己会看一部 AI 短片——《丧尸清道夫》原本就是一部传播颇广的 AI 短片。


但试玩版的结构比 Steam 页面此前披露的复杂得多。除了互动影游常见的选项和 QTE,还有场景探索、第三人称射击和放置塔防。玩家控制机器人男主进入海滩清理丧尸,进入地铁站后视野收窄、尸潮涌来;操作段落结束,回到电影化叙事,背包、武器、数值这些状态被带进后续段落。


AI互动内容公司发布后训练模型 Yoroll H3 Superfast


目前 90 分钟的实机试玩版,在科隆游戏展的试玩数据中玩家平均体验时间超过半小时。海外玩家的第一反应,是一款看起来像 AI 电影的游戏,竟然真的可以进入空间移动、探索和射击。这说明,AI 内容也是可以打动硬核玩家的。


这些游戏背后的玩法和系统,都已经变成了 Yoroll 的创作平台能力。当 AI 视频的质量越来越高、玩法的编程越来越好、实时生成越来越快,互动娱乐产品的爆发就即将来临。


四、开源模型作为基座拉平了大家的起跑线


回到模型,有一个有趣的问题:H3 开源一个月,几十个团队在同一个底座上做后训练,为什么 fal 和 Yoroll 这样的公司能交出不错的答卷?


把视角拉远一点看。大语言模型今天是“两超多强”:GPT 和 Claude 两家闭源领跑,多强几乎全是开源——DeepSeek、Qwen、GLM、Kimi K3 等等。开源的多强没有赢下基准,却赢下了应用层:更低的成本、更开放的生态(不会被封号或者限制并发)、拿更强的底座为应用自己的场景去调模型。视频模型的格局是“一超多强”,多强里大半是国内团队,过去也几乎都闭着。H3 把权重放出来之后一个月里发生的事,和 DeepSeek 开源之后那半年 LLM 应用层发生的事很像:LoRA、蒸馏、量化、稀疏注意力,同一个底座上长出多个版本,模型本身不再是稀缺品。


下一个应用爆发的机会:实时视频生成来临之时


OpenRouter 上最近一个月 LLM 的调用榜单


开源拉平的是模型层的起跑线。没有拉平的是三样东西:推理栈、数据、产品。


fal 占的是推理栈和开发者。它本来就是做推理基础设施的,H3 Max 的快,一部分来自后训练,另一部分来自把模型搬进自家推理栈。fal 把“比实时更快”做成了公共品,任何人都能按秒买到。


Yoroll 占的是数据和产品。这也是它要做一个自己的版本、且能做一个自己的版本的原因。


首先是数据。Yoroll 从做互动影游和 3D 游戏的第一天起,就在积累一类别人没有的素材:游戏内影像。第一方长内容,加上创作者平台上的作品,留下了大量带分支、状态和玩法标注的镜头——什么样的画面接在什么样的选择之后,一个角色在 90 分钟里如何保持一致,射击段落和播片段落之间如何衔接。通用视频模型的训练数据来自电影和短视频,它擅长“拍”,不擅长“玩”。H3 Superfast 的后训练,就是拿游戏内数据去补它:游戏美术风格的稳定性、长序列中的角色一致性、镜头与玩法节奏的配合,以及为世界模型预留的动作控制(action control),让模型能根据玩家的操作而不只是文字提示来续写画面。


其次是产品。速度只有被消耗掉才有价值。Superfast 发布当天就有三个地方在用它:创作者平台上生成视频,YoLive 里接观众的投票,实时互动小游戏。每一次提速都直接落到玩家手里,玩家的反应又回来告诉模型团队该先修什么——角色没执行动作,道具前后消失,画面接不上。只做模型的公司难以拿到这些问题,只做应用的公司过去拿不到模型;开源解决了后一半,前一半只能靠自己做 C 端产品。


最后是推理栈。实时生成的更大难点,其实是在于推理优化和加速。Anthropic 欲以 60 亿美元收购 Decart (AI 互动视频和实时生成公司),很大程度上也是看重团队的这部分能力和积累。据了解,Yoroll 母公司 LinearGame 正在洽谈投资一家 AI 推理芯片公司,双方深度合作、软硬件协同优化,通过“云+端”的专用芯片来进一步落地实时推理生成,解决速度和成本问题。


下一个应用爆发的机会:实时视频生成来临之时


开源底座会一代一代换,能跟着迁移的只有数据、产品和推理栈。这三样是在这一轮里真正能积累的东西。


五、未来属于“预生成 + 实时生成 ”


预生成负责打磨,实时生成负责回应。 主线、角色和关键场景提前制作,玩家未被预设的提问与行动,由实时生成接续。规则和状态系统负责记住发生过什么,保证故事与玩法连贯。


成本会决定两者的分工:多人共看、共同参与的实时流更容易分摊成本;个人化互动需要付费意愿支撑;可自由探索的持久世界,则有待控制能力与推理成本进一步改善。


作品也可以边被玩、边生长:先交付主线,再把玩家感兴趣的角色、空间和互动,打磨成后续内容。


长期竞争力来自内容与 IP、交互数据、创作工具、发行能力和推理成本控制。Yoroll 正在这些方向上积累。但最终,作品仍要回答:好不好玩,谁愿意花时间,谁愿意付费。


下一幕,从你的一个弹幕选择开始。


下一个应用爆发的机会:实时视频生成来临之时


参考资料


[1]yo.live:http://yo.live/


文章来自于微信公众号 “十字路口Crossing”,作者 “十字路口Crossing”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
OWL

【开源免费】OWL是一个完全开源免费的通用智能体项目。它可以远程开Ubuntu容器、自动挂载数据、做规划、执行任务,堪称「云端超级打工人」而且做到了开源界GAIA性能天花板,达到了57.7%,超越Huggingface 提出的Open Deep Research 55.15%的表现。

项目地址:GitHub:https://github.com/camel-ai/owl

2
OpenManus

【开源免费】OpenManus 目前支持在你的电脑上完成很多任务,包括网页浏览,文件操作,写代码等。OpenManus 使用了传统的 ReAct 的模式,这样的优势是基于当前的状态进行决策,上下文和记忆方便管理,无需单独处理。需要注意,Manus 有使用 Plan 进行规划。

项目地址:https://github.com/mannaandpoem/OpenManus


3
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales