扩散语言模型驱动的实时交互视频模型:SigmaZ 完成数百万美元融资
扩散语言模型驱动的实时交互视频模型:SigmaZ 完成数百万美元融资Pixel 擅长表达 appearance,Code 擅长表达 structure;未来会进入 Pixel-Code 联合的视觉表达。
来自主题: AI技术研报
8323 点击 2026-08-20 10:54
搜索
Pixel 擅长表达 appearance,Code 擅长表达 structure;未来会进入 Pixel-Code 联合的视觉表达。
我们先来看两个画面。
对着摄像头比了个手势,桌上凭空多了只企鹅
如果 2024 年我们还在感叹 Sora 模拟物理世界的真实感,那么在 2026 年的今天,单纯的高清视频生成已不再是终点。
初创公司 Xmax AI 推出的首个虚实融合的实时交互视频模型 X1,没有复杂的 Prompt,不需要漫长的渲染等待,只需要手势进行交互,就可以让虚拟世界与现实相连,在镜头中令「幻想」成真,让用户体验到实时交互的心流体验。