ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事
ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。
搜索
过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。
前两天发了个深度思考的Prompt,没想到大家反馈还挺好,然后也有人说,能不能把过去我写过以及一些最有用的Prompt整理个合集,再给大家分享一下。 然后我就翻了一下,才发现过去几年,确实已经零零散散
用 AI 做视频的同学总有这样的痛苦:提示词也不是没认真写,运镜方向、人物走位、画面构图交代了一大段,但模型给出的画面总是差着一截,运镜偏了几十度,人物走到中途消失,镜头速度前半段稳后半段飘。
玩 AI 视频有一段时间了,经验说不上多,但有一件事我算是想明白了:提示词这条路,走到头也就那样。
前几天,我在推特上刷到了一条很有意思的分享。
最近来自斯坦福大学、CMU、MIT、UT Austin 等高校和科研机构的研究人员联合发布了全球首个系统提示词库 System Prompt Index(systempromptindex.ai),其中汇集了来自 Claude、ChatGPT 等 400 多款 AI 产品的 1000 余个系统提示词,是目前全球规模最大的 AI 系统提示词库。
继Loop Engineering、Graph Engineering等概念进入讨论之后,一篇2026年7月底发布的论文又提出了一个更贴近Prompt本身的工程概念:Prompt Graph Engineering,提示词图工程。
《仅需》6.9亿个token、423美元和1条提示词,就能做出一款火遍全网的美式水上快艇竞速游戏。
最近,电影的制作团队 Higgsfield 公开了这部名为《Hell Grind》地狱磨砺的完整制作资料。每一幕每一场,累积十万多个资产,生成的视频不计其数,我们都能在 Higgfield 公开的项目地址查看。
且不论性能,自Claude Opus 5发布以后有一件事让AI圈特别在意,就是Anthropic在提示词上的改进。