300多组控制实验、70万余TPU小时,普林斯顿团队给出全开放文生图配方i1
300多组控制实验、70万余TPU小时,普林斯顿团队给出全开放文生图配方i1近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。
搜索
近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。
OpenAI 可能正在测试一款新的 AI 图像模型。 这两天,多名海外用户发现,一个名为 luna-lisa-alpha 的神秘模型出现在 LMArena 测试平台中。从目前流出的测试结果来看,luna-lisa-alpha 重点提升了几个方向,包括人物一致性、图像真实感、文字生成能力,以及此前 GPT Image 系列一直存在的噪点问题。
毫无疑问,四月份发布的生图模型 GPT-Image-2,现在依然是当之无愧的 AI 生图之王。
训练一个顶级文生图模型,到底需要多少钱?
用 AI 生图的人,应该都体会过这种痛苦。
Meta 旗下的超智能实验室 Meta Superintelligence Labs 推出了图像生成模型 Muse Image,并同步预览了 Muse Video。目前,Muse Image 已经接入 Meta AI 应用、网页端以及部分地区的社交平台,Muse Video 也即将向创作者开放。
文本生成图像的领域早已经是一片红海,看上去已经卷无可卷了。
来自西湖大学和香港中文大学(深圳)的团队沿着这一思路提出 Drifting Preference Optimization(DrPO),把漂移场用于单步文生图模型的偏好后训练。在 DrPO 中,奖励只负责对候选图像排序,不参与反向传播。具体而言,针对同一个文本提示词,当前模型生成一组候选图像。高分样本在特征空间中产生吸引,低分样本产生排斥,并结合参考模型约束给出模型的更新方向。
近年来,文生图模型的能力快速提升。从 Stable Diffusion 到 FLUX、Qwen-Image,扩散模型已经能够生成高质量图像,也能处理越来越复杂的文本提示。
用强化学习(RL)优化文生图模型的 prompt following 能力,是一条被广泛验证的路径 —— 让模型根据 prompt 用不同随机种子生成多张图片,通过 reward model 计算 reward,再利用相关 RL 算法优化模型。