训练一个顶级文生图模型,到底需要多少钱?
Qwen-Image、HunyuanImage 这些优秀的开源模型,预训练动辄用掉数十亿张图像;而 GPT-Image-2、Nano-Banana-Pro 等闭源系统虽然效果惊艳,其内部实践却始终不对外公开。对于绝大多数研究机构来说,这条赛道的入场券太贵了。
近日,华为香港莱布尼茨研究所小艺团队与港大、港科大、港中文等 6 校联合发布了 Boogu-Image-0.1—— 一个仅用 2.08 亿张独立图像、理论训练成本约 40 万美元,就在多个基准上做到开源第一、逼近闭源水平的统一多模态模型家族。模型权重、代码与训练配方已全部以 Apache 2.0 协议开源。Boogu 系列模型是最早支持原生 2K 的开源模型之一,并支持华为昇腾 Ascend NPU,vLLM-Omni 框架等, ModelScope 和 ComfyUI 均已上线。



Boogu 团队的核心判断是:图像生成正在从 Text-to-Image 走向 Requirement-to-Image。
用户早已不满足于给一句描述性 prompt—— 他们希望模型能理解复杂意图、隐含约束、多层指令,甚至跨模态上下文。而现实需求又极度多样:有的只想快速出图,有的需要精细排版的海报。单一模型配置很难同时服务好所有场景。
因此,Boogu 把「理解」提升为与数据质量、训练配方同等重要的一等公民,并将其拆解到系统的每一个环节:


在 Boogu 自建的 Arena 盲测中(与公开 LMArena 排名的 Spearman 相关系数达 1.0, Pearson 相关系数 0.986),Boogu-Image-0.1-Turbo-Thinking 以 1048 的 Elo 位列开源第一,仅次于 GPT-Image-2 和 Nano-Banana-Pro。在新发布的 Qwen-Image-Bench 上,其 Base-Thinking 变体在中英文双语下均取得开源模型最佳总分;编辑模型 Boogu-Image-0.1-Edit-Thinking 更是在 ImgEdit-Bench 上拿下全场最高的 4.64 分。






这份 71 页的技术报告有意思的地方,不只是结果,还有大量业内「靠试错才能学到」却很少被写进论文的细节。
公开基准正在失效。团队用 6 个近期模型对比了 LMArena 人类偏好排名与 GenEval、DPG-Bench 分数,发现明显的排名倒挂:人类偏好最强的 GPT-Image-2 在两个学术基准上只排中游。团队直接宣布不再把这些基准作为主要评估,并呼吁社区重新审视其适用性 —— 甚至坦率指出自家模型在 ImgEdit-Bench 上分数虽高,但人评中仍不如 Nano-Banana-Pro。

「“足够” 的数据」是不够的,但结构化的数据可以很省。团队用 1.87 亿开源数据训练的模型明显撞上性能天花板;而利用少量按人类先验组织的「Boogu Syllabus」教学大纲式数据(仅 2162 万独立样本)进行后训练反而能全面提升性能。原则很朴素:系统性细粒度拆解、能力全覆盖、每个类别数据量充足 ——「如果模型训练时没见过猫,就默认它画不出猫」—— 数据的精细的 “质” 大于朴素地堆砌 “量”。
几个可复用的量化结论。一个汉字要被稳定渲染,训练中至少需要约 300 次曝光;覆盖 3500 个现代常用字即可满足日常中文渲染需求。让模型记住一个从未见过的人物身份,需要约 4500 次语言匹配的曝光 —— 团队用一位志愿者(也是论文作者之一)的 170 张日常照片做了完整消融。

不要盲目过滤「坏数据」。水印、过曝、运动模糊的图片不必丢弃 —— 只要在 caption 里明确详细地描述缺陷,它们反而能让模型学会理解并可控地规避(或复现)这些视觉元素。
慎用 RL。重度美学 RL 会让输出分布坍缩:让模型画「一位六十岁的中国女性」,重 RL 模型倾向输出精致妆容的理想化形象。Boogu 选择把人类偏好放进理解系统而非烙进生成器,只在肢体结构、文字渲染等不损害多样性的问题上使用 RL。
此外,作为最早的原生 2K 训练的开源模型之一,团队发现标准的动态时间偏移策略在 2K 分辨率会产生「过度挤压」效应导致收敛变慢,并给出了简单有效的截断修正方案;附录还提出了免训练的推理增强方法 BOG(Boosted Orthogonal Guidance),把 DiT 预测视为二维矩阵做结构化归一化,强化垂直于 flow 流场的信息,一定程度提升照片摄影艺术质感。
Boogu-Image-0.1 当然有局限:世界知识仍落后于头部闭源系统,文字渲染只优化了中英双语,复杂多人交互场景仍会出现肢体畸变。但在 40 万美元的预算约束下,它给出了一条可复现、可验证的路径 —— 并把过去藏在工业团队内部的工程经验摊开在了论文里。
正如团队在结语中所说:希望 Boogu-Image-0.1 让图像生成向「真正理解用户想要什么」的系统迈进一步。
Boogu 团队来自华为香港小艺大模型应用实验室(莱布尼茨所),联合香港大学、香港科技大学、香港理工大学、香港城市大学、香港中文大学与南京大学共同完成。项目负责人为 Chenyang Lei,通讯作者包括 Chenyang Lei、Rui Liu 与 Chao Huang。团队致力于以理解驱动的统一智能体多模态生成研究,模型、代码与训练配方均以 Apache 2.0 协议开源。
文章来自于"机器之心",作者 "机器之心"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0