过去,在灵光闪应用中,用户需要等到应用生成完成,才能看到完整的页面设计和视觉效果。
在画眉的专业设计场景中,设计师拿到成图后,还要经过拆层处理,通常需要 5 分钟以上才能继续编辑。
一个需要更早看见设计,一个需要继续编辑设计。两个场景指向同一个问题:AI 设计还需要从“能够生成”,进一步走向“可预览、可编辑、可交付”。
今天,我们正式开源 Ming-Image-0.1-Design 系列,包含两个参数量均为 6B 的模型:
同时开源 Design Skill 和 PPT Skill,将模型能力继续连接到前端页面与可编辑演示文稿。
从生成设计、拆解图层,到进入 Coding、PPT 和设计工具,这次发布希望解决的不是“再生成一张图”,而是怎样让生成结果继续被使用。

两个 6B 模型,
把设计生成和后续编辑接起来
Design 先把完整设计画出来
UI、Dashboard 和信息图不同于普通图片。模型需要同时处理文字、功能模块、视觉层级、配色和布局;少一个字、按钮位置偏移或卡片关系混乱,都可能让结果无法直接使用。
Ming-Image-0.1-Design 因此重点增强了四项能力:
相比通过代码多次调用通用生图模型,分别生成背景、插画和装饰,端到端生成拥有更完整的全局控制,能够减少素材之间色系冲突和画风不一致。
Layer 将设计变成可编辑资产
它做的不是普通抠图,而是在恢复一张设计图背后的结构。
设计生成后,文字还会修改,人物需要移动,背景可能替换,商品和装饰也需要单独复用。
Ming-Image-0.1-Design-Layer 可以将设计图拆成 2—9 个语义独立的 RGBA 图层,侧重广告海报、PPT、UI/UX、信息图、电商主视觉和模板再创作等场景。
模型按照文字、卡片、主体和背景等设计角色组织图层,保留透明边缘,补全被遮挡区域,并保障所有图层重新组合后的结果一致性。

Layer 为什么能够拆得更准
模型通过 Type Token 告诉每个图层自己承担的设计角色;Alpha-Aware Layer Optimization 重点优化透明区域和边缘;Composite-Layer Stack Consistency 则通过重新合成检查各图层能否还原原图。
对应到使用体验,就是内容分得更清楚、边缘更干净,叠回去以后也更接近原始设计。

图1:Ming-Image-0.1-Design-Layer 模型架构。模型结合图层类型条件、Alpha 感知优化和重组一致性约束,使各图层保持语义独立和透明边界,并在重新合成后尽可能还原原始设计。
6B 参数进入设计模型第一梯队
Design 位列 AA UI/UX Design 榜单开源第一
在 Artificial Analysis 于 2026 年 9 月 18 日更新的 UI/UX Design 专项评测中,Ming-Image-0.1-Design 位列开源模型第 1,Elo 得分为 1082。
模型在 UI/UX 场景中的版式胜率达到 67.4%,复杂构图达到 67.0%,文字渲染达到 66.7%。
这些能力对应的正是真实页面中的核心问题:信息能否排清楚,多模块能否保持协调,文字能否准确呈现,多张页面能否使用同一套视觉语言。
在具体案例中:
这说明 6B 并不意味着降低对复杂设计任务的要求。通过面向文字、版式和多元素组合进行专项训练,小参数模型同样可以进入大模型竞争区间。

图2:Artificial Analysis UI/UX Design 开源模型排名

图3:果园dashboard要同时画出果园地图、采摘状态、图表和操作按钮。

图4:三个步骤页的食谱 App 要共用同一套视觉语言。
Layer 在 Crello 12 项指标中全部最优
对于 Ming-Image-0.1-Design-Layer,我们关注三个问题:
在 Crello-Test 图层解耦评测中,Ming-Image-0.1-Design-Layer 在 RGB L1、Alpha soft IoU 两项指标,以及 MLM-0 至 MLM-5 六档设置下均取得最优结果,即 12 项结果全部排名第一。
即使与未开源、并使用 Crello 训练集微调的 Qwen-Image-Layered-I2L 版本相比,Ming-Image-0.1-Design-Layer 仍全面保持领先。
在相同软硬件和统一评测条件下,6B 的 Ming-Image-0.1-Design-Layer 在质量优于 20B Qwen 官方开源版本的同时,将单次推理时间从 795 秒降低至 183 秒,速度提升约 4.3 倍。经过工程优化,当前 1024 分辨率的端到端服务通常约 20 秒即可返回完整结果。

走进真实业务,
改变不只发生在效果上
灵光闪应用:提前预览设计,最终应用高度还原
灵光闪应用让用户通过自然语言生成可实际操作的小应用。
过去,在应用生成过程中,系统虽然会持续展示编写进度,但用户要等到应用完成后,才能看到页面的布局、配色与整体效果。
接入 Ming-Image-0.1-Design 系列后,设计预览被前置到应用生成的初始阶段。Design 根据用户需求,端到端生成布局完整、风格统一的应用预览,让用户提前看到应用最终的视觉方向。随后,Agent 调用 Layer 拆解设计素材,并结合设计文档完成代码生成,使最终应用在页面结构、视觉风格与细节元素上和预览保持高度一致,带来更接近“所见即所得”的体验。
这一变化不只是让用户“更早看见”。Design 能够从全局统筹布局、配色与素材风格,减少多次生成和代码拼装造成的风格割裂、模板感与拼接感,让 AI 生成的应用拥有更完整的主题表达和更统一的设计语言,更接近经过系统设计的产品。
注:接入 Ming-Image-0.1-Design 系列模型的闪应用目前正在内测,将于近期与大家见面,带来更统一、更可控、更高效的应用生成体验。
画眉:从先出图再拆解,变成约 40 秒获得可编辑图层
在专业设计中,生成图片通常只是起点。文案会继续调整,主体需要移动,背景和颜色可能替换,设计也会随着需求不断完善。
旧流程需要先生成图片,再进行抠图、拆层和调整。首次获得可编辑图层通常需要 5 分钟以上。
画眉接入 Ming-Image-0.1-Design-Layer 后,可以直接将图片转换为语义独立的可编辑图层。文字、主体、背景和装饰能够分别修改、移动、隐藏或替换,通常约 40 秒即可获得分层结果。
如果只是修改少量文字,可以使用“改字”;文案需要持续调整时,可以使用“转文字”;需要移动主体、替换背景或继续精细编辑时,则可以使用“图像分层”。
在当前内部测试口径下:
设计,不止于生成。支持图层编辑与文案调整,可导出 PSD 源文件,让创意持续完善。

注:画眉是蚂蚁集团内部面向设计师和业务团队的智能设计应用,支持 AI 生图、文案调整、图像分层、图层编辑和 PSD 导出等能力。
从模型能力继续走向前端和办公交付
本次还同步开源 Design Skill 和 PPT Skill。
Design Skill 支持 Text-to-Page 和 Image-to-Page(Visual Coding),把 Design、Layer 和 Coding 串成一条完整链路,直接生成可运行、可继续修改的前端页面。传统 AI Coding 往往是先生成代码、再打开页面看效果,如果风格或布局不对,就要回头改代码、换素材,改动大时甚至需要重新生成。Text-to-Page 把这个过程前置成“先设计、再写代码”:用户输入一句需求,约 15 秒就能先看到完整页面方案,确认风格和布局后,再提取素材并交给 Coding 构建页面。这样首次看到结果可以从约 5 分钟降到 15 秒,在启动Coding 前先把方向选对,减少无效生成和后续返工。
Visual Coding 是“从参考图直接还原页面”:输入设计稿或截图后,通过Layer的模型先理解页面结构和视觉关系,正确拆解背景和插画等素材,再进入Coding环节;页面生成后还会通过截图与原图做视觉校验并继续修正。相比传统“看图写代码”,Design Skill把视觉理解、素材拆解、代码生成和视觉验证做成闭环,提升页面还原度,同时减少反复调代码和换素材的成本。

PPT Skill 可以将图片中的文字、色块和布局关系还原为 PowerPoint 中可编辑的元素。复刻所需的图标、插画等视觉资产可直接从源图中分离提取,无需额外重复生成,在保留原有视觉细节的同时,支持用户继续修改文案、字体、配色、图片和页面布局。
用于将一张设计图直接还原成可编辑的 PowerPoint 页面。它会识别图片中的文字、色块、图片和布局关系,并转换为 PPT 中可单独编辑的元素;其中的图标、插画等视觉素材可以直接从原图中提取复用,不需要重新生成。转换完成后,用户可以继续修改文案、字体、配色、图片和页面布局,在尽量保留原图视觉效果的同时,把一张“只能看”的图片变成一页“可以继续改”的 PPT。

四项能力既可以独立使用,也可以组合:
文字需求或参考图 → Design 生成完整视觉 → Layer 拆出独立素材 → 继续编辑与复用 → 生成前端页面或可编辑 PPT
对外部开发者而言,6B 参数降低了部署和二次开发门槛;模型权重与 Skills 同步开源,则提供了一套从视觉生成到应用交付的基础能力。开发者可以基于它构建设计工具、商家营销产品、办公应用和前端生成服务。
当前局限与未来计划
Ming-Image-0.1-Design 系列仍有明确的能力边界。
Design 目前最稳定的是排版和文字;但遇到复杂的人手动作、连续操作步骤,或者需要很精细的阴影、反光效果时,效果还不够稳定。
在 Layer 模型中,分层不存在唯一答案。有人只需要背景、主体、文字三层,也有人希望将每段文字和每个图标分别拆开。大量叠加光效、特殊透明材质和复杂遮挡,也可能出现边缘残留或图层缺失。
下一步,我们将继续提升文字与复杂布局稳定性,扩展图层语义和可控分层能力,优化透明效果、遮挡补全和推理效率,并将模型接入更多设计、办公与应用生成场景。
我们关注的不只是模型还能生成什么,而是生成结果能否真正进入下一步:继续改、继续用、继续交付。
即刻体验
在线体验
为方便开发者快速体验,Ming-Image-0.1-Design 已在 OpenRouter 开放为期两周的免费 API 调用。
🤗 Hugging Face
🤖 ModelScope
Design Skill
PPT Skill
如果你正在制作 UI、信息图、海报、演示文稿或设计资产,或者手里已经有一张希望继续修改的设计图,欢迎体验 Ming-Image-0.1-Design 系列。
也欢迎把真实项目里最难生成、最难修改或最难分层的案例留给我们。
让 AI 不只生成一张图,也能理解设计,并把设计继续交付下去。
文章来自于微信公众号 “蚂蚁开源”,作者 “蚂蚁开源”
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0