不止一个模型:蚂蚁 Ming-Image 系列一口气开源两个 6B,Design 版只是开始
【免费下载链接】Ming-Image-0.1-Design项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ming-Image-0.1-Design
当大多数开源团队还在为"一个拿得出手的旗舰模型"反复打磨时,蚂蚁百灵选择了另一条路:9 月 23 日,Ming-Image-0.1-Design 系列一次性发布两个参数量均为 6B 的模型——Ming-Image-0.1-Design 与 Ming-Image-0.1-Design-Layer。前者负责"从文字需求直接生成 UI、信息图、海报等完整视觉设计",后者负责把设计图/创意图拆解为可独立编辑的透明图层。一个负责生产、一个负责二次加工,二者天然互补,构成了一个面向设计交付场景的最小闭环。
对开发者来说,这一系列真正值得关注的,不是"又开源了一个 6B 文生图模型",而是蚂蚁把"设计生成"这件事拆成了可组合的多个模型,并配齐了从部署到下游工作流的整套生态。本文基于仓库源码与公开情报,拆解这两个 6B 的分工差异、Design 版在工程上的关键取舍,以及这套"矩阵式开源"背后的策略逻辑。
两个 6B 的分工:Design 负责"生成",Layer 负责"拆解"
先厘清一个容易混淆的点:同一系列的两个模型,干的并不是同一件事。
- Ming-Image-0.1-Design:文生图模型,输入提示词,输出完整的 UI 界面、信息图、海报等文字密集型设计稿,支持原生 RGBA 透明背景;
- Ming-Image-0.1-Design-Layer:图层拆分模型,把已有的设计图/创意稿分解为可独立编辑的透明图层,相当于为"AI 出图 → 设计师接手改稿"提供了一条可落地的中间路径。
两者拼在一起,正好覆盖了设计工作流里最耗时、最割裂的两端:从零生成素材,以及把生成结果"打回"成可编辑资产。单独的生成模型再强,产出的也只是一张"死图";而有了 Layer 模型,生成结果可以进入 Figma、PPT 等可编辑场景继续加工——这也解释了为什么社区教程里反复出现"Ming-Image 搭配 Layer 拆分模型与 Design Skill 自动化工作流"的组合玩法。
Design 版"为设计而生"的四个工程证据
打开仓库目录,README.md 对该模型的定位写得很直接:面向 UI、信息图、海报及其他文字密集型视觉设计的 6B 文生图模型。所谓"文字密集型",意味着模型必须同时解决三件事:文字渲染不崩、排版布局稳定、输出可交付(透明背景)。我们从仓库配置逐一验证这三个能力是怎么落地的。
第一,多模态语义理解用 MoE,而不是堆一个大稠密模型。文本/视觉理解由 mllm/config.json 定义的多模态模型承担:LLM 主干为bailing_moe_v2,256 个专家、每 token 激活 8 个,配合 32 层 Qwen2.5 ViT 视觉编码器。官方口径的"6B"正是 MoE 的激活参数量(权重索引元数据中的 170 亿参数为含全部专家的总量,mllm/model.safetensors.index.json)。理解侧能力越强,提示词里的版式描述、字号层级、"左上角放标题"这类布局信息才越能忠实传递到生成侧。
第二,语义注入走"轻桥接",不过度引入新模块。文本侧先经 connector/config.json 定义的 Qwen2 因果语言模型(28 层、hidden size 1536,约 15 亿参数)编码,再通过 mlp/config.json 的恒等 MLP(use_identity_mlp: true)直接注入扩散 Transformer。连接层选最轻的实现,目的是保留语义、减少条件注入链路中的信息损耗——这也是"语义保真"的工程化表达。
第三,生成侧是标准的 MMDiT 风格扩散 Transformer,但为透明通道留了位。transformer/config.json 显示:dim 3840、30 个主层 + 2 个 refiner 层、16 通道输入(in_channels: 16)、支持 2048 级高分辨率(axes_lens中 20480 对应大图 token 长度)。注意这里的 16 通道潜变量不是巧合——它要为下面 VAE 的 RGBA 四通道各分配独立的潜空间表达。
第四,透明背景是"原生能力",不是后处理。与多数模型生成 RGB 后再抠图不同,vae/config.json 定义了AutoencoderKLQwenImage:input_channels: 4(即 RGBA 四通道直接进 VAE)、z_dim: 16、scaling_factor: 8.0064。也就是说,透明度在潜空间里就被联合建模了,采样一步到位的输出天然带 Alpha 通道。配合 scheduler/scheduler_config.json 的 Flow Match 欧拉调度器(shift 6.0、1000 步训练时间表),实际推理仅需 12 步即可出图——README 给出的推荐参数是 2048×2048、12 步、CFG 1.0、BF16、单卡 80 GiB。
这套组合的实际效果得到了第三方盲测的背书:在 Artificial Analysis 的 UI/UX 文生图盲测中,该模型以Elo 1082分登顶开源模型第一,把文字渲染、版式稳定这类"设计生图"专属指标作为核心竞争力摆到了台面上。
透明背景为什么值得专门做一个 VAE
先澄清一个常见的误解:RGBA 输出并非"多加一个通道"这么简单。常规 3 通道 VAE 的潜空间分布是在 RGB 数据上学出来的,强行把 Alpha 塞进去会导致透明度与内容解耦失败——生成结果要么边缘发虚,要么"透明"变成了灰色。Ming-Image 的做法是让 VAE 从输入端就吃 4 通道(input_channels: 4),把透明度当成与颜色平行的第一公民参与重建训练,16 维潜变量(z_dim: 16)也给了四通道足够的表达能力。
从工程成本看,这一选择让 VAE 解码端到端产出带 Alpha 的 PNG,跳过了"生成 → 抠图 → 合成"的传统链路,对电商商品图、App 图标、贴纸表情包这类高频需求,收益是实打实的:一次推理、直接交付。README 中的透明背景示例(assets/transparency_showcase.webp)也专门用棋盘格预览透明度,并注明棋盘格仅用于预览、不属于生成结果。
为什么铺矩阵而不是押单点
回到"一次开源两个 6B"这个动作本身。单看 Design 版,它已经是一个完整的 6B 文生图模型;但蚂蚁显然不满足于"押一个爆款",而是围绕设计交付场景铺了一张网:
- 模型层:Design(生成)+ Layer(拆层),覆盖"出图—改稿"链路;
- 工作流层:官方配套了 Design Skill 自动化工作流与"图转可编辑 PPT"的 Skill,把单模型能力组装成端到端的生产管线;
- 部署层:明确推荐 vLLM-Omni 服务化框架,并给出 80 GiB 单卡验证配置,降低自部署门槛;
- 合规层:MIT 协议开源(LICENSE),商用无附加条件。
这套打法的逻辑很清晰:场景比单点模型更难复制。单一 6B 模型再强,竞品追几个月也能追平;但"生成 + 拆层 + 工作流 + 服务化 + 开源许可"构成的完整矩阵,才是真正沉淀下来的生态壁垒。这也与蚂蚁在通识多模态上的家族化路线一脉相承——从 Ming-Omni 的统一多模态感知生成,到 Ming-UniVision 的连续视觉表征统一理解与生成,再到如今 Ming-Image 系列垂直场景化落地,开源动作始终是"系列化、成体系"地推进,而不是零散地丢模型。
下一个成员会是谁
既然"系列"是策略,"Design 只是开始"就不仅是标题修辞。从已公开的线索可以合理推演:
其一,Layer 模型本身就有独立迭代空间。当前它能拆透明图层,下一步向"拆出可编辑的矢量结构""还原布局树/组件属性"演进,是技术路线上顺理成章的方向——那将真正打通"AI 出图 → 设计稿结构化"的最后一公里。
其二,与 Ling 系多模态生态的整合。README 中提示词增强(PE)可挂载 Ling-3.0-flash-VL 或 qwen3.8-27B,说明官方在设计的是"理解模型增强提示词 → 生成模型出图"的协同链路。随着理解侧模型升级,生成质量与指令跟随能力会同步水涨船高。
其三,从"静态设计稿"走向"动态内容"。Ming 家族在统一多模态上已有积累,图像生成之后,视频、多页文档排版、甚至"设计稿 + 交互逻辑"的一体化生成,都是同一套"文字密集型内容生成"能力的自然延伸。
回到当下:两个 6B、一个 MIT 协议、一套成体系的工具链——Ming-Image-0.1-Design 系列给开源文生图社区带来的不是又一个可下载的权重,而是一个"按场景拆解、按矩阵交付"的范本。对想快速落地的团队,Design 版 + Layer 版 + vLLM-Omni 的黄金组合已经可以直接开工;对想研究架构的人,从 mllm/config.json 到 vae/config.json 的每一份配置都在告诉你:设计生图的难点,从来不在"画得像",而在"排得对、拆得开、交付得了"。
【免费下载链接】Ming-Image-0.1-Design项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ming-Image-0.1-Design
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考