最近打开任何和 AI 生成图片有关的社群,都会看到 gpt-image-2 这个代号被反复刷屏。它不是某一个小插件的名字,而是新一代 GPT 图像能力所牵扯出的整片生态,包含官方接口、开源封装、提示词模板、复盘案例和大量踩坑记录。为了不让这些内容继续散落在各自的收藏夹里,我维护了一份命名为 awesome-gpt-image-2 的公开清单,并在这篇文章里把整理逻辑、实际跑通的经验,以及那些只有上手后才会发现的问题一次性写清楚。这篇文章适合三类人:想调用 API 做产品的开发者、想稳定输出视觉素材的设计师,以及被各种效果图吸引但还不清楚从哪开始的内容创作者。
1. gpt-image-2 的资源生态,已经大到值得单独维护
1.1 只靠收藏夹,撑不过三天
我在两周前开始关注 gpt-image-2 时,第一反应是先建一个收藏夹,看到好的 demo 就丢进去。结果不到三天就乱套了:同一个效果可能被五六个账号重复发,部分教程的截图漂亮,但没有任何可复现的参数说明,还有些项目的 star 数很高,代码却已经三个月没更新。最后真正能用的资源比例不到四成。
这个阶段最需要的不是收藏,而是筛选。awesome-gpt-image-2 价值不在链接数量,而在把"能跑、能解决问题、有明确边界"的资源挑出来,按用途排好。一个模型刚起来的时候,信息密度高,噪音也高,没有这样一层过滤,后续学习和落地都会非常吃力。
1.2 我筛选资源的三个硬标准
我在收资源时坚持三个标准,缺一个就不进清单:
- 可复现性:不能只看效果图,必须给出 prompt、参数或代码里的一部分。凡是只发成品图不说过程的内容,一律不进。
- 参数透明:代码里要能看出 model、size、quality、n 这些关键参数怎么设置。只有一堆函数封装的仓库,我也会继续看它是否暴露了底层参数。
- 活跃度:项目最近半年有没有更新,issue 区有没有人回复,社区有没有二次开发。gpt-image-2 这个方向变化太快,一个季度不维护的项目基本就失效了。
这三个标准听着简单,执行起来费时间。尤其是可复现性,很多教程看起来详细,真照着跑一遍就发现缺了某个依赖,或者用的接口版本已经变了。所以每条资源我都会标记"最近验证时间",避免后续读者被过期信息带偏。
1.3 满足哪种需求的人,可以直接抄这份清单
我把清单的服务对象分成三组。产品开发者重点看 API 封装、批量生成和结果校验相关条目;设计师重点看提示词模板、风格参考和二次编辑工具;纯内容创作者可以从案例库和 prompt 对照表入手,先找到自己能稳定复用的套路,再去理解背后的模型逻辑。
对于刚接触生成式 AI 的小白,这份清单里最有价值的是那些"从零到一"的示例:一条 prompt、一个 API 调用、一张成品图,三样东西放在一起,比任何理论解释都直观。
2. 清单内容拆解:官方、开源、提示词和案例
2.1 官方文档与接口资料
不管社区里有多少第三方工具,第一优先永远是官方接口文档。gpt-image-2 相关的能力通常通过图像生成接口暴露出来,核心关注点包括模型名称、支持的分辨率、输出格式、每次调用生成的图片数量上限,以及质量档位的选择。
我整理官方资料时,会专门把参数表做成一张速查卡,方便开发时直接复制:
| 分区 | 内容 | 典型用途 |
|---|---|---|
| 接口说明 | 请求方式、鉴权方式、模型名 | 接入前的第一站 |
| 参数手册 | size、quality、n、response_format 等 | 调整出图逻辑 |
| 错误码 | 超时、限流、内容审核相关返回 | 排查线上问题 |
| 权限说明 | 哪些账号和套餐可以调用 | 预算与权限评估 |
官方文档通常不会帮你写 prompt,也不会告诉你怎么批量管理生成结果,但它是所有后续方案的基准。我在清单里把所有官方链接放在最前面,目的就是让用户先建立起正确的心理预期:第三方工具可以提升效率,但不能替代对基础接口的理解。
2.2 开源封装与自动化工具
开源部分是我花时间最多的分区。gpt-image-2 生态里常见的工具包括:把图片接口封装成更简单命令的 CLI 工具、能批量读取 Excel 或 CSV 中的 prompt 并自动出图的脚本、以及能在设计软件里直接调用模型的插件。
我实际用下来,最值得收录的是三类:
- CLI 工具:适合不需要复杂交互,只想在终端里快速出一张图的场景。这类工具通常支持从文件读取 prompt,能直接输出到指定目录。
- Python SDK 封装:适合需要和后端服务集成的开发者。封装得好不好,主要看它是否允许我自己传 size、quality 这些参数,而不是把参数藏进默认值里。
- GUI 或插件:适合设计师。社区里已经有人做了可以直接在画布上生成图片、生成后继续做局部重绘的插件,这类工具能把生成流程嵌进已有的工作流,而不是让人反复切换窗口。
看一个开源项目值不值得用,我会直接读它 README 里的参数表。如果整个项目只有一个"在线体验地址",没有安装命令,没有依赖说明,我会直接放弃。这种东西要么是玩具,要么就是随时会断更的实验品。
2.3 提示词模板库与风格数据集
提示词模板库是我认为最被低估的资源类型。很多人以为 prompt 很简单,实际写起来会发现,同一个模型,换一种描述顺序,出来的构图和光影差别非常大。
我清单里收录的提示词资源会按场景拆开,比如电商产品图、人物肖像、建筑表现、UI 概念稿、3D 渲染、品牌插画等。每个模板至少包含三段内容:原始 prompt、生成参数、成品效果。没有成品图作为对照的模板,我也会单独标记为"待验证"。
风格数据集则更偏参考性质。比如某组图统一用低饱和色彩加胶片颗粒,或者某组图强调柔光环境和平视角度,这类风格不是靠一个词就能复现的,通常需要完整的视觉场景描述。我把这些案例按"风格关键词 + 核心描述结构"两条线整理,方便设计师根据甲方需求快速套用。
2.4 生产级案例与效果评测
案例分区里放的不是那种"看第一眼很惊艳"的作品,而是能经得住二次审视的内容:电商 banner、游戏概念图、产品说明书配图、社交平台配图等。这些案例不仅展示了模型能力,更重要的是展示了一个完整的产出流程:怎么从一句话需求拆解成 prompt,怎么在几张结果里挑出可用的,怎么处理不符合预期的地方。
效果评测分区是我后来补上的。一个模型不是所有场景都强,有的场景文字渲染好但人物手部容易崩,有的场景真实感强但风格迁移弱。我对评测类内容的筛选标准很严格:必须是用同一组 prompt 和参数跑出来的横向对比,不能是两张来源不同的图凑在一起。
3. gpt-image-2 提示词的核心变化:从标签到场景
3.1 短标签时代结束了
上一代部分图像模型的提示词,常见写法是一串逗号分隔的短标签,比如cat, happy, studio lighting, full body, blue background。这类标签能控制主体和基础风格,但很难表达画面里的空间关系、光线氛围和情绪。
到了 gpt-image-2 这一代,模型的语义理解能力明显更强,写 prompt 的方式也应该切换成完整句子。同样是一只猫,用标签写和用场景写,出来的图片差别极大。我在清单的提示词分区里放了一个原则:先写清楚"画面里发生了什么",再写"用什么方式呈现"。
3.2 用完整视觉语言描述一张图
一个稳定的 prompt 结构,通常包含六个维度:
- 主体:什么对象,什么状态,穿什么,在做什么。
- 环境:室内还是室外,背景里有什么,空间纵深如何。
- 光线:自然光、顶光、霓虹灯、柔光箱,光的方向和色温。
- 镜头:平视、俯视、仰视,焦距,景深,视角。
- 构图:中心构图、三分法、留白,主体在画面中的位置。
- 风格媒介:电影感、商业摄影、水彩、3D 渲染,具体到画册或相机型号都可以。
我举一个例子。如果只写a cat in raincoat, neon street, night,结果往往缺乏层次。但如果写成这样,稳定性会高很多:
一只穿着黄色雨衣的橘猫站在夜晚的霓虹灯街道上,镜头平视,85mm 焦距,浅景深,背景里的灯牌光斑被虚化,整体色调偏冷,有电影感。
这段描述里,主体和环境的信息没变,但多了机位、焦段、景深和色调。同一颗种子下,后者的构图会更接近人眼观察到的真实街景,而不是把每个元素平均地塞进画面。
3.3 负面需求的表达方式
gpt-image-2 的提示词里,表达"不要什么"同样重要。我会把不希望出现的东西单独放在 prompt 最后一句,比如:
- 不要多余的手指
- 不要画面中的文字
- 不要水印和签名
- 不要过度锐化
实测下来,明确写"不要文字"能明显降低画面里出现乱码的几率,但并不能保证百分百。如果生成结果里的中文文字完全无法阅读,最可靠的做法是把它当作一个创意素材,在后处理阶段用设计软件重新排版,而不是在模型里反复硬调。
3.4 同提示词复现与微调
gpt-image-2 的接口里,很多参数可以直接控制生成过程,比如通过seed和n的组合来稳定复现构图。我通常的做法是:先用同一段 prompt 配合固定 seed 跑 2 到 3 次,看构图是否稳定,再微调光线描述或角度描述。这样能区分到底是 prompt 写得不好,还是模型在某个场景下天然不稳定。
我还在清单里放了一组"翻车对照":同一个 prompt 的失败结果和成功结果放在一起,然后标注我改了哪个词。这种对照比单纯展示成功案例更有学习价值,因为真实工作里大部分时间是在处理失败。
4. 最小可用管线:API 调用、批量生成、人工筛选
4.1 一行代码先跑通
不管清单里有多少高级工具,第一步永远是先把 API 跑通。下面这个示例,是 gpt-image-2 相关能力的最小可运行代码,基于官方 OpenAI Python SDK:
from openai import OpenAI client = OpenAI() resp = client.images.generate( model="gpt-image-2", prompt="一只穿着黄色雨衣的橘猫站在夜晚的霓虹灯街道上,镜头平视,85mm f/1.4,浅景深,电影感", size="1536x1024", quality="medium", n=4, response_format="b64_json", ) for item in resp.data: print(len(item.b64_json))这段代码的重点不是把图存下来,而是确认几个关键链路:鉴权是否成功、参数是否正确、服务端是否返回了结果。第一次跑通之后,再谈批量和产品化。
拿到 b64_json 后,可以存成本地图片文件:
import base64 import pathlib for i, item in enumerate(resp.data): if item.b64_json: pathlib.Path(f"generated_{i}.png").write_bytes( base64.b64decode(item.b64_json) )这里要注意,不同接口版本可能返回 URL 而不是 base64,写代码之前先看清楚 response_format 的默认值。
4.2 批量生成时的参数设计
批量生成和单张生成的思路很不一样。单张可以反复调 prompt,批量必须先把 prompt 列表固化成文件,再用脚本逐条读取调用。我的推荐参数设计如下:
n=4:一次生成四张,成本可控,也足够做初筛。quality="medium":批量阶段用中档质量,等模糊筛选后再对少数几张用高档质量重跑。size提前固定:避免同一批图尺寸不统一,给后续排版带来麻烦。- 相邻请求之间加一点延时:避免瞬间打满接口限流,尤其是并发调用的场景。
批量脚本的核心不是把请求循环发完,而是让每张图都能溯源到对应 prompt。我会在输出文件名里带上 prompt 编号,比如prompt_007_2.png,代表第七段 prompt 生成的第二张图。没有这个编号,生成一百张图之后基本就乱成一团。
4.3 人工筛选与二次编辑流程
模型再强,出图后也一定要有人工环节。我两个人协作时的流程是:自动生成四张网格图,把同一批结果的缩略图拼成一张大图;先删掉明显有瑕疵的,再讨论剩余图片的构图和风格;最后对选中的图做二次编辑,比如裁切、加文字、统一调色。
二次编辑并不是"模型不够好所以人来补救",而是模型和设计工具各司其职。模型负责快速生成多种构图,设计工具负责把结果变成真正可交付的素材。把这两步混在一起,反而是浪费时间。
5. 我实际跑项目时踩过的四个坑
5.1 尺寸设置与构图裁切
gpt-image-2 能直接生成的分辨率是有限的,比如常见的有 1024x1024、1536x1024、1024x1536 这类规格。如果你在 prompt 里写"1920x1080 横版海报",模型不一定会照做,最终可能仍然返回接口支持的尺寸。
我的经验是:先按接口支持的规格生成,再在 Photoshop 或 Figma 里做无损扩展和裁切。生成时要在 prompt 里把画面主体放在安全区内,不要让重要信息贴着边缘。因为后裁剪一定会牺牲掉一部分画面,如果主体原本就在边角,裁完可能直接裁掉主体。
5.2 中文文字渲染
生成包含中文文字的图片,是所有人都绕不开的坑。英文短句的渲染相对稳定,中文招牌、中文包装、中文海报的情况就复杂得多,容易出现多一笔少一笔、整体像汉字但细看完全不是字的问题。
如果必须由模型生成文字,我总结的可用方案是:文字数量尽量少,把要出现的文字用引号包起来放进 prompt,比如"招牌上写着‘深夜食堂’四个字"。字数越多,翻车概率越高。如果要交付带有大量中文文案的成品,务必备好设计软件,把文字层放在后处理阶段补齐。这不丢人,真实商业项目里这么做才是稳定可靠的。
5.3 内容审核边界
大模型图像接口都有内容审核机制,这既是为了合规,也是平台能长期提供服务的基础。我在使用 gpt-image-2 时,明确不碰任何可能触发审核或违反平台政策的内容。有人会觉得测试审核边界是"探索能力上限",我的观点很直接:完全没有必要,账号风险、合规风险和商业风险都太高了。
正确做法是把它当成一个过滤条件:如果一段 prompt 反复被拦截,先检查是不是描述里出现了平台不允许的实体、场景或人物,而不是继续换着说法硬试。合规使用的前提下,gpt-image-2 能覆盖的创作范围已经足够大,不应该在这件事上消耗注意力。
5.4 版权和素材合规
版权合规是另一个容易忽略但非常重要的点。生成图片时如果直接在 prompt 里写某位在世艺术家的名字,或者直接要求模仿某个品牌的标志性风格,在商业项目中都有风险。
我的替代思路是:把风格拆成可以描述的元素,比如"低饱和、粗颗粒、暖色调、强调材质纹理的插画",而不是直接引用某个人名或品牌。对于商业交付项目,我还会额外确认生成素材的授权条款是否覆盖商用场景。这条经验不是矫枉过正,而是踩过几个项目节点后才意识到的问题。
6. 不同角色可以怎么用这份清单
6.1 开发者:先搭骨架,再换零件
如果你是开发者,建议按"官方接口资料 → Python SDK 封装 → 批量生成脚本 → 二次编辑辅助工具"的顺序来用这份清单。先跑通最小 API 调用,把基础链路搭好,然后才去尝试社区里那些花哨的封装,千万不要一上来就接一堆依赖,最后连请求参数都看不见。
我维护清单时,也会刻意保留那些只用一个文件就能跑的示例。对开发者来说,单文件示例是最容易被理解、测试和修改的。
6.2 设计师:从模板库抓起,但不要机械复制
设计师用这份清单的效率最高。我建议从提示词模板库入手,先完整复制几个模板,看效果是不是符合预期,再逐步替换里面的主体、环境和光线描述。这样能最快积累出"哪些词对这个模型有效"的感觉。
但不要机械复制。同一个模板在生产环境里跑十次,可能会因为尺寸、quality 和描述里的细节不同,得到完全不同的结果。持续微调 prompt 里的一到两个变量,比同时改十个变量更容易判断影响来源。
6.3 AI 内容创作者:批量产出时记得做选题
内容创作者最容易迷失在各种风格模板里。我的建议是:先确定接下来一周想要产出的内容主题,比如"科技产品图""深夜街头摄影""城市建筑插画",再从清单里挑对应分区,批量生成一组素材,最后人工筛选和统一调色。
不要一天换一个风格。固定一套视觉语言,连续更新几期内容,才是 AI 内容能形成辨识度的关键。
6.4 我后续想补充的方向
这份 awesome-gpt-image-2 清单目前还在快速迭代。接下来我打算补充三个方向:更系统的横向评测基准,覆盖文字渲染、人脸一致性、手部细节、风格迁移等维度;更多真实商业项目复盘,最好能展示从需求到成品全链路;以及更细化的参数调试记录,比如 size、quality、seed 对结果的影响。如果你也在折腾 gpt-image-2,欢迎把你自己的踩坑记录或工具提交过来,我会按这套筛选标准审一遍再收进去。最后分享一个最实际的建议:别急着逛完整个清单,先拿你的第一个真实需求跑通一条最小链路,一切都好说。