这两天ZHO用GPT Images 2.5做人物卡的视频,应该把不少做内容的人看燃了。跟以前那种必须会画、会摆姿势、会修图才能产出一张角色的路子完全不同,现在只要把角色设定写得清楚,再让GPT Images 2.5按设定出卡就行。我特意用同样的思路实测了几轮,把提示词、生成比例、踩坑点全部跑了一遍,这篇就是把整个“用GPT Images 2.5做人物卡”的过程拆给你看,从最基础的角色设定到最终成卡的输出细节都有。想给游戏角色做参考图、给小说人物做封面人设、给直播或短视频做虚拟人物形象的,可以直接照着操作。
先说明白,GPT Images 2.5不是一个独立下载的软件,也不是什么需要本地部署的模型,它是图像生成能力,直接通过ChatGPT的对话窗口使用。你把需求说出来,它帮你把图生成。人物卡这件事,本质上考验的已经不是“你会不会画”,而是你“能不能把一个人物说得足够完整、足够有画面感”。ZHO那套操作里最值得学的地方,恰恰就是这一点。
1. 人物卡做成什么样,先想清楚再动手
1.1 人物卡不是一张图,而是一套“角色信息包”
很多人拿到GPT Images 2.5就急着让它画个“帅气男角色”,出来的图可能确实好看,但放不到项目里用。真正能落地的人物卡,至少包含三个层次的内容:
第一层是角色的形象本身,包括发型、五官、肤色、身材、服装、道具。第二层是角色设定信息,比如名字、职业、性格标签、势力归属、特殊能力。第三层是展示排版,比如卡面背景、标题字体、数值栏、台词框。
ZHO那个做法的聪明之处,是让GPT Images 2.5在一张图里同时输出这三层。也就是说,它生成的不是“一幅画”,而是一张具备设计感的完整卡片。这点对做游戏人设、跑团角色卡、小说人物设定集的场景特别有用。
我这次实测的目标定成“一个赛博朋克风格的女猎手角色卡”,需要包含文字标题、角色数值区块和一句话介绍。这个目标看起来简单,实际生成时对提示词的要求很高,因为GPT Images 2.5虽然擅长排文字版式,但如果你不限定版式结构,它容易把文字和图混得乱七八糟。
1.2 为什么非得用GPT Images 2.5来做这一步
市面上的AI绘图工具很多,但做“人物卡”这个具体任务,每个工具表现差别很大。以前用其他主流模型时,最痛苦的是三个问题:一是画出来的文字经常乱码,二是同一角色换个姿势就变成另一个人,三是想要完整的卡片排版基本靠后期PS。
GPT Images 2.5在这几个点上有明显优势。它的文字渲染能力相对靠谱,中文短文本正确率比前代技术提升了不止一个等级。它对指令的理解也更细,你告诉它“排版上要突出标题”“背景用夜景”“人物左侧留白”,它是真的会按指令执行,而不是只把绘画风格听懂了。另外,同一角色连续生成时的一致性也比以前的工具好,不至于换一个动作就换一张脸。
这不是说它完美,后面我会专门说它崩的地方。但作为一个人物卡快速成卡的工具,它现在是效率极高的选择,特别适合不会板绘、但需要大量角色卡内容支撑项目的人。
1.3 做人物卡最忌讳的是“角色设定模糊”
我见过很多人在生成人物卡时翻车,根因不在AI,而在角色设定太模糊。你说“一个穿红色衣服的剑客”,AI确实能画出来,但这张卡没有任何记忆点,放十个角色在一起根本分不清谁是谁。
正确的做法,是把角色浓缩成“三个视觉锚点加一个背景锚点”。视觉锚点是让别人一眼记住这个角色的东西,可以是特殊瞳色、疤痕、机械义肢、标志性武器,也可以是服装上某种固定纹样。背景锚点是角色所处世界的氛围,比如废土、近未来都市、奇幻森林。
我这次的女猎手,三个视觉锚点定成“一条横贯鼻梁的光学记号线”“右肩的旧式机械装甲”“一把带有霓虹灯条的短刃”。背景锚点是“雨夜中的霓虹街巷”。后面生成的所有图,都在这个框架里跑,出来的角色辨识度非常高。
2. 生成人物卡前,先把这几样东西准备齐
2.1 账号、工具、构图规格的基本准备
使用GPT Images 2.5做人物卡,入口很直接。你需要一个ChatGPT账号,然后在对话窗口里选中支持图像生成的那个模型,直接发文字描述就行。如果你之前从来没用过,建议先拿一张简单的图测试一下,确认账号有图像生成权限再开始做人物卡,避免折腾半天最后发现是权限问题。
构图规格方面,人物卡最常用的比例有几种:竖版卡牌一般是2:3,适合整个立绘;方形的1:1适合做展示图和头像;横版的16:9适合做角色主题横幅。我建议第一版直接用2:3的竖版比例,因为人物卡的主视觉通常都是人物立绘加上下信息条,竖版排版最自然,后期裁切也方便。
如果想要印刷级清晰度,生成之后还要做后处理。GPT Images 2.5默认生成的图分辨率虽然已经够日常使用,但放到大幅海报或者高清展示屏上会吃力。后面我会单独说后处理的事,这里先记住一个概念:AI生成的图不是终点,后期放大和修复是人物卡流程里不可缺少的一环。
2.2 先写一份角色设定文档,比直接开画更重要
很多人第一步就搞反了,上来直接让AI画,画完不满意再一句一句补提示词,效率极低。我的习惯是先把角色设定写成一段结构化的文档,再基于这段文档写生成提示词。这个习惯在ZHO的项目里也看得到,他不是凭空让AI发挥,而是真的有角色背景在支撑。
角色设定文档不需要长,但几个关键信息必须明确:角色名字、年龄、职业、势力、性格关键词、外形特征、服装描述、核心道具、场景氛围。我这次写的是:
角色名:林鸽。年龄:24。职业:城市猎手。性格:寡言、果决、有轻度洁癖。外形特征:银灰色齐耳短发,左眼下方有一颗小痣,横贯鼻梁有一条细长的青色光学记号线。服装:黑色高领短夹克,右肩覆盖旧式机械装甲,下装是战术裤配短靴。核心道具:一把刀刃带霓虹灯条的短刃。场景氛围:雨夜的霓虹街巷。
这段文字最后直接转化成提示词的主体部分。没有这份设定文档,AI就会自由发挥,出来的东西可能好看,但绝对不是你要的那个人物。
2.3 提示词的结构化模板,直接套用就行
人物卡提示词不是越长越好,但结构一定要清晰。我自己用的通用模板是四段式:主体角色描述、环境氛围描述、构图与排版要求、画质与风格限定。
比如我给女猎手写的完整提示词是:
“一位银灰色齐耳短发的年轻女性,左眼下有痣,鼻梁上有青色光学记号线,穿黑色高领短夹克和战术裤,右肩有旧式机械装甲,手持带霓虹灯条的短刃。背景是雨夜霓虹街巷,地面有积水倒影,整体色调为冷蓝色搭配品红霓虹光。竖版构图,人物居中偏左,右侧留出文字排版区域,卡面右上角有大标题‘林鸽’,底部有两行小字作为角色介绍。高细节,商业插画质感,电影级打光。”
注意最后我加了“右侧留出文字排版区域”和“卡面右上角有大标题”这样的指令。GPT Images 2.5跟其他工具最大的不同就是能理解排版类指令,你不给明确位置,它就随意发挥;给了具体位置和内容,它会认真执行,这是做人物卡时最值钱的能力。
2.4 参考图怎么用,能解决一大半的“换脸”问题
如果你需要同一个角色输出多张卡片,只靠文字提示词是不够的。文字再详细,AI每次生成时还是会在细节上漂移,尤其脸部特征很难完全一致。这时候需要用参考图。
做法很简单:第一张满意的图生成之后,把这张图直接上传到对话里,然后跟GPT Images 2.5说“参考这张图的角色形象,保持脸型、发型、五官一致,换一个动作和场景”。实测下来,这种做法能让角色漂移问题大幅减轻。
这里有一个实操细节:上传参考图时,最好用一张正面视角、光线均匀、脸部没有任何遮挡的图。如果你传了一张斜侧面的,它可能把斜侧面也当成角色特征,后续所有卡片都是斜的。我觉得与其说是AI的理解问题,不如说它把所有视觉信息都当成了“特征”。
3. 实操过程:从一句设定到一套完整人物卡
3.1 第一版生成:先看整体方向,别急着抠细节
我建议第一次生成时不要加太多细节限制,先用设定文档的核心信息生成一个大方向图。目标是确认角色的整体气质、服装配色、背景风格是不是你要的方向。这一版如果就跑偏,后面再怎么改提示词都很难拉回来。
我的第一版提示词是:
“年轻女猎手,银灰色短发,鼻子上的青色光学记号线,黑色夹克,右肩机械装甲,手持霓虹短刃,背景是雨夜霓虹街巷,竖版构图,高细节,商业插画。”
这版提示词没有要求文字排版,没有要求具体姿势,给AI很大的发挥空间。生成的图整体氛围是对的,但有两个问题:一是夹克细节被过度发挥,变成了复杂纹路的装饰外套;二是背景的霓虹元素太多,抢了人物主体。这两个问题很典型,说明AI在“氛围”理解上通常很准,但在“主次分配”上需要人来干预。
3.2 第二版调整:收紧服装和背景的主次关系
针对第一版的问题,第二版提示词做了两处修改。一是把服装描述改成“黑色高领短夹克,款式简洁”,用“简洁”这个词压住AI过度设计的倾向;二是把背景描述改成“霓虹灯光作为背景氛围,弱化细节,虚化处理”。
修改后的提示词在人物头上加了“高领”限定,这是因为第一版画成了翻领,而我设定里明确是高领。“简洁”会让AI减少不必要的花纹和挂饰。“虚化处理”则是明确告诉它人物是视觉中心,背景只是陪衬。
这一版的变化非常明显。人物体量变大,服装干净利落,霓虹灯从一片光海变成了远处的光斑,整体已经有了“卡牌立绘”的感觉。到这一步,我才开始在提示词里加入真正的“卡片排版”要求。
3.3 第三版:让AI直接生成带文字排版的完整卡面
这一步就是ZHO那套流程里最核心的玩法了。不要只让AI画人物,而是让它把整张卡面当作一个视觉作品来设计。我把提示词改成:
“保持当前角色形象和背景,将画面改为正式的角色卡牌设计。竖版构图,人物居中偏右。左侧和底部留出干净的深色半透明区域,用于文字排版。右上角用加粗字体写‘林鸽’,下方竖排写一行小字‘城市猎人’。底部区域用整齐的横排文字写角色介绍:‘霓虹雨夜中独行的赏金猎手,代号林鸽。’整体风格保持赛博朋克,高细节,商业卡牌插画质感。”
这版生成结果让人比较惊喜。它没有无视排版指令,真的把“林鸽”两个字写在了右上角,而且字形是带着科技感的无衬线体。底部也确实出现了半透明黑色区域,文字内容也基本正确。虽然还有个别笔画的小瑕疵,但作为一张人物卡,它的完成度已经够了,可以直接放进项目文档里。
3.4 同一角色批量出图:用“在保持上述风格的基础上”来锁一致性
人物卡在实际项目里从来不会只做一张。一个角色通常需要正面立绘、侧面特写、场景战斗图、表情差分图。这时候锁一致性就变得很关键。
我的做法是把第一张成图上传回去,然后说:
“保持这个角色的长相、发型、服装和整体风格,新增一张全身战斗姿态图,人物在画面左侧,右侧留出大片霓虹夜景,竖版构图。”
它的理解能力比我预想的好。它知道“保持角色”是什么意思,生成的战斗图里,人物依然是银色短发、鼻梁记号线、黑色高领夹克,脸部特征也确实延续了。唯一的小变化是短刃的霓虹灯条颜色从青色变成了偏蓝,这属于可以接受的微小漂移。
如果你想多张图都保持高度统一,建议每张图生成前都把参考图再传一次,不要依赖AI的“记忆”。对话记录长了之后,它对新一轮任务的理解会被中间其他操作干扰,重新上传参考图是最稳的做法。
3.5 文字部分拆开做,成功率更高
虽然GPT Images 2.5能直接生成带文字的卡面,但只要是中文,长句子依然会有出错的可能。我做了很多次实验,结论是:字越少,正确率越高;字越大,越不容易变形;固定模板句比自由发挥句可靠。
如果卡片上的文字很多,比如完整的角色背景故事,那就不建议让AI直接一次画进图里。我的做法是先生成没有关键文字的卡面,然后用修图工具把文字单独加进去。这样既保证了文字准确,又不牺牲AI出图的效率。
如果是英文或者数字,它的准确率会高很多。所以如果你做的是国际风格的项目,卡面文字直接用英文或混排数字,出图成功率会显著提升。
3.6 多生成、再筛选,别指望一次成图
ZHO的视频里看着很顺,但其实他自己也肯定试了很多次。我的经验是,同一句提示词不要只生成一张,至少生成四张再选,因为AI在构图、表情、光线上的随机偏差有时候会带来惊喜。
我这次实操里,出现了一次极其好看的下雨反光效果,但那张人物表情没控制好;另有一张人物表情到位,但右肩装甲画得过于笨重。素材够多之后,后期的选择空间就大。
批量生成的另一个好处是,你可以把几张图中最好的部分组合起来,比如A图的脸、B图的服装、C图的背景,这种“局部迁移”操作在修图软件里很容易完成,不需要重新画一遍。
4. 实测高频问题与排查技巧
4.1 常见问题速查表
| 问题现象 | 可能原因 | 解决办法 |
|---|---|---|
| 脸部细节崩坏 | 提示词没有限定脸部特征重要性 | 加入“脸部细节精细”和五官描述,或单独生成脸部特写 |
| 字母乱码 | 文字量太大或字体样式复杂 | 减少文字数量、切换英文或数字、后期单独加文字 |
| 多张图角色不一致 | 没有上传参考图或对话环境被干扰 | 每轮生成前重新上传参考图 |
| 服装过于花哨 | “简洁”等控制类词汇缺失 | 在服装前加“款式简洁”“剪裁干净” |
| 背景抢主体 | 背景描述太具体 | 改为“虚化背景”“氛围光”这种弱化词 |
| 手部形态崩坏 | 手部姿势太复杂 | 换简单姿势或裁剪到上半身构图 |
| 灰暗噪点多 | 生成参数误设或场景光线控制不足 | 增加打光描述,后期做降噪和超分处理 |
4.2 脸部崩坏和手部畸形怎么处理
这是AI绘图绕不开的事。脸部崩坏往往发生在角色面部过小、饰品过多、光线杂乱时。解决思路有两条:一是把构图往中近景调,让脸部占画面更大比例,这样可以大幅降低出错概率;二是把脸部特征从服饰、光线中独立出来强调,明确告诉AI“这是视觉重点”。
手部畸形更麻烦。目前最好是减少对手部姿势的复杂要求,比如不要求手拿东西、不要求多根手指做出特殊手势。做人物卡时,我通常把手部动作控制在“垂放”“叉腰”“持武器自然下垂”这几个简单姿势内,翻车概率低很多。
如果确实需要精细的手部特写,一个可靠的补救手段是先把脸和身体生成好,再单独用修图工具修复手部,或者用同一角色参考图单独生成一次手部特写,再合成上去。
4.3 文字乱码到底怎么避免
中文文字是GPT Images 2.5做人物卡时最大的坑之一。它确实能写中文,但笔画一多、字号一小、内容一长,必然开始出错。我实测出来的规律是,它写标题类短词的正确率比较高,写一句话以上的内容就会开始产生形近字错别字。
对策就是拆分:卡片上的核心标题、姓名、称号这类短词可以直接让AI生成;角色介绍、背景故事这类长文本,后期用修图工具叠加。别强行让AI处理所有文字,这是提高效率和成功率的最佳方案。
字体风格上,无衬线体比衬线体可靠,粗体比细体可靠,纯色比渐变变色可靠。这些规律在实测中反复出现,可以省下很多次重试时间。
4.4 角色一致性漂移怎么救
即使有参考图,角色一致性还是会漂。我的理解是,GPT Images 2.5把“角色”理解成一组偏好的图像统计,而不是记忆一张绝对的面孔。所以它的漂移范围是有限的,但不可能完全消失。
实操中,想要把漂移降到最低,建议把“辨识度最高的三样东西”写进每一轮提示词里。对于我的女猎手,就是“银色短发”“鼻梁青色记号线”“黑色高领短夹克”。这三样只要同时出现,即使五官有一点点变化,观众依然能认出是同一个角色。与其追求绝对一致,不如用锚点元素建立视觉身份。
4.5 风格不统一时如何拉回同一种调性
做一批人物卡时,单张好看不是目标,整体风格协调才是。我的做法是给所有提示词使用同一组风格后缀,比如统一加“高细节,商业插画质感,电影级打光”,并且把色调关键词保持同色系。
如果你的角色性格和背景不同,色调也完全不一样,那就需要后期统一调色。把生成的图全部拉进修图软件,统一加一个色调滤镜或调一下色温,就能把看起来各不相同的图拉回同一个体系。这一步几乎是必做的,哪怕AI生成时用了同一条提示词。
5. 人物卡的后期加工与多场景延伸
5.1 后处理四件套:分辨率、细节、裁切、字幕
AI生成图不等于成品图,通常还需要几步后处理。分辨率方面,如果你要用于社交平台,默认清晰度基本够用;如果要打印或高清展示,需要用超分工具放大到2倍或4倍,同时做轻微降噪。细节方面,重点检查脸部、手部、文字边缘是否干净,有瑕疵就先修复再放大。
裁切可以根据使用场景来。竖版卡牌图转头像时,截取脸部特写区域;转封面时,保留人物主体去掉多余背景。字幕建议最后加,因为AI文字就算写对了,字体风格也未必跟你的项目匹配,后期统一加更专业。
我在后处理时常用到的流程是:先放大,再降噪,再局部修复,最后统一色彩。顺序不能反,先放大再修复可以避免放大后瑕疵被放大得更明显。
5.2 人物卡能用在哪些真实场景里
做角色卡不只是为了玩。这几年内容创作、独立游戏、小说连载、直播间虚拟形象的需求一直很旺盛。用GPT Images 2.5做人物卡,可以直接用到这些地方:小说封面和章首插画、独立游戏的立绘草稿和人物设定集合、直播和短视频的虚拟人物形象、跑团桌游的角色卡、漫画人设的前期参考图。
它的价值不是取代专业画师,而是把“从零到一”的启动成本压到极低。以前想做一个角色设定图,哪怕是草图也得找人画或者自己死磕几天。现在从文字到成卡,可能只要十几分钟,这中间省下的时间足够让你把精力花在角色故事和世界观构建上。
我身边有做短视频的朋友,用这个方式给账号生成了一个固定虚拟形象,每次更新内容就用同一张参考图生成不同姿态的图,搭配短视频使用,效率比之前拍照修图高太多了。
5.3 这几天实测下来的一点体会
真正上手用GPT Images 2.5做人物卡后,我最大的感受是:它把角色设计从“绘画问题”变成了“定义问题”。你不必会画,但你必须会定义一个足够鲜明、足够有画面的角色。AI放大的是你的设定能力,而不是凭空给你创造力。
效率方面,我可以负责任地说,一组简单的人物卡,第一版到可用版本,基本在半小时内能搞定。如果只是做创意探索,不考虑文字排版,十分钟就能出好几版方向。但对于要求高度严谨的商业项目,比如需要完全一致的多姿态角色,AI还需要配合后期流程,不是万能魔法。
我也遇到过完全不听话的时刻,比如明明强调了风格,它依然给我生成一个偏写实的人脸;强调了身材比例,它却把腿部画得过长。这些都需要靠多轮沟通和人工筛选来解决。AI工具真正落地,靠的不是单次生成的运气,而是持续的操作方法论。
最后分享一个我自己的小习惯:每次生成人物卡前,我都把当轮的提示词和生成结果截图存档,方便复盘哪个词影响了什么。积累几轮之后,你会慢慢摸透自己项目的“提示词手感”,后续再做任何角色卡都会快很多。这也是ZHO那种看起来“信手拈来”的生成操作,背后真正的秘密。