先说个真实感受:我在AI绘画上花的时间不算少,身边朋友知道我玩这个后,问得最多的不是“哪个网站能生成赛博朋克城市”,而是“哪个网站生成的美女图最好看”。这个需求如此旺盛,以至于我得认真把主流的AI绘画网站都测了一遍。今天这篇不写虚的,就是扎扎实实六款我实际用过、出图质量稳定、界面也好看的AI绘画网站/工具,针对人像生成这件事,从审美风格、操作门槛、可控性、成本四个维度讲清楚。你拿这篇当参考,基本就不用花冤枉钱去一个个试错了。
先说明一点:所谓“各种美女随便生成”,我理解成“高质感的角色人像自由创作”。AI绘画对人物表现力的支持,这两年已经到了非常夸张的地步——光影、皮肤纹理、衣服材质、情绪氛围,都能做到几乎以假乱真。但你要是把“随便”理解成“不审核、无限制、什么都能画”,那这个方向我不推荐,也不符合主流平台的使用规范。过一遍审核是好事,这能让工具生态更健康。下面全是正经测评,放心看。
1. 为什么“同一句话”在不同网站出图效果差这么多
先说一个很多人没搞明白的事:AI绘画网站背后不是一个“万能模型”,而是“模型 + 微调 + 出图策略”的组合体。你拿同一句提示词去Midjourney和去国内某个在线网站生成,出来的图几乎不可能一样。这背后的核心差异有三个。
第一,底模训练数据和风格偏向不同。Midjourney的V6模型在海量高质量艺术图片上做了大量美学调优,出图自带电影感和氛围感;Stable Diffusion系列是开源社区驱动的,底模本身偏“写实底子”,这么说不准确——SD生态真正强的是可以换模型。你在Civitai、LiblibAI上下的那些专门训练过的人像模型,比如ChilloutMix、MajicMix Realistic、GhostMix,都是社区贡献者用大量精选人像图喂出来的,风格高度收敛。所以SD能“指哪打哪”,是因为它能挂不同的LoRA和Checkpoint,而Midjourney更像是一位审美稳定的画家。
第二,提示词理解和解析逻辑不同。Midjourney对自然语言的理解很好,你写“一位穿红色风衣的亚洲女性站在雨夜的霓虹灯下,35mm镜头,浅景深”这种整句描述,它能准确渲染。但Stable Diffusion早期生态更依赖“标签堆叠”,比如“(masterpiece, best quality), 1girl, solo, red coat, night, neon lights, rain, cinematic lighting”,当然现在也有DeepDanbooru、WD14 Tagger这类工具帮你把图片反推出标签,说明SD生态已经向“标签化提示词”靠拢。如果你习惯写整句长文,MJ更舒服;如果你习惯像搭积木一样精确控制,SD系更好。
第三,后端有没有做“二次加工”。很多在线网站为了出图好看,默认开启了人脸修复(Face Restoration)和高清放大(Upscale),你看到的效果其实是“生成 + 修复 + 放大”三重输出的结果。这也是为什么有些在线小网站用同一个开源模型,效果却比你自己本地跑的SD要好——不是模型更先进,而是在参数和后期策略上帮你调好了。理解这一点,你就能明白为什么测评网站得分高,不代表你自己用就顺手。
2. 六款人像生成工具实测:定位、选型与上手建议
接下来进入正题。这六款我都在实际项目里用过(人像写真、角色设计、配图),按“审美天花板”“可玩性最强”“中文友好度最高”三类来分,你可以根据自己的需求对号入座。
2.1 Midjourney:审美上限最高的“懒人神器”
Midjourney目前的出图质量在主流商业工具里依然属于第一梯队,尤其是人像写实和艺术氛围的平衡度上,几乎没有对手。我的使用体验是:你不需要掌握太复杂的提示词语法,用自然语言尽量把场景、光线、镜头、情绪描述清楚就行。比如生成一张女摄影师的工作照,我会写:
a female photographer in her 30s, holding a vintage camera, standing in a sunlit studio, film dust in the air, shot on Kodak Portra 400, 85mm lens, f/1.8, warm tonesMJ的强项是一个画面里有“故事感”,那种“照片背后的叙事感”是别的工具很难模仿的。它还有几个很实用的参数:--ar 3:4控制竖版,--style raw降低MJ自带的美学滤镜让画面更纪实,--stylize 250左右默认值比较稳妥。当然它的明显短板是不适合精确控制人物五官——你不能要求“左眼双眼皮,右眼单眼皮”这种细节。另外MJ不免费,最低月费10美元,对偶尔玩一下的人来说稍贵。
2.2 Stable Diffusion(SD WebUI + ComfyUI):可控性最强的“技术流首选”
如果说MJ是给“愿意出钱换省事”的人准备的,SD就是给“愿意花时间换自由”的人准备的。SD生态强大在两点:
- 模型市场成熟。人像领域公认好用的写实模型已经非常丰富,比如MajicMIX realistic、majicmix、ChilloutMix等,每个模型都有自己的“审美脸型”,有的偏冷艳御姐,有的偏邻家少女。你可以反复试,找到最贴身的那款。
- 控制力极强。除了文字提示词,你还能用ControlNet控制人物的姿势(OpenPose)、面部表情(FaceID)、构图边缘,甚至直接把一张参考图的姿势和风格迁移到新图上。配合LoRA模型,你可以让同一个人物在多张图中保持长相一致——这是MJ目前做不到的。
SD的上手门槛也高:如果你用云服务(比如AutoDL、青椒云)或者本地方案,要面对安装环境、下载大模型、调整参数等一系列麻烦。不过现在国内有很多SD在线聚合平台,把部署问题解决了,详见后面几个。
2.3 DALL·E 3(ChatGPT内置):语义理解最准确,适合描述复杂场景
DALL·E 3本身出人像的精细度,说实话比MJ还是差一截,它生成的皮肤质感和手指细节有时候还是有“AI味”。但我依然把它列入推荐,理由是它太听话了。你对它说“画面左边是一个戴草帽的女生背影,右边是向日葵田,远景有山坡和云朵”,它能严格按你的构图逻辑来,不会自己“加戏”。这种文本控制力在做分镜、做插画概念稿时非常实用。
而且DALL·E 3支持在ChatGPT对话里多轮修改,比如“把衣服从红色改成蓝色”“把背景的光线调暗一点”,后面生成的图会延续上一张的内容布局,只改你说到的部分。这个“对话式修图”体验,其他平台目前都比不上。适合需求描述能力强、但对参数不感冒的人。
2.4 即梦AI / 可灵:国产第一梯队的“中文友好型”
国内AI绘画工具这几年的进步超出很多人预期。即梦AI(字节跳动旗下)对中文提示词的理解非常自然,你直接用中文写“穿汉服的年轻女子站在桃花树下,落英缤纷,柔和阳光,古风人像”,它出图就能达到非常可用的程度,加上它还集成视频生成能力,能直接把静态图变成动态短片。如果你主要画国风、古风、汉服方向的人像,即梦的审美非常在线。
可灵(快手旗下)的视频能力知名度高,但它的“AI生图”模块也不差。其优势在于“图生视频”非常顺滑,先让可灵生成一张高质量人像,接着一键让图上的人物眨眼、转头、微笑。如果你想做那种“照片会动”的短片,这个工作流非常高效。这两款都免费额度足够新手玩很久。
2.5 LiblibAI(哩布哩布):国内最大SD模型社区,在线直接用
LiblibAI是我个人用得最多的在线SD平台。它把Stable Diffusion原版搬到了浏览器里,同时内置了成千上万个人像模型,涵盖国风、二次元、欧美写实、韩系复古等多个风格分类。你不需要自己部署SD,打开网页选一个模型,输入提示词就能跑图,界面还完全中文化。
这个平台解决了一个很实际的问题:SD的模型很多,但在Civitai下载动不动几个G,还要担心电脑带不带得动。LiblibAI把“选模型 + 写提示词 + 出图 + LoRA搭配”整合成了一站式体验。而且它有个“推荐模型”机制,首页就能看到近期多少人用某个模型生成了什么图,审美趋势一目了然。我的建议是:如果你想认真玩SD但不想折腾环境,直接注册LiblibAI就够了。每张高清图差不多消耗几个“算力点”,充值价格也比较友好。
2.6 吐司TusiArt:适合快速出图的在线生成站
吐司(TusiArt.com)是另一家国内在线生图平台,特点是“模型丰富 + 出图快”,人像模型非常多,而且很多模型页面上直接推荐正负提示词,你只需要点一下“填入”,再点生成就行。对新手极其友好。
我特别欣赏它的一点是“一键复制”其他用户的生成参数。你在社区里看到一张很精致的人像图,点开详情,就能看到对方用的模型、采样器、步数、提示词。复制到自己的生成框稍微改改,就能复现类似效果。这个功能对入门学习非常有帮助。吐司的劣势是高峰期排队时间略长,不过普通使用频率下影响不大。
2.7 快速选型参考
| 工具 | 审美上限 | 可玩性 | 中文友好度 | 付费模式 | 适合人群 |
|---|---|---|---|---|---|
| Midjourney | 极高 | 中等 | 中(建议用英文) | 月费约10美元起 | 不想折腾、追求氛围感 |
| SD WebUI/ComfyUI | 极高(看模型) | 极高 | 中 | 免费/算力成本 | 技术型玩家、创作者 |
| DALL·E 3 | 较高 | 中 | 高(英文更好) | ChatGPT Plus订阅 | 需要精确控制语义 |
| 即梦AI | 高(国风突出) | 中 | 极高 | 免费+会员 | 中文用户、古风爱好者 |
| LiblibAI | 高 | 高 | 极高 | 算力点充值 | 想玩SD但不装环境的人 |
| 吐司TusiArt | 高 | 高 | 极高 | 算力点充值 | 新手、追求效率的人 |
3. 人像生成的关键参数与提示词写法
选好了工具,接下来就是核心技能:怎么写提示词才能生成一张“能发朋友圈”的人像图?
3.1 通用人像提示词公式
我总结过很多次,人像提示词其实可以用一个公式概括:
质量词 + 主体描述 + 环境氛围 + 镜头语言 + 画质附加词
以生成“街拍风女生人像”为例,拆解给你看:
质量词:masterpiece, best quality, ultra-detailed, 8k wallpaper 主体描述:a beautiful Chinese woman in her mid-20s, wearing a beige trench coat, walking across a zebra crossing, street style 环境氛围:downtown Tokyo street, soft overcast daylight, shallow depth of field, bokeh background 镜头语言:shot on 85mm lens, f/1.4, cinematic lighting, photorealistic 画质附加词:highres, film grain, natural skin texture合起来就是:
masterpiece, best quality, ultra-detailed, 8k wallpaper, a beautiful Chinese woman in her mid-20s, wearing a beige trench coat, walking across a zebra crossing, street style, downtown Tokyo street, soft overcast daylight, shallow depth of field, bokeh background, shot on 85mm lens, f/1.4, cinematic lighting, photorealistic, highres, film grain, natural skin texture关键点在于“镜头语言”那一组。很多人写人像提示词只知道堆“beautiful, pretty”,忽略了镜头焦段和光圈,导致生成出来的图虽有美人但总感觉“像游戏CG”。加一句85mm f/1.4,人物和背景就会有空间压缩感,背景虚化自然了,专业感立刻上来。
3.2 负向提示词比正向提示词更重要
在SD系工具中,负向提示词(Negative Prompt)是控制质量的关键。写人像时我建议固定加这一组:
lowres, bad anatomy, bad hands, extra fingers, missing fingers, deformed hands, extra limbs, mutated face, ugly face, fused face, bad proportions, blurry, jpeg artifacts, watermark, signature, text, jpeg artifacts其中最有效的是那组手指相关的词:extra fingers, missing fingers, deformed hands。AI绘画已经解决了很大一部分“画手”问题,但偶尔还是会冒出一两根多余手指,负向词能显著降低概率。你如果用的是LiblibAI或吐司这类在线平台,很多模型已经把常用负向词预填好了,不需要自己手动敲。
3.3 关键参数:采样器、步数、CFG、高清修复
在SD类工具里,出图不只靠提示词,还要调参数。我的常用底子是:
| 参数 | 推荐值 | 说明 |
|---|---|---|
| 采样器 | DPM++ 2M Karras / Euler a | 稳定、细节好 |
| 步数 | 25-35 | 太高不一定更好,徒增等待时间 |
| CFG Scale | 5-7 | 太高会让画面发灰发硬,太低会跑偏 |
| 高清修复 | 开启,放大倍数1.5-2 | 对脸部平滑有奇效 |
| 脸型修复 | ADetailer(默认内置) | 生成后自动二次精修脸部 |
很多人把步数拉到50甚至60,其实没必要。25到35步之间画面已经收敛,多跑那些步只是浪费算力。CFG是另一个常见误区:设太高会让画面“过度解释”提示词,颜色变得不自然,皮肤出现塑料感。CFG 7以上再配合步数50,几乎是“灾难组合”。建议先从CFG 6、步数30开始,出图后根据效果微调。
3.4 关于LoRA:让“同一个人”在不同图里保持长相一致
如果你想要一个固定角色反复出图——比如创作一组同一个人物在不同场景下的照片——单靠提示词是不行的,得用LoRA。LoRA是一个很小的模型文件(通常几十到几百MB),挂载到SD模型之上,专门调控某种风格或某个角色特征。人像领域有专门的“写真LoRA”,能定义五官比例、妆容风格,还有“服装LoRA”定义特定衣服。在LiblibAI或Civitai搜索“人像”“国风”“日系”等关键词就能找到大量现成的。
挂载LoRA后提示词里要加上触发词,比如<lora:majicmix realistic:0.8>,那个0.8是权重,控制LoRA对画面的影响力度。权重太高会让人物长得太“模板化”,太低又没效果,一般从0.7到0.9之间试起。说实话,LoRA玩明白之后,AI绘画才真正从“抽卡”变成“创作”。
4. 从“能看”到“好看”:高清修复与后期润色全流程
很多人的出图流程到“生成”就结束了,然后感叹“AI画的图还是有点生硬”。其实职业玩家都会做一层“后期”,原因很简单:AI直接输出的图,分辨率通常不够发大图,且皮肤细节虽多但有时会发腻。我的标准润色流程分四步。
4.1 高清放大
AI图本身是1024×1024或1024×1536之类,用于手机壁纸够用,但想印出来或者做电脑桌面就吃力。SD类工具内置了Hires Fix,生成时可以直接二次放大。如果是已经生成好的图,我会用 Upscayl (免费开源)或 Real-ESRGAN 做外部放大,2倍放大后画质依旧干净。Midjourney用户直接在Upscale按钮上点V2/V3,选择最高倍数就行。放大完再检查一遍五官,有时候放大过程会损失眼神光,需要后面调回来。
4.2 人脸修复
人脸修复工具里最出名的是GFPGAN和CodeFormer,SD的WebUI和LiblibAI里都有内置开关。GFPGAN倾向把脸磨得光洁,适合偏网红审美的图;CodeFormer能保留更多皮肤纹理,适合写实风。我的个人建议是:先看原图眼睛和嘴巴有没有崩,再决定要不要修。如果本身已经很好看,过度修复反而会让脸变成“塑料模型”。
4.3 重新构图与调色
AI出图经常会有多余的边缘杂物,比如路人半只手、背景奇怪的电线杆。我习惯在Lightroom或者手机自带编辑里做一次裁剪,二次构图把人放在黄金分割线上。调色方面,AI原图通常偏灰偏平,轻轻加一点点对比度、提高自然饱和度、再加一层柔焦效果,质感会立刻上来。记住:调色是加法,别一步拉满。
4.4 批量出图的效率技巧
如果你需要出一批图(比如一组头像、一册人物设定),我强烈建议用“固定种子值”配合“固定提示词前缀”。具体做法是:先在SD中生成一张满意的图,把种子值记录下来,然后修改环境描述词,保持种子不变。这样出的一组图在风格、色调、人物特征上都会非常统一,效率也高。在线平台上一般也能勾选“固定种子”。否则每张图都随机,出来的东西就像不同摄影师拍的,不成系列。
5. 生成人物图最容易踩的坑:五官崩坏、相似度和合规风险
玩AI人像这么久,我遇到过太多翻车现场,这里专门写一节避坑指南。
5.1 崩脸崩手的高频场景与修复手段
崩脸最常发生在“多人同框”的时候。一个画面里两个人以上,AI的注意力会被分散,五官扭曲概率直线上升。解决方案有两个:一是让每位角色分别单独生成,再用局部重绘(Inpaint)或者PS把人物合成到一起;二是打开ADetailer,它能检测出画面中每一张人脸并单独精修,大幅降低翻车率。手的问题集中在手指数量和弯曲方向,除了加负向词,更好的办法是尽量让画面里的手别太复杂——比如手放口袋里、拿咖啡杯、背在身后。等画图技术成熟了再接复杂手势。
5.2 关于“像真人”的边界与平台审核
这里必须说点掏心窝的话。AI绘画可以生成很逼真的人像,但主流平台都会对“深度伪造”和“未经授权的真人肖像”做限制。你自己的脸可以生成,明星的脸、网上别人的照片生成后就涉及肖像权和伦理问题。Midjourney在这方面审查很严,一些国内平台也在加校验。我个人的经验是:玩AI人像,最好的方向是“创作虚拟角色”,不是“复刻真人”。给自己取个英文代号,设定性格、职业、穿搭风格,让AI画一套完整人设图,这比蹭真人热点好玩得多,也更安全。
5.3 尺度与内容合规
虽然某些标签类的讨论在一些平台里一直存在,但我还是要说一句:很多在线AI绘画网站的“无审核”模式,本质上是把风险转嫁给用户,轻则封号,重则惹上法律问题。正规工具的审核机制不是为了扫兴,而是让这个生态能持续下去。如果你真的需要做偏艺术向的人体作品,请选择支持“艺术裸体”的垂直平台,并且确认自己的用途合法合规。我更推荐把精力放在时尚、写实、国风、科幻这些方向,作品空间一点也不小。
5.4 “免费无限出图”背后的隐性成本
不少刚接触AI绘画的朋友喜欢找“完全免费无限次生成”的网站。我的经验是:这种工具要么是拿你的算力挖矿,要么是把你的图投入训练集,要么会偷偷压缩画质输出低分辨率图。算力是有成本的,免费背后一定有代价。与其到处找免费羊毛,不如选一个靠谱平台买额度,专注在作品质量上。你随手画的垃圾图即便免费生成一万张,也不如认真调三张好图。
6. 一套可以直接抄的人像生成工作流:以“傍晚街拍风女生人像”为例
最后,我把自己最近常用的完整工作流拆解出来,给你一个可以直接照做的参考。
6.1 第一步:选定平台与模型
如果追求出片氛围,我用Midjourney;如果要批量出图或者自定义人物,我选LiblibAI + MajicMIX Realistic模型(或者类似写实人像模型)。这篇文章的示例流程以LiblibAI为例,因为对国内读者来说门槛更低。
6.2 第二步:写提示词
正向提示词(完整示例,可直接复制):
(masterpiece, best quality:1.2), ultra-detailed, 8k, photorealistic, 1girl, solo, a 25-year-old Chinese woman with black long hair, wearing a camel-colored wool coat and black boots, standing beside a glass window at dusk, city street background, warm streetlight, soft reflections, misty breath in cold air, cinematic lighting, 85mm lens, f/1.8, shallow depth of field, natural skin texture, film grain, highres负向提示词:
lowres, bad anatomy, bad hands, extra fingers, missing fingers, deformed hands, extra limbs, mutated face, ugly face, blurry, jpeg artifacts, watermark, signature, text, monochrome这里的(masterpiece, best quality:1.2)含义是给这两个质量词1.2倍加权,确保画面整体精度更稳。其他描述尽量信息清晰,避免语义冲突。
6.3 第三步:设置参数并出图
模型:MajicMIX Realistic
采样器:DPM++ 2M Karras
步数:30
CFG:6
分辨率:768×1152(竖构图更适合人像)
开启ADetailer(人脸修复)
种子:随机(先出第一批)
第一次先出4张,不要指望第一张就完美。AI绘画本质是“抽卡”,你的任务是在一批图里发现最有潜力的那张,而不是反复刷到满意为止——时间成本太高。
6.4 第四步:图生图微调
从第一批4张里选一张构图最舒服的,放入“图生图”(img2img)模块,开启局部重绘。提示词里保留主体,但删除你不喜欢的元素(比如背后多余的电线杆),修改后重新生成。图生图的“重绘幅度”(Denoising Strength)建议控制在0.3到0.5之间,低于0.3会“一点没改”,高于0.5容易“整容整过头”。这一步的节奏是:小幅度、多轮迭代,让画面一点点接近你想要的。
6.5 第五步:放大与后期
选中满意的图后,点“高清修复”,放大倍数1.5到2倍。出来后再用Upscayl做一次外部放大,分辨率到2048以上作为最终版本。随后进Lightroom,稍微压暗背景、提亮人物面部,加一点点清晰度。这张图就可以放进你的作品集了。
6.6 个人心得
用这个工作流,我个人从“出图-修图-定稿”大概需要15分钟,相比最开始动不动刷半小时,效率提升确实很明显。核心不是熟练度,而是“提前想好自己要什么”和“果断放弃残次品”这两个习惯。AI绘画的产出质量,很大程度取决于你对图片的判断力,而不是你会多少咒语。多看图、多拆解优秀作品、多试不同参数组合,这个过程比任何工具升级都管用。
另外提醒一句,不要在别人的电脑上随意登录这类平台的账号,出图的提示词和成品图都能体现个人创作偏好,算是数字隐私的一部分。自己保存好秘密参数和模型组合,体验会更好。