1. 从“原图我不吃的哈”说起:一个AI绘画玩家的自我修养
最近在AI绘画的社群里,一个梗突然火了起来:“原图我不吃的哈”。这句话的出处,是某位玩家在分享自己用Stable Diffusion等模型生成的作品时,面对别人“求原图”的请求,给出的一个俏皮又带点傲娇的回应。它背后折射出的,是AI绘画圈一个非常核心且有趣的议题:我们究竟在“生成”什么,又在“创作”什么?
当你说“原图我不吃的哈”时,你其实在声明几件事:第一,这张图不是简单的模型“直出”,它经过了你的精心调整和后期处理;第二,你投入了时间、审美和判断力,赋予了这张图独特的价值;第三,你希望别人关注的不是模型的基础能力,而是你作为“炼丹师”或“咒术师”的二次创作成果。这恰恰是AI绘画从“玩具”走向“工具”,从业余爱好走向专业创作的关键一步。今天,我们就来聊聊如何真正“成为模型”,而不仅仅是“使用模型”。这不是一篇简单的软件教程,而是一次关于创作方法论、工作流构建和审美判断力的深度探讨。
2. 理解“模型”:你的画笔,而非你的代笔
很多人把AI模型看作一个“许愿机”,输入一段描述(Prompt),就能得到完美的图片。这种想法是通往“原图直出”陷阱的第一步。要成为模型的主人,首先要破除这个迷思。
2.1 模型是概率的集合,不是答案的宝库
以Stable Diffusion为例,它的本质是一个经过海量图文数据训练的概率模型。当你输入“一个女孩,金色长发,站在樱花树下”时,模型并不是去它的数据库里找一张匹配的图,而是根据学习到的规律,从一张纯噪声图片开始,一步步“猜测”每个像素点最可能是什么颜色,最终“算”出一张图。这个过程充满了随机性。同一段提示词,每次生成的结果都不同,这就是“种子”(Seed)在起作用。
提示:理解这一点至关重要。这意味着模型给出的永远是一个“可能性分布”中的样本。你的工作,就是从无数个可能的样本中,筛选、引导、修正出最符合你心中所想的那一个。模型是提供素材的“矿场”,而你才是那个“雕刻师”。
2.2 “原图直出”为什么不够“吃”?
一张未经任何调整的模型直出图,通常存在以下问题,使得它难以被称为“作品”:
- 构图与焦点问题:模型可能无法精准理解你构图的重点。比如你想要一个中心对称的肖像,它可能把人脸放在了一侧;你想要一个充满故事性的远景,它可能给了一个大头贴。
- 细节崩坏:这是AI绘画的老大难问题。手指数量异常、肢体扭曲、五官错位、纹理混乱(如毛衣变成肉色)等。直出图往往在这些细节上经不起放大审视。
- 风格与质感不统一:你可能想要一张赛博朋克风格的插画,但模型给出的结果可能在光影、线条硬度和色彩饱和度上摇摆不定,导致画面风格混杂,缺乏整体感。
- 审美平庸化:模型在训练时学习了海量数据,其输出容易趋向于“平均审美”。直出的图往往看起来“还行”,但缺乏让人眼前一亮的独特性或艺术张力。
因此,当你说“原图我不吃的哈”,潜台词是:“我已经帮你们把上面这些问题都处理过了,现在呈上来的,是一道精心烹制的菜肴,而不是食材本身。”
3. 构建你的“重生”工作流:从咒语师到导演
要告别“原图直出”,就需要建立一套系统的工作流。这套工作流的核心思想是:将单次“生成”变为多次“迭代”和“加工”。下面我以Stable Diffusion WebUI(Automatic1111或ComfyUI)为例,拆解一个进阶工作流。
3.1 第一阶段:精准的“蓝图绘制”(提示词与参数工程)
这一步的目标不是得到完美成品,而是得到一张“潜力股”底图。
- 分层提示词法:不要把所有描述塞进一个提示词框。学会使用语法,如
(关键词:权重)来强调或弱化某些元素。更高级的用法是利用Alternate Syntax(交替语法)或BREAK关键字来分隔不同时间步长的提示内容,从而控制画面中不同元素的出现时机和强度。例如,你可以先让模型确定构图和人物姿态,再在后续步骤中细化服装和背景细节。 - 负面提示词的艺术:负面提示词和正面提示词同等重要。除了通用的
bad hands, extra fingers, deformed等,你应该针对每次生成的具体问题添加负面词。例如,如果画面总是偏灰,可以加入low contrast, dull, muted colors;如果人物表情呆板,可以加入expressionless, blank stare。建立一个自己常用的负面词库是专业化的标志。 - 参数不是玄学:
- 采样步数(Steps):并非越高越好。20-30步对于DPM++ 2M Karras这类采样器通常已足够清晰,再增加步数收益很小且耗时。关键在于找到清晰度和效率的平衡点。
- 采样器(Sampler):不同采样器有不同特性。Euler a 创意强、出图快但可能不稳定;DPM++ 2M Karras 稳定、细节好,是精修常用选择;DDIM 则更适合需要高度可复现性的情况。
- 重绘幅度(Denoising Strength):在Img2Img(图生图)中,这是最重要的参数之一。低值(0.2-0.4)用于微调细节和风格;高值(0.6-0.8)则用于大幅度改变画面内容,相当于在原有构图基础上进行“重新想象”。
3.2 第二阶段:外科手术式的“局部修正”(Inpainting与局部重绘)
这是让你告别“整体重来”噩梦的核心技能。拿到一张构图满意但局部有瑕疵的图后,使用局部重绘功能。
- 修复崩坏细节:用画笔工具精确涂抹有问题的手部、脸部。在提示词框中仅描述你希望修复成的正确样子,比如“perfect hands, five slender fingers, natural pose”。关键点:勾选“仅重绘蒙版区域”,并适当提高蒙版边缘模糊度,让修复部分和原图自然融合。
- 定向增加细节:觉得人物衣服纹理太简单?涂抹衣服区域,提示词输入“intricate lace embroidery, detailed fabric texture”。觉得背景太空?涂抹背景,输入“ancient forest, dappled sunlight, volumetric fog”。这相当于你拿着不同的“画笔”和“颜料”,在画布的不同区域进行精细加工。
- 使用Inpainting专用模型:许多社区训练了专门用于局部重绘的模型,它们在修复一致性(如皮肤纹理、光照方向)上表现远优于通用大模型。在你的工作流中集成这样的模型,能极大提升修复质量。
3.3 第三阶段:风格的“灵魂注入”(LoRA与ControlNet)
如果说大模型决定了画面的“基因”,那么LoRA和ControlNet就是你进行“基因编辑”和“形体控制”的工具。
- LoRA:微调风格与特征:LoRA是一个小型模型文件,可以为大模型注入特定的风格(如“吉卜力风格”、“胶片摄影”)、角色特征或画风。用法是在提示词中激活它,例如
<lora:FilmGirl_v10:0.8>。这里的0.8是权重,需要你根据效果调整。我的经验是:同时使用多个LoRA时,总权重和不宜超过1.2,否则容易导致画面过饱和和崩坏。最好一次只突出一个核心风格LoRA。 - ControlNet:绝对控制构图与姿态:这是让你“成为模型”的最强助力。它允许你输入一张参考图(如线稿、姿势图、深度图、边缘检测图),让AI严格按照参考图的构图来生成内容。
- Canny(边缘检测):适合将你的手绘线稿或简单草图转化为精美彩图。
- OpenPose(姿态检测):可以上传一张真人照片,提取其骨骼姿势,让生成的人物拥有完全相同的、自然复杂的动作。彻底解决了“AI人物姿势僵硬”的问题。
- Depth(深度图):控制画面的景深和前后景关系,让生成的作品更有立体感。
- Tile(分块重绘):用于无损放大和补充超细节。它能让AI在放大图片时,不是简单地拉伸像素,而是智能地“想象”并填充放大后所需的细节纹理。
一个实战组合拳案例:我想生成一个特定姿势的武侠角色。我会先找一张姿势参考图,用OpenPose提取骨架;再找一张山水画作为背景风格参考,用Canny提取其线条轮廓;然后开启两个ControlNet单元,分别加载骨架和轮廓,再在提示词中描述人物衣着、相貌,并加入一个水墨风LoRA。这样,我就能精确控制人物动作、背景构图和整体风格,生成的图已经高度接近我的最终构想,远超“原图直出”。
3.4 第四阶段:最后的“抛光打磨”(后期处理与外工具联动)
即使经过上述步骤,图片可能仍需最后加工。
- 高清修复(Hires. fix)与放大:在文生图时直接启用高清修复,或在生图后使用Extras标签页的放大功能。推荐使用UltraSharp、4x-UltraSharp等放大模型,它们在保持清晰度的同时能优化细节。注意:单纯放大分辨率不会增加新细节,配合适当的“重绘幅度”才能让AI“想象”出更丰富的纹理。
- 与外置图像软件联动:不要局限于WebUI内部。
- 将图片导入Photoshop或GIMP,使用图章、修复画笔工具手动处理AI难以解决的、极其复杂的结构错误。
- 使用调色工具(曲线、色相/饱和度)统一全局色调,增强光影对比,让画面更具氛围感。
- 可以添加镜头光晕、颗粒噪点等特效,增加作品的真实感和质感。
4. 审美与判断力:你的核心价值所在
技术流程可以学习,但最终让作品脱颖而出的,是你的审美和判断力。这需要长期的积累和主动训练。
- 建立视觉资料库:定期浏览ArtStation、Pinterest、Behance等平台,收藏打动你的作品。分析它们好在哪里:是构图?色彩搭配?光影氛围?还是叙事张力?不要只看AI作品,多看顶级的摄影、绘画、电影截图。
- 学会“诊断”图片:拿到一张AI直出图,不要只看整体感觉。有意识地去“挑刺”:透视对吗?光影来源统一吗?人物表情是否符合情境?材质表现是否合理?这种诊断能力,会直接指导你如何编写负面提示词,以及选择在哪个环节进行干预。
- 定义你自己的风格:在熟练运用技术后,尝试融合不同的LoRA,调整出独特的色彩倾向和画面质感。你甚至可以收集自己满意的作品,用Dreambooth等技术训练一个专属自己的风格模型。这时,你就真正拥有了一个体现你个人审美的“画笔”。
5. 从“生成”到“创作”:心态的转变
最后,我想分享心态上的几点体会,这或许比技术更重要。
- 接受不完美,拥抱过程:AI生成充满随机性,失败是常态。不要把一次难看的生成看作挫折,而应视为一个数据点,告诉你当前的提示词或参数组合需要调整。享受这个调试、探索、惊喜迭出的过程。
- 混合媒介创作:不要被“纯AI”束缚。可以用手绘草图控制构图,用摄影照片提供纹理参考,用3D软件搭建基础场景和光影,最后用AI进行渲染和风格化。你扮演的是“导演”和“合成师”的角色。
- “原图我不吃的哈”背后的骄傲:当你能坦然说出这句话时,意味着你已跨越了单纯索取工具的阶段。你通过一系列专业的、可复现的操作,将原始的、粗糙的“可能性”,塑造成了完整的、带有你个人印记的“作品”。这份骄傲,来自于你对整个创作流程的掌控,以及对最终成果负责的态度。
所以,下一次当你看到别人精美的AI作品时,不妨问一句:“能分享一下工作流吗?”这比单纯要“原图”更有价值。而当你分享自己的作品时,也可以自信地附上一句:“原图我不吃的哈,但可以聊聊我是怎么‘煮’出来的。”这既是对自己劳动的尊重,也是向更高阶的创作社区迈进的一张名片。