说起 Stable Diffusion 的提示词,网上随便一搜就是一大堆“咒语大全”“万字词库”。但很多人照着抄完,生成的图还是四不像——要么画风不对,要么细节崩坏,要么颜色脏得没法看。问题出在哪?多半不是因为词不够多,而是压根没搞清楚提示词这玩意儿到底是怎么被模型消化的。
这篇东西我不打算再给你堆一份“万能词表”。我会把提示词拆开揉碎,从语法规则、权重控制、常用词分类,到实际项目中的完整案例、模型与插件之间的配合,再到那些我在实操里踩过的坑,一次性讲透。不管你是刚装好秋叶整合包的小白,还是已经在用 ComfyUI 搭工作流的进阶玩家,这都值得你花几分钟看完。
1. 提示词不是咒语,是一份结构化的需求说明书
1.1 先搞清楚提示词到底在干什么
Stable Diffusion 里的提示词,本质上是给 CLIP 文本编码器看的一段“需求描述”。CLIP 会把你的文字转换成一串语义向量,再去引导扩散模型在去噪过程中把对应的特征画出来。所以提示词并不是什么神秘咒语,它更接近一份结构化的需求说明书——你描述得越清晰、越有条理,模型就越容易还原你脑子里的画面。
我见过太多人把提示词写成“a beautiful girl, nice dress, beautiful face, beautiful eyes, beautiful hair, beautiful everything”。这种叠形容词的写法让模型非常迷茫:满屏都是 beautiful,主体是什么?环境在哪?风格是什么?镜头怎么摆?全都是一笔糊涂账。而真正高效的提示词,应该是把画面切分成模块,按优先级逐层描述——先定主体,再补环境,再定风格,最后加质量词和细节修饰。
1.2 为什么同一条提示词在不同人手里效果不一样
这一点经常被忽略:提示词效果严重依赖你用的底模。同一个“1girl”,二次元底模和写实底模的理解完全不同;同一个“photorealistic”,在不同大模型里对质感的还原度也天差地别。换句话说,提示词和模型是绑定的,脱离模型谈提示词,和脱离食材谈菜谱没有区别。
而且,Stable Diffusion 对提示词的处理还涉及分词器。WebUI 的 CLIP 编码器会把一段提示词切成多个 token,每个 token 都会被映射成语义向量。有些词会被拆得很碎,比如 “masterpiece” 有时会被拆成几个子词,导致权重被稀释。这就是为什么同样的词,放在不同的位置、不同的长度下,效果会不一样。理解这一点之后,你就不会再去背什么“必抄模板”了,而是会自己判断一段提示词为什么有效、为什么失效。
2. 提示词语法与权重控制:别小看括号和逗号
2.1 组合顺序和分隔符的讲究
Stable Diffusion 的提示词,最简单的形式是用逗号分隔的关键词组合。但顺序很重要——排在越前面的词,模型投入的注意力权重越高。所以主体词一定要往前放,修饰词往后放。比如:
1girl, solo, long silver hair, blue eyes, school uniform, cherry blossoms, spring, sunlight, soft lighting, highly detailed, masterpiece这条顺序是合理的:先说“一个人物”,再细化人物特征,然后补场景,最后加光照和质量修饰。如果你把 “masterpiece, best quality” 放最前面,模型会优先处理质量词,但主体的特征反而不够突出,细节容易飘。
有一个常见误解:“提示词越短,AI 自由发挥空间越大;提示词越长,控制力越强。”这话对但也不全对。更准确的说法是:提示词越长,模型要兼顾的信息越多,如果内部逻辑冲突(比如既想要科幻机甲又想要和风古建筑但没有说明融合方式),结果就会变成单车变摩托的缝合怪。所以,提示词长可以,但要长在“合理补充”上,不能是堆砌。
2.2 权重括号的正确玩法
这是新手最容易搞混的地方。WebUI 和 ComfyUI 里最通用的权重语法是(word:倍数)。比如:
(masterpiece:1.2)表示把 masterpiece 的权重提高到 1.2 倍[word]表示权重降到原来的 0.9 倍左右(word)表示权重提高到 1.1 倍- 多层括号会叠加,比如
((word))相当于约 1.21 倍
注意,ComfyUI 默认的 CLIP 加载器对(word:1.2)这种格式的解析和 WebUI 略有差异,但大部分情况都能兼容。在你用提示词插件做动态批量生成时,更要注意权重语法的转义问题——有些插件会把括号当成模板语法,导致权重失效。
我自己的习惯是:关键主体词的权重控制在 1.1~1.3,太高的权重(比如 1.5 以上)会产生色彩溢出或结构畸形,画面容易“烧焦”。质量词我基本不再加权重,因为大多数模型在训练时已经内置了对 “masterpiece” 这类词的理解。
2.3 采样步数、CFG Scale 和种子的配合关系
提示词不是独立生效的,必须配合一组稳定的生成参数才有意义。
- 采样步数:WebUI 一般 20~30 步就够,太少了细节不足,太多了后面的步数基本在重复微调,对提示词表达的还原度提升有限
- CFG Scale:这个参数控制的是“图片追着提示词跑的力度”。默认 7 左右比较稳。CFG 太低,画面会懒散,不贴合提示词;CFG 太高,画面会过饱和、出现伪影,甚至“色彩烧穿”
- Seed:固定种子后,同一套提示词生成的结果是可复现的。调提示词的时候,锁住 Seed 去改动一个词,你才能真正看出那个词对画面的影响
所以,当你准备调试提示词时,建议先固定一组已经验证过的基础参数(步数 25、CFG 7、采样器 DPM++ 2M Karras),然后只改动提示词本身。这样你才能逐步建立对“词”的直觉。
3. 常用提示词分类整理:从摄影到插画到素描
3.1 质量修饰词和画质增强词
这类词几乎是所有提示词的标配,但注意不要一口气塞十几个。常用的包括:
masterpiece(杰作级画质)、best quality(最佳质量)、ultra-detailed(超细节)、highly detailed(高度细节)、8k wallpaper(8K 壁纸级清晰度)
对写实类图片,可以追加:
photorealistic(照片级真实)、raw photo(原始照片质感)、professional photography(专业摄影)、depth of field(景深)、bokeh(背景虚化)
对二次元或插画类图片,可以追加:
anime style(动漫风格)、illustration(插画)、artbook(画集质感)、2D(二平画面)、clean lineart(干净线稿)
这里有个经验:质量词的作用是提升画面完成度,但不能替代对主体和构图的描述。只堆质量词,出来的图大概率是“看起来很精致但内容空洞”的废图——就像一篇通篇华丽辞藻却没有中心思想的作文。
3.2 风格词:你想让 AI 用什么“画风”来画
风格词是提示词里最出效果的一类,很多所谓“咒语”其实就是把各种风格词组合起来。常见的风格方向包括:
| 风格方向 | 常用提示词 | 适用模型类型 |
|---|---|---|
| 写实摄影 | photorealistic, 35mm photography, cinematic lighting | 写实底模 |
| 动漫日系 | anime style, shonen style, pastel colors | 二次元底模 |
| 国风古风 | traditional Chinese painting, ink wash painting, oriental style | 通用底模 |
| 科幻概念 | sci-fi, futuristic, cyberpunk, mecha | 通用底模 |
| 油画笔触 | oil painting, impasto, brush strokes | 写实/通用底模 |
| 素描手绘 | pencil sketch, graphite, monochrome, cross-hatching | 通用底模 |
说到素描,很多人想生成“素描画”效果,就直接在提示词里写pencil sketch, black and white。这能出图,但往往线条乱、调子不够干净。更稳妥的做法是先用正常提示词生成一张构图完整的图,再通过图生图或者 ControlNet 的线稿预处理,把它转成素描。热词里被反复提的“stable diffusion 素描画”,大概率就是这类需求——不是要 AI 凭空画素描,而是要把已有的画面转成素描质感。这个思路切换很重要,能帮你少走很多弯路。
3.3 内容词:主体、环境、光照、镜头
这部分是提示词的地基。建议你每次写提示词时,都按这个模板来组织内容词:
- 主体描述:谁/什么物体,外貌特征、动作、表情、服装
- 环境背景:室内/室外、具体场景、季节、天气
- 光照条件:自然光/人造光、硬光/柔光、黄金时刻/夜光
- 镜头语言:特写/中景/全景、俯拍/仰拍、广角/长焦、景深效果
举个例子。如果你想出一张“黄昏时站在海边的短发女孩”的照片式画面:
1girl, short hair, white dress, standing on the beach, ocean, sunset, golden hour, warm light, wind blowing, medium shot, photorealistic, highly detailed是不是比单纯写 “a girl at the beach” 要清晰得多?关键就在于把“环境”和“光照”填进去。很多时候你觉得 AI 生成的颜色不通透,可能只是因为你忘了告诉它“光照条件”。
3.4 反向提示词:给 AI 拉一张负面清单
反向提示词(Negative Prompt)的价值被严重低估。合理使用反向提示词,能有效消除多余手指、畸形构图、模糊、水印等常见问题。
常用的反向词:
bad anatomy(解剖结构错误)、bad hands(手部错误)、extra fingers(多余手指)、extra limbs(多余肢体)lowres(低分辨率)、blurry(模糊)、jpeg artifacts(压缩伪影)watermark(水印)、text(文字)、signature(签名)、logo(标志)
但反向词也不是越多越好。有些人的反向提示词能写一整屏,结果画质反而变得灰蒙蒙、缺少层次感,甚至把正常细节也给“反”掉了。我常用的策略是:正面提示词表达 70% 的内容,反向提示词只放 20% 的“高频错误”,剩下 10% 是针对当前模型易错点的定制词。
比如写实模型容易在皮肤上画出塑料感,我就会在反向里加plastic skin, overly smooth skin。动漫模型容易在某些小模型上产生杂乱的线条,我会加unclean lineart, messy lines。这才是反向提示词的进阶用法——不是堆数量,而是按模型特性精准排雷。
4. 实战案例拆解:三组不同需求的完整提示词
4.1 人像摄影类提示词完整结构
需求背景:想生成一张“电影感强、氛围感足的女主角特写”,用于小说封面或短视频配图。
正向提示词:
1girl, brown wavy hair, freckles, wearing a vintage coat, rainy window behind, reflections, moody atmosphere, teal and orange color grade, soft cinematic light, shallow depth of field, 85mm lens, close-up portrait, photorealistic, RAW photo, highly detailed反向提示词:
bad anatomy, bad hands, extra fingers, deformed face, blurry, lowres, watermark, text, overexposed, washed out colors参数参考:步数 28,CFG 7,采样器 DPM++ 2M Karras,尺寸 512x768(后期高清修复到 1024x1536)。
拆解逻辑:
moody atmosphere和teal and orange color grade负责定调,后者是电影感调色的关键词组合85mm lens, shallow depth of field负责镜头层次,85mm 是标准人像焦段,能带来自然的背景压缩感rainy window behind, reflections负责环境叙事,让画面不空洞soft cinematic light负责光线质感,比单纯写good lighting要精准得多
4.2 国风插画类提示词完整结构
需求背景:想做一张“国风水墨风的古代仕女”,用于自媒体配图。
正向提示词:
1girl, traditional chinese hanfu, ancient chinese painting style, ink wash painting, flowing lines, soft gradient ink, misty mountains in background, plum blossoms, poetic atmosphere, negative space, elegant composition, masterpiece, best quality反向提示词:
bad anatomy, bad hands, watermark, text, western style, oil painting, 3d render, photorealistic, extra objects同样的一套思路:主体是谁,穿什么,背景是什么,用哪种画风,画面情绪是什么,最后加质量词。重点是反向提示词里加了western style, oil painting, 3d render,否则 AI 很容易把国风画成“古装合成大乱炖”,身体比例和质感都走偏。
因为水墨画强调留白和笔意,所以negative space很关键,它告诉模型“不要把画面塞满”。如果没有这个词,AI 倾向于把所有画面区域都填上内容,留白感就没了。
4.3 产品广告类提示词完整结构
需求背景:需要一张“高端香水瓶在晨光中的产品图”,用于电商详情页。
正向提示词:
perfume bottle, glass material, gold cap, amber liquid, on a marble surface, soft morning light, long shadows, clean background, luxury advertising style, studio product photography, macro lens, high contrast, ultra detailed反向提示词:
low quality, blurry, distorted shape, broken glass, text, watermark, cluttered background, yellowish tint产品图的核心是材质和光影。marble surface提供高级感的衬底,soft morning light, long shadows构成光影氛围,macro lens控制视角,luxury advertising style定下广告感基调。反向词里cluttered background很关键——电商产品图最怕背景杂物多。
5. 模型与插件:提示词发挥作用的真正舞台
5.1 模型决定下限,提示词决定上限
之前说过,提示词一定要匹配模型。很多新手在通用模型里写动画风格词,效果通常不如在二次元模型里随便写几个词来得好。所以你要先理清楚几个概念:
- 大模型底模(Checkpoint):决定了整体画风、色彩倾向和部分概念的理解能力。比如二次元底模、写实底模、2.5D 底模
- VAE:决定了色彩的还原度。有些模型外挂 VAE 缺失,画面会发灰,相关关键词救不回来
- LoRA:用于锁定某个具体风格、角色或物体,配合提示词触发
模型下载方面,现在常见渠道是 Civitai 和国内一些镜像站。下载时注意看底模的说明页,哪些提示词是模型作者推荐使用的,哪些触发词可以激活模型特性,这些都直接关系到提示词写作。比如有些模型要写nsfw或/imagine这类特殊触发词,不写就不生效。
5.2 秋叶整合包和 ComfyUI:提示词输入方式差异
热词里反复出现“stable diffusion 秋叶整合包”“stable diffusion(comfyui)”。我的建议是:
- 新手先用秋叶整合包,自带的 WebUI 界面友好,提示词输入框就是文本框,负面提示词也有单独输入区,调试直观
- 进阶玩家慢慢迁移到 ComfyUI。ComfyUI 的提示词同样是文本输入,但它是通过节点连接 CLIP 加载器的,可以做到完全自定义的工作流。比如一次加载多个提示词,批量更换风格词,或者用节点控制不同提示词的权重变化
ComfyUI 里有一类非常实用的提示词插件,比如动态提示词(Dynamic Prompts)扩展,可以让你写一个“模板”然后批量展开成几十条提示词。比如:
{masterpiece|best quality|ultra detailed}, 1girl, {pink|blue|white} hair, {school uniform|sailor uniform|dress}这条模板会自动展开成 3 × 3 = 9 条不同的提示词组合,非常适合做风格探索和批量测试。我用这个插件跑过一次 LoRA 触发词测试,一次性生成几十张对比图,效率比手动改词高太多了。
5.3 Instant-ID 这类人脸一致性扩展怎么配合提示词
最近很热的 Instant-ID 也是提示词的重要搭档。它的作用是给 SD 提供一张参考人脸,让生成的角色保持面部特征一致。配合提示词时,基本套路是:
reference photo of a woman, (face consistency:1.2), 1girl, detailed face, close-up portrait, photorealisticInstant-ID 的核心是控制面部信息,所以提示词里不需要再花太多篇幅描述五官,只需给一个方向性描述(比如年龄段、气质、表情),其他交给参考图去锁。这一点和纯靠提示词生成角色完全不同——很多人在用 Instant-ID 时,还在提示词里死磕五官细节,结果反而干扰了面部一致性。
6. 提示词调试的排错链路与实用心得
6.1 画风不对,先检查模型,再检查提示词
我在实际使用中发现,至少一半的“提示词没用”案例,根源出在模型和参数的匹配上。所以当你发现生成结果不对劲,不要急着改提示词,按下面这个顺序排查:
- 检查当前选中的底模是不是你想要的风格(最容易犯的错:以为切了模型,实际还在用的旧模型)
- 检查 VAE 是否正确加载,画面发灰先换 VAE
- 检查采样器和 CFG 参数,CFG 过高会让颜色烧焦,过低会让画面平淡
- 用一条极其简单的提示词做基线测试,比如只写
1girl,看模型的基础画风 - 确认没有“脏数据”干扰,也就是你前面跑出来的图是不是还在影响后续结果
6.2 提示词被截断:CLIP 的 token 上限问题
WebUI 的 CLIP 编码器一般有 75 token 的容错机制,超过部分会分段处理。换句话说,提示词超过一定长度后,多出来的部分对画面的影响会明显减弱。所以,提示词越长不等于越精确。
如果你在写长提示词,优先把最重要的主体和风格词放在最前面。装饰性的质量词放在后面。如果确实需要写超级长,建议用 ComfyUI 配合 Text Encoder 节点来扩展,或者用额外的提示词融合节点来处理。
6.3 手指和肢体异常,光加负面词是不够的
手部崩坏是 SD 最常见的问题。反向提示词里加bad hands, extra fingers有用,但只能降低概率,无法根除。想要彻底解决,更靠谱的做法是:
- 使用专门的手部修复模型,比如 ADetailer 插件自动检测人脸、手部并局部重绘
- 在提示词里避免复杂的动作描述,越简洁的动作,手部结构越不容易崩
- 生成后手动局部重绘(inpaint)手指区域,用更低 denoising strength 重跑
6.4 作为总结的最后一句
根据我个人经验,提示词能力的提升,不是一个词一个词背出来的,而是通过“固定变量 + 大量对比”逐步积累的。每次跑图都锁住种子,改一个词,看画面的变化,坚持两周左右,你对自己常用模型的理解就会有质的飞跃。这套方法比起收藏无数份“提示词大全”,要靠谱得多。
最后再分享一个小技巧:写提示词时,刻意去描述光线、镜头、材质这三个维度,而不是一味堆“beautiful”“lovely”这类情绪形容词。光线能让画面立体,镜头能定构图,材质能提升质感——这三样到位了,哪怕你的提示词很短,出图的质量也会明显上一个大台阶。