朋友发来一张图:一个女生在镜子前拍穿搭,浅灰条纹衬衫、黑色荷叶边短裙、羽毛发饰,背景是木质楼梯和白色护墙板。光线柔和得像电影布光,皮肤不是白,是”冷白皮”的漫反射质感——我说”这图挺真的”,他回”AI 出的”。
第一反应是不信。但放大看细节——衬衫的细条纹对上了,胸口的黑色刺绣 QY 字母对上了,连光影扫过锁骨的角度和镜子里反射的颜色都统一。这不是碰巧。
这条 Prompt 和绝大多数穿搭 Prompt 的区别,不在于它写了多少单品,而在于它给每样东西都配了一个数值。
这条 Prompt 第一眼在看什么
跳过技术细节,先说直觉。看完成品图,你会觉得三件事靠谱:
- 人物不是贴上去的。她真的站在那个空间里——木质楼梯有纵深,护墙板是干净的背景面,光线在墙上和人物身上遵循同一套物理逻辑
- 穿搭不是”大概像”。浅灰条纹、黑色荷叶边、羽毛发饰、链条包,每一件都精确。不是”一个女生穿衬衫和短裙”,而是”这一套”穿搭
- 肤色不是”白”,是冷白皮的漫反射。暖光打上去是奶油色,不是蜡黄色——这是材质层在起作用,不是色调层
这三点分别对应这条 Prompt 的三个核心技术决策:物品链编码、权重场分层、材质描述公式。下面逐一拆开。
核心机制:物品链和权重场是怎么协同的
大部分穿搭类 Prompt 长这样:
一位女性穿着白衬衫和黑色短裙,站在木楼梯前
这条 Prompt 多出了两个维度:
- 物品链——从头发到脚,按空间顺序串起所有穿戴物。每个物品都有精确修饰词(细条纹、荷叶边、链条、羽毛),不做”大概描述”
- 权重场——8 个数值权重(1.2-1.6),各自管控画面中的一个独立维度(面光、皮肤、骨相、细节、构图、审美方向)。每个维度可以独立调参
两条线不是分开跑的——它们交叉作用。”冷白皮漫感质感”这个词被皮肤权重(1.6)放大,”细条纹”被细节权重(1.4)保证清晰度。
我把这种协同机制称为「物品链+权重场」双线编码。
下面分五层拆开。
第一层:穿搭物品链——从头到脚每件单品都是锚点
把 Prompt 里的穿搭物品按人体空间位置排开:
| 空间位置 | 物品 | 修饰词 | 编码策略 |
|---|---|---|---|
| 头部 | 发饰 | 黑色、羽毛、盘起 | 三维修饰(颜色+材质+形状) |
| 颈部 | 项链 | — | 存在即锚点 |
| 上身 | 衬衫 | 浅灰、细条纹、短袖、收腰 | 四维修饰(颜色+纹理+长度+版型) |
| 胸口 | 刺绣 | 黑色、QY字母 | 品牌级精度 |
| 手腕 | 手链 | 多条 | 数量锚定 |
| 肩部 | 链条包 | 黑色 | 单色锚点 |
| 下身 | 短裙 | 黑色、荷叶边 | 双维修饰(颜色+形状) |
| 脚 | 长袜 | 黑色 | 单色锚点 |
这个清单的设计逻辑:
修饰词按重要性梯度分配。衬衫作为视觉重心,给了四个修饰维度:颜色(浅灰)、纹理(细条纹)、长度(短袖)、版型(收腰)。链条包作为配饰只给了颜色(黑色)。密度梯度天然引导模型把算力放在正确的位置。
没写的东西不等于缺失。鞋子没写、耳环没写——但读者和模型都不会注意到。因为已给的物品密度足够高,视觉系统会自动补全空白。
空间顺序就是渲染顺序。从头到脚排列不是偶然。文生图模型对 Prompt 的前后位置敏感——排在前面(发饰)的元素比排在后面(长袜)获得更多注意力。按空间顺序写,恰好也符合视觉优先级:人脸附近 > 下半身。
物品链规则:按人体空间顺序(头→脚),视觉重心位置给 4 维修饰,次要位置给 1-2 维,密度够了就不用写全。
第二层:权重场——8 个参数各自在控制什么
这是这条 Prompt 技术含量最高的一层。8 个权重参数拆开看:
| 参数 | 权重 | 控制维度 | 模型行为 |
|---|---|---|---|
| 电影级面光 | 1.6 | 面部照明质量 | 柔光方向、无硬阴影、立体感 |
| 冷白皮光滑皮肤 | 1.6 | 皮肤材质 | 漫反射率、光滑度、冷调色温 |
| 光线追踪 | 1.4 | 全局光照物理计算 | 镜面反射、光反弹、颜色溢出 |
| 网感脸 | 1.5 | 面部风格方向 | 社交媒体审美偏好 |
| 极致细节 | 1.4 | 纹理解析度 | 面料经纬、发丝、配饰细节 |
| 构图多元多角度 | 1.6 | 构图自由度 | 不僵硬、有变化、多角度 |
| 爆款逻辑最优解 | 1.5 | 综合审美方向 | 平台内容偏好适配 |
| 骨相 | 1.2 | 面部结构基准 | 保底,不崩就行 |
几个关键发现:
面光和皮肤同权重(1.6),但各管各的。面光管”光怎么打”,皮肤管”光打在什么东西上”。两者同权叠加的效果 > 单维度拉满——因为好的面光照在好的皮肤材质上,乘积效应。
骨相只给 1.2,这是保底值。骨相定的是颧骨、鼻梁、下颌的基础结构。1.2 的意思是”别崩,不用太突出”。因为网感脸(1.5)会覆盖绝大部分面部审美判断,骨相只是地基。给太高反而会和网感脸的审美方向打架。
光线追踪(1.4)和面光(1.6)不互斥。很多人以为这两者会冲突——不会。面光只管脸部的直接光照,光线追踪管镜子里的反射、光照到衬衫上反弹到下巴的颜色、锁骨高光的来源方向。两者作用域完全不重叠。
爆款逻辑(1.5)是无参数的参数。它不控制任何具体视觉元素,而是告诉模型”请往高互动率的方向走”。相当于给模型设了一个内容质量的目标函数。为什么是 1.5 而不是 1.6?经验是:审美方向权重过高会导致”千图一面”——模型会倾向于生成最安全、最大众的构图,反而失去特色。
权重场规则:同类参数可以叠加不互斥(面光 1.6 + 光线追踪 1.4 各管各的)。高权重给核心视觉维度(皮肤、面光、构图)。低权重做保底(骨相 1.2)。元级审美参数留一个做方向绳,但不拉满。
第三层:皮肤编码的语言学——”冷白皮漫感质感”拆开四个字四个信息
大部分 Prompt 写皮肤”白皙”就完了。
这条写了 8 个字:”冷白皮漫感质感的光滑皮肤”。拆开:
- 冷白皮:冷调白——RGB 里 B 通道多、G 通道少。和整身穿搭的黑色形成冷暖对比。如果是”暖白皮”,黑色穿搭会显得脏
- 漫感:漫画感的缩写。它不是要你画二次元,而是说”这皮肤是经过审美加工的漂亮皮肤,不是素颜写实”——这是网感脸(1.5)在材质层的呼应
- 质感的光滑:不是光滑,是”质感的光滑”。光滑但有纹理,不是塑料般的平滑。类似说”陶瓷的质感”——光滑但你知道它是有重量的
三个词构成一个精确的材质向量:冷调色温 + 二次元审美 + 真实纹理。
这比”白皙皮肤”有效得多——它给模型提供了三个独立维度的信息,而不是一个模糊的形容词。
通用公式:皮肤材质描述 = 色温 + 审美风格 + 纹理类型
- 色温:冷白皮 / 暖白皮 / 中性调
- 审美风格:漫感 / 真实感 / 油画感 / CCD滤镜感
- 纹理类型:磨砂 / 光泽 / 质感光滑 / 雾面
第四层:镜前穿搭的构图暗线——不说”自拍”说”展示”
镜子 + 穿搭 = 天然的双重构图资源:你可以拍到人,也可以拍到镜中倒影。
但这条 Prompt 没写”对镜自拍”,写的是”在室内镜前展示穿搭”。
区别:
- “对镜自拍”:人拿着手机面对镜子→镜子里必出现手机和手→构图写死了
- “在镜前展示穿搭”:人面对镜子→镜头在人侧后方→可以拍人 + 镜中倒影 + 背景纵深→构图开放
后者给了模型更多构图自由度——配合构图多元权重(1.6),模型会在”人物 + 镜子 + 木质楼梯 + 白色护墙板”四个元素之间自动找最优构图。
背景两个锚点(楼梯 + 护墙板)的选择也很讲究:楼梯给纵深和空间层次,护墙板给干净的背景面。一纵一平,构图元素就有了。
镜前场景规则:不说”自拍”说”展示”,给构图留白。背景至少两个元素,一个给纵深(楼梯),一个给平面(护墙板)。
第五层:穿搭颜色的一致性策略——黑灰双色的视觉减法
所有穿搭物品颜色:
- 浅灰:衬衫
- 黑色:短裙、长袜、链条包、发饰、刺绣
黑灰二色体系,没有第三个色系。
效果:视觉焦点自动聚在人物面部。道理很简单——整身穿搭是低饱和度暗色,面部是唯一有色彩的区域。衣服全部退为背景,面部成为画面中心。
这是穿搭颜色策略的核心逻辑:穿搭做减法,面部做加法。如果你的穿搭颜色太多太杂,模型会把算力分散到每件衣服上,面部精度反而下降。
框架抽象:从这条 Prompt 到可迁移的方法论
以上五层拆解可以收敛为三个可移植的模块:
模块 A:物品链编码(任何穿搭 Prompt 适用)
- 确定空间顺序:头 → 上身 → 下身 → 脚
- 每个位置写 1 个物品 + 2-4 个修饰词
- 视觉重心位置四维修饰(颜色+纹理+形状+版型),边缘位置单色锚定
- 密度够就不用写全——没写的模型会自动补全
模块 B:权重场分层(需要精细控制的 Prompt 适用)
- 列出要控制的视觉维度(面光 / 皮肤 / 构图 / 细节 / 审美方向)
- 每个维度分配权重 1.2-1.6,高权重 = 核心关注点,低权重 = 保底
- 同类但不同域的维度可以并存(面光 + 光线追踪)
- 元级审美参数(爆款逻辑)留一个做方向绳,别拉满
模块 C:材质描述公式(涉及皮肤 / 面料等材质的 Prompt 适用)
公式:色温 + 审美风格 + 纹理类型
- 不写”白”,写清楚是什么白、什么质感
- 每个维度选一个最准确的词,不堆叠同义词
效果图


技术参数表

Prompt 完整附录
【真人写真,64K高清,(电影级面光:1.6),(光线追踪:1.4),(冷白皮漫感质感的光滑皮肤:1.6),(人物有最好的骨相:1.2),(网感脸:1.5),肌肤雪白水润光泽,与镜头的互动感(极致细节:1.4),(构图多元,多角度:1.6),(综合网络爆款逻辑输出最优解:1.5)。一位女性在室内镜前展示穿搭,身着浅灰细条纹短袖收腰衬衫(胸口有黑色刺绣QY字母),搭配黑色荷叶边短裙,脚穿黑色长袜,肩挎黑色链条包,头发盘起并饰有黑色羽毛发饰,佩戴项链与多只手链,背景是带有木质楼梯、白色护墙板的空间,露出大长腿,露出肩、锁骨和吊带】
FAQ
Q:为什么权重取 1.2-1.6 这个区间,不是更高或更低?
低于 1.2 效果不明显,模型基本忽略。高于 1.6 会出现该维度压制其他维度的风险——比如面光拉到 2.0,皮肤权重就会被稀释。骨相只给 1.2 是刻意保底——太低脸会崩,太高会和网感脸的审美方向冲突。
Q:物品链编码必须要写这么多吗?能不能精简?
可以,但要保持密度梯度。核心规则:视觉重心位置(上半身 + 头部)修饰密度高,远离重心的位置密度低。砍掉”黑色长袜”比砍掉”胸口刺绣”安全——前者处于视觉边缘,模型自动补全的概率高。
Q:这个方法对 Midjourney 或其他模型通用吗?
物品链编码是通用方法——所有文生图模型都吃物品-位置-修饰词的结构。权重数值的精确范围需要根据模型测试,Seedream 的 1.2-1.6 区间是多次实验的经验值。Midjourney 用 –iw、–s、–c 等参数体系,逻辑类似但语法不同。
Q:背景只写了两个元素,够吗?多了会怎样?
两个够了,而且不能太多。背景元素超过 3 个时,模型容易分不清哪个是主背景——不同元素之间可能出现风格冲突。两个锚点正好构成”纵深(楼梯)+ 平面(护墙板)”的组合,既给了空间层次又留了干净的背景面。

评论0