先看一个常见场景。拿到一条 cosplay 提示词,写了”逼真””写实””细节丰富”,信心满满按下生成。
出来的图第一眼还行,多看两秒就发现不对——皮肤像硅胶,眼神像玻璃珠,衣服像硬纸板折出来的。
问题不是模型不行,是提示词给了方向,没给执行清单。方向是”画真实”,清单才能告诉模型”什么才算真实”。
【以9:16竖屏纵横比创作一幅逼真的真人cosplay肖像。一位非常美丽的成年东亚女性,二十多岁,在明亮的日式教室里摆姿势,穿着精致的白色和浅蓝色奇幻女仆装。保留参考图像的动态构图、身体比例、姿势、相机倾斜和强烈的近景透视效果。
她拥有苗条却自然曲线玲珑的身材,丰满的胸部、纤细有型的腰部、柔和圆润的臀部,以及平衡的现实比例。她的脸庞甜美而精致,呈柔和锥形椭圆形,大大的杏仁状深棕色眼睛,细微的棕色眼线,长长的睫毛,一只眼睛下方的小美人痣,轻微泛红的脸颊,精致的鼻子,以及光泽的珊瑚粉色嘴唇微微张开,带着友好而俏皮的微笑。她直视镜头。
她一头长长的深棕色头发,松散地扎成半上髻,侧分刘海轻轻飘散,框住脸庞。她戴着白色蕾丝女仆发带,饰以浅蓝色缎带、小蓝色蝴蝶结、珍珠链装饰,以及一侧耳朵旁悬挂的心形饰品。
她的服装包括一件完全结构化的浅蓝色和白色蕾丝紧身胸衣式女仆上衣,带有不透明的模压面板、白色褶边装饰、精致的花卉蕾丝叠层、多个小缎带蝴蝶结、细薄装饰丝带和珍珠点缀。添加可拆卸的白色蕾丝泡泡袖围绕上臂、带浅蓝色蝴蝶结的褶边腕部袖口,以及一套高腰服装短裤上的白色和蓝色迷你围裙。包含蓝色缎带式腰部吊袜带作为装饰性服装元素、一条小珍珠项圈配浅蓝色蝴蝶结和悬挂的金色心形吊坠,以及一条细微的银色肚脐环。服装保持牢固贴合,完全覆盖所有私密部位。
精确再现姿势:她的躯干从木质教室课桌右侧斜向镜头倾斜。一只手肘搁在课桌上,那只手优雅地悬浮在锁骨附近,展示光泽的深红色修剪指甲。她的另一只手臂直接伸向镜头,手掌张开,手指大大分开。伸出的手占据了左侧前景的大部分,并因极浅的景深而有意模糊,而她的眼睛和脸部保持锐利清晰。她的臀部略微远离肩膀转动,形成自然的S形姿势。
使用近距离、略微低角度正面相机位置,带有轻微的荷兰角。构图从头顶到大腿上部。在背景中,包含温暖的木质课桌、一块大型深色教室黑板上只有模糊不清的粉笔痕迹、浅色墙壁,以及明亮的午后窗户光线。柔和的阳光洒落在她的脸庞、肩膀和服装上,产生精致的蕾丝阴影和发光的皮肤高光。
高端逼真的cosplay摄影,真实的皮肤毛孔和精细面部纹理,自然的身体解剖结构,逼真的蕾丝、缎子和珍珠材质,温暖的日光,柔和的浅色调色,浅景深,28mm镜头,动态近景变形,脸部清晰锐利,专业相机品质。
避免:动漫、插图、CGI、娃娃脸、未成年外貌、学校女生制服、裸露、透明服装面板、暴露私密部位、服装失灵、夸张的人工解剖结构、不可能纤细的腰部、超大头部、交叉眼睛、脸部遮挡、双手均清晰、前景手遮挡脸部、畸形手、多余手指、融合手指、重复肢体、扭曲课桌、可读文字、标志、水印、圆角图像。】
上面这条提示词不是”描述一幅画面”,而是一份摄影订货单。
这个策略可以称为「制景清单术」(Production Checklist Method)。核心机制很简单:把一次完整 cosplay 摄影写真的全部生产要素——模特体态、面容细节、发型配饰、全套服装结构、详细姿态坐标、相机镜头参数、光线环境、技术质量标准——按条逐项声明。
模型不是”生成一个画面”,而是”执行一份拍摄合同”。所有决策参数已预先填好,不需要走任何默认填充路径。

维度一:模特声明——从”一个美女”到 7 项可量化参数
大多数提示词描述人物时停留在”一位美丽的女孩””精致的面容”这种层面。这不是有效约束,模型只能自由发挥。
制景清单术的做法是给出 7 项可量化的参数集。
体态参数:苗条却自然曲线玲珑——不是”苗条”或”丰满”二选一,而是两者的组合状态,附带”平衡的现实比例”做上限锚定。
面部几何:柔和锥形椭圆形脸、杏仁状深棕色大眼睛、精致鼻子、光泽珊瑚粉色嘴唇——每项对应一个真实面部特征,不是模糊形容词。
肤色传达:轻微泛红的脸颊、光泽嘴唇——这些是自然生理信号,不是”皮肤质感好”这类空话。
特殊标记:一只眼睛下方的小美人痣——独一性的面部锚点,带”小”字做克制声明,防止模型过度放大。
表情指令:友好而俏皮的微笑,直视镜头——双向声明,同时锁定了面朝方向和情绪种类。
年龄声明:二十多岁的成年东亚女性——明确排除”未成年”的潜在路径,也排除了超龄老化渲染的可能。
头发系统:长度(长)、颜色(深棕)、发型(半上髻)、刘海(侧分)、装饰(发带+缎带+蝴蝶结+珍珠链+心形饰品),逐层拆解。
7 项参数组合在一起,模型无法走捷径生成”标准美女脸”,必须逐一实现。
维度二:服装结构声明——从”女仆装”到 6 层结构拆解
“精致的女仆装”这种写法等于把服装设计权完全交给模型。制景清单术会把服装拆成 6 个结构层。
第一层:紧身胸衣式上衣。 浅蓝色和白色蕾丝、不透明的模压面板、白色褶边装饰、花卉蕾丝叠层、多个缎带蝴蝶结、装饰丝带和珍珠点缀。颜色 + 材质 + 装饰物 + 叠层结构,四项要素一次声明到位。
第二层:泡泡袖。 声明为”可拆卸的白色蕾丝泡泡袖围绕上臂”——不是独立袖套就是半袖,明确附在服装上且覆盖位置。用”可拆卸”三个字提前堵住”袖子造型与上衣割裂”的问题。
第三层:腕部袖口。 褶边、带浅蓝色蝴蝶结。
第四层:下半装。 高腰短裤 + 迷你围裙(白色和蓝色)。这里把裙装拆成了底层(短裤)和覆盖层(围裙)分别声明。
第五层:装饰性配件。 腰部吊袜带(蓝色缎带式)、珍珠项圈配浅蓝色蝴蝶结与金色心形吊坠。
第六层:身体配饰。 银色肚脐环——这个细节要求模型在生成身体时给肚脐位置预留装饰空间。
每层的颜色、材质、装饰物、位置全部分别声明。更关键的是两条全局保护声明:“服装保持牢固贴合”——告诉模型衣服是有结构张力的,不是贴图;“完全覆盖所有私密部位”——做安全兜底。
6 个结构层 + 2 条保护声明 = 一套完整的服装说明书。
维度三:姿态坐标——从”伸出手”到 7 个关节点的空间关系
这是整条提示词阅读体验最密的部分,也是拉开效果差距的关键。它不是在描述”一个姿势”,而是在编码7 个关节点在 3D 空间中的位置关系。
关节点 1:躯干-课桌关系。 躯干从课桌右侧斜向镜头。这一步锁定了人物在整个画面中的主体位置:不是正对课桌,而是斜向。
关节点 2+3:肘部支点 + 手部悬浮高度。 手肘搁在课桌上,手悬浮在锁骨附近。两个关节点联动,压缩了模型在”手臂怎么放”这个问题上的自由度。
关节点 4:手指末端。 展示光泽的深红色修剪指甲——连指甲油颜色和光泽度都声明了。
关节点 5:伸出手的完整声明。 直接伸向镜头(方向向量),手掌张开(关节锁定),手指大大分开(末端形态)。一个动作被拆成三段精确编码。
关节点 6:前景手与景深的关系。 占据左侧前景,因极浅的景深模糊——这是对画面构图的跨维度声明,把姿态和摄影语言绑定在一起。
关节点 7:躯干扭转差。 臀部略微远离肩膀转动,形成 S 形姿势。
7 个关节点之间形成了完整的空间编码路径:整体定位 → 支点锁定 → 手部高度 → 末端细节 → 第二只手的完整向量 → 与构图的关系 → 躯干扭转。这不是”一个姿势”,是一次完整的身体坐标测绘。
维度四:相机语言——28mm + 荷兰角 + 前景模糊的联动约束
提示词中的相机参数不是技术炫技,而是一组互相绑定的成像约束。
镜头焦距声明:28mm。这不是随便挑的数字。28mm 是广角焦距,会产生自然的边缘畸变和透视拉伸。写”正常视角”模型会输出 50mm 左右的标准视觉。写”28mm”等于告诉模型:近大远小的透视变形是允许的,甚至是被要求的。
荷兰角。 轻微倾斜的画面构图——不是”拍歪了”,是有意为之的摄影技法。这个声明防止模型自动校正水平线。
近景动态变形。 与 28mm 配合,明确声明广角近摄产生的透视压缩是可接受的画风特征。两个字”动态变形”抵得上十行”近处物体显得大”的描述。
浅景深声明。 告诉模型背景应该虚化。
前景模糊声明。 这是整条提示词中最巧妙的一个打法。”伸出的手占据了左侧前景的大部分,并因极浅的景深而有意模糊”——这里的关键词不是”景深”而是“有意”。训练数据中前景清晰是绝大多数,模型天然倾向于把前景手也画清楚。用”有意模糊”四个字抵消训练数据偏差,强迫模型执行”手不清晰”这个反默认行为。
5 个相机参数组合在一起,等于告诉模型:画面倾斜是技法,畸变是特征,前景模糊是要求。模型没有任何默认行为可以走。

维度五:负向声明防火墙——26 项”避免”的 7 大错误覆盖
Prompt 末尾的”避免”清单共 26 项,覆盖 AI 制图 7 类最常出现的系统性错误。
格式错误类:动漫、插图、CGI——三重防御,防止模型滑向非写实渲染管线。
解剖错误类:娃娃脸、未成年外貌、夸张的人工解剖结构、不可能纤细的腰部、超大头部——每一项对应一个具体的数据集偏向。娃娃脸是亚洲画风的高频特征,超大头部是日式萌系的数据残留。
内容保护类:裸露、透明服装面板、暴露私密部位、服装失灵——四条安全边界,与正声明中的”完全覆盖所有私密部位”形成前后呼应。
细节错误类:交叉眼睛、脸部遮挡、畸形手、多余手指、融合手指、重复肢体——手部错误是 AI 生成图的头号硬伤,用了 5 个不同的手部否定词。
构图错误类:前景手遮挡脸部、双手均清晰——与正声明中的”前景手模糊”互为表里。
技术痕迹类:圆角图像、水印、标志——视觉噪音清除。
逻辑错误类:可读文字、扭曲课桌。
26 项形成了一个防火墙清单。 每一类错误在训练数据中都有极高的出现概率,逐一声明排除是唯一可靠的拦截方式。
技术参数总表
| 参数维度 | 声明项数 | 主要控制目标 |
|---|---|---|
| 画幅规格 | 1 | 9:16竖屏 |
| 模特体态 | 7 | 真实人体比例 |
| 面容细节 | 9 | 面部几何+表情+特殊标记 |
| 发型配饰 | 7 | 完整发型系统+装饰分层 |
| 服装结构 | 6层+2保护 | 完整服装说明书 |
| 姿态坐标 | 7关节 | 3D空间姿态编码 |
| 相机语言 | 5联动 | 镜头+景深+畸变 |
| 环境光线 | 3条件 | 时间+光源+光质 |
| 质量标准 | 8项 | 纹理+材质+色彩+锐度 |
| 负向声明 | 26项 | 7类错误全覆盖 |
可迁移模块
模块一:姿态编码法
学会把”伸出手”这种模糊指令拆解为「方向向量 + 关节锁定 + 末端形态」三个层次。
方向向量:手臂直接伸向镜头。关节锁定:手掌张开,手指大大分开。末端形态:展示光泽的深红色修剪指甲。
这种三层拆解可以应用到任何人体动作声明中。靠近镜头的部位拆得越细,模型跑偏的可能性越低。双腿、躯干、头部朝向都可以用同一套方法编码。
模块二:前置否定 + 后置防火墙
在正声明中嵌入关键否定(如”有意模糊”),同时在末尾追加完整否定清单。正声明做定向拦截,末尾做全面覆盖。
前者解决默认值偏差——模型对某个元素的默认处理与需要的结果不一致;后者解决系统性错误——那些在所有写实生成场景中都可能出现的共性问题。两者配合,拦截效率远高于只用其中一种。
模块三:三明治结构
整条提示词的组织方式是三层夹心:规格声明 → 内容声明 → 负向声明。画幅和相机参数在最前面做框架约束,中间是模特+服装+姿态的具体内容,末尾用否定清单密封。每一层只做自己的事,不交叉混写。
FAQ
Q:26 项避免会不会太长?模型理解得了吗?
主流模型对”避免”指令的理解力已经成熟,长列表不会导致信息丢失。26 项拆分覆盖 7 类错误,每一项在训练数据中都有高频出现率,逐一拦截是必要的。少写一条,模型就有大概率犯一次。
Q:服装声明里写”完全覆盖所有私密部位”有必要吗?
有必要。模型在某些安全机制不明确的场景下会”开洞”——把紧身结构自动认为是半透明或可穿透的。这句话是安全保护声明,也是结构完整性声明。
Q:每次都要写这么长吗?
对于追求高写实度的 cosplay 人像,是的。每少一条声明,模型就多一条默认路径可以走。当目标效果对精度有要求时,提示词的长度和质量在合理范围内呈正相关。可以先把完整模板保存起来,后续在模板基础上做删减微调。
写一条高写实度的 cosplay 提示词,本质上不是在”描述一幅画面”,而是在写一份摄影执行手册。制景清单术的核心就是放弃”让模型理解意图”的幻想,转而用逐项声明的方式填满每一个可能被默认值占据的缝隙。从模特声明到相机语言,从 7 个关节点姿态到 26 项否定清单,一次完整的操作就是一次完整的拍摄项目企划书的简化版。高质量 AI 输出不需要魔法,只需要清单。

评论0