
用 AI 生成一张高质量角色设定图,直觉上的做法是分步来:先生成角色正面全身、再单独跑侧面、背面、面部特写、服饰细节……最后扔进 Photoshop 拼版。五到八次生成,再加一小时排版。
但这条 Prompt 用了一个完全不同的策略:不生成多张图再拼,而是把整张角色设定海报当成一张图来生成。 一次 API 调用,9:16 纵向构图,左侧全身主视觉 + 右侧多分栏设定板——三视图、面部特写、发型细节、配饰纹样、配色色卡——全部在一张图里完成。
这个策略可以称为「板式铺陈法」:用空间布局指令替代多次生成,把角色设定集的排版逻辑编码进 Prompt,让模型在单次前向传播中同时解决角色一致性和页面排版两个问题。
Prompt 全文
古风仙侠角色长图,9:16纵向构图,冷月青白色系,中国古风仙侠美学,空灵唯美气质,角色设定板式设计,电影级柔光渲染,统一人物一致性,顶级二次元写实风格,超精致女性角色”宋玉”,凡人修仙题材仙女角色,月下竹林背景,整体青蓝灰白配色,整张图为高级游戏角色设计说明海报布局。
左侧为角色全身主视觉,女性角色拥有黑色长直发,清冷东方美人脸,白皙皮肤,柔和桃花眼,细腻五官,淡雅妆容,气质安静空灵。身穿浅青白色轻纱仙裙,层叠飘逸广袖,半透明薄纱披帛,刺绣花纹腰封,细腻银白纹饰,轻盈材质,裙摆自然垂落,古风仙气动态感。头戴白玉与银饰发簪,耳坠简洁精致,整体服装干净高级,具有”凡人修仙传”式东方仙侠气质。
整体采用完整角色设定板布局结构,右侧为多分栏设计,包括:三视图(正视图、侧视图、后视图),保持同一人物一致性;角色细节展示;面部特写;发型细节;眼睛特写;耳饰细节;服饰纹理细节;领口细节;腰饰细节;袖口纹样细节;配饰展示;材质展示;配色方案色卡;角色设定说明。
画面UI采用高级仙侠游戏角色设定集风格,类似国风3A游戏角色美术设定图,整体为深青灰背景,冷色月光氛围,薄雾环境,竹林剪影,大面积留白,高级极简排版,细线边框设计,柔和电影级体积光,整体干净克制,具有高级感。
人物服装重点:浅青白渐变长裙、半透明雪纺材质、轻纱广袖、银白刺绣纹理、玉石发饰、月光质感、柔软布料褶皱、自然飘逸裙摆、修仙古风服装。
细节重点:超精致皮肤纹理、真实布料纹理、丝绸反光、柔和月光边缘光、高清眼部细节、自然头发丝、统一人物面部、统一服装设计、统一发型、统一气质。
整体色彩方案:月白色、浅青色、雾灰色、淡蓝灰色。
布局编码:为什么「左侧主视觉 + 右侧多分栏」能一次出图
直觉上,AI 画角色设定集应该用”多图拼接”的思路——但这其实是在用人类的排版工具思维去套 AI 的生成逻辑。
扩散模型的工作方式完全不同。它不是在”排版”——它是在单次去噪过程中同时解决所有像素。给它的 Prompt 就是它规划像素分布的唯一依据。如果 Prompt 说”左侧是角色全身,右侧是多分栏设定板”,模型就会在潜空间中为这两个区域分配不同的语义注意力。
关键在于空间锚定词的选择。”左侧””右侧”这种方位词比”三视图””面部特写”更底层——它们直接作用于注意力图的 spatial layout,而不是 object class。这和分屏锚定法中”左侧放大展示头部细节,右侧放置三视图”的思路一脉相承,但板式铺陈法更进一步——不仅是左右二分,而是左侧主视觉 + 右侧 14 个分栏模块的复杂版面。不需要 ControlNet 或参考图:方位词本身就在做空间约束。
举例来说:当 Prompt 声明”左侧为角色全身主视觉”,模型在去噪时左半区的 cross-attention 会集中到角色外观描述词上——黑色长直发、浅青白色轻纱仙裙、白玉发簪。而右半区则被”三视图””面部特写””配色方案色卡”等 UI 元素占满。两个区域的语义场互不污染——这靠的不是分割模型,而是方位词在注意力机制中天然的空间偏差。
细节密度场:14 个分栏模块如何保持互不干扰
这条 Prompt 真正狠的地方不在于”列了 14 个分栏”,而在于每个分栏只写了名称,没有写内容。
“三视图(正视图、侧视图、后视图)”——只声明存在,不描述每个视图长什么样。”配色方案色卡”——只标位置,不规定色值。这恰恰是做角色设定集最正确的策略:角色外观已经在左侧全身主视觉中完整定义了,右侧不需要重新描述,只需要”镜像引用”即可。
这形成了一种细节密度梯度:左侧高密度(从发型到脚踝星辰链的完整外观描述),右侧低密度(仅模块名+品类标签),中间由角色的整体气质描述(清冷东方美人脸、气质安静空灵)做桥梁。模型在右侧分栏中会自动从左侧”借用”外观信息——因为同一个潜空间中没有收到右侧的覆盖性描述。
可以把这种策略类比为 CSS 的样式继承:左侧全身是”父级样式”,右侧分栏是”子元素”——不写覆盖属性,就会自动继承父级的外观。只不过这里继承的不是像素,而是语义注意力。
三视图一致性:正面、侧面、背面如何通过属性复用保持角色统一

角色三视图最容易翻车的地方是:正面和侧面不像同一个人。这几乎是所有文生图模型在 multi-view 场景下的共同痛点——每多一个视角,就多一次模型对角色外观的”重新解读”。
但因为左侧主视觉已经用海量外观细节(黑色长直发、桃花眼、浅青白渐变长裙、玉石发簪、层叠飘逸广袖……)锚定了一个非常具体的角色形象,右侧的三视图分栏只需要声明”三视图(正视图、侧视图、后视图),保持同一人物一致性”——不需要在每个视图里重新描述角色长什么样。
这实际上是把”角色一致性”的责任从视图描述转移到了原形象锚定。左侧越具体,右侧的三视图就越不容易走形。因为模型在去噪时,对”宋玉”这个概念的语义空间已经被左侧的密集描述填满了——右侧的”正视图/侧视图/后视图”只是换了个观察角度,而不是换了个人。
还有一个隐性约束:色彩方案统一声明。”月白色、浅青色、雾灰色、淡蓝灰色”这个全局色板作用于整张图,不分区。无论左侧还是右侧,去噪时都受同一个色调约束。色彩一致性天然拉高了角色一致性的下限——即使某个视图的面部略有偏差,同一色系也会让它看起来”是同一个人”。
UI 风格编码:从「生成插画」到「生成排版」的类型切换
这条 Prompt 的一个关键操作是告诉模型”这不是一张插画,这是一张角色设定海报”。
“整张图为高级游戏角色设计说明海报布局”——这句话的本质是在切换模型的生成类型。文生图模型训练数据中包含大量游戏美术设定集(artbook、character design sheet、concept art presentation),这些数据天然带有排版结构:左侧立绘 + 右侧文字说明框 + 底部色卡 + 细节放大镜。用”角色设定板式设计””角色设定说明海报布局””UI采用高级仙侠游戏角色设定集风格”这些词时,实质是在索引训练数据中这一整个视觉品类。
这意味着 Prompt 中明确列出的 14 个分栏模块,并不是凭空要求模型去做版面设计。训练数据里已经有大量排版模板——只要 Prompt 明确指定了品类(游戏角色设定集),模型就会从这些模板中采样一个合适的版式骨架,然后把角色外观和模块名称填入。
这里有个策略层面的选择:不手写 UI 细节。”深青灰背景,冷色月光氛围,薄雾环境,竹林剪影,大面积留白,高级极简排版,细线边框设计”——这些环境词不是给角色用的,是给排版用的。它们约束的是版面的”气质”而非”像素坐标”。相比直接写”右侧从上到下排列 14 个模块,每个模块间距 20px”,抽象风格词给了模型更大的排版自由度,反而更容易落到训练数据中那些已经证明好看的版式上。
技术参数表
| 参数 | 值 |
|---|---|
| —— | —– |
| 模型 | gpt-image-2 |
| 构图 | 9:16 纵向 |
| 风格 | 顶级二次元写实 × 中国古风仙侠美学 |
| 核心策略 | 板式铺陈法(空间布局编码 + 细节密度梯度 + 品类类型切换) |
| 角色 | 宋玉(凡人修仙题材仙女) |
| 色板 | 月白色 / 浅青色 / 雾灰色 / 淡蓝灰色 |
| 质材 | 轻纱 / 雪纺 / 丝绸 / 白玉 / 银饰 |
| 分辨率 | 2K |
| 格式 | PNG |
| Prompt 词数(中文) | ~350 |
可迁移模块
模块一:空间布局三段式
任何需要”角色 + 信息面板”同框的场景,都可以用三段式空间指令:
1. 品类声明:告诉模型这是什么类型的图(角色设定海报 / 产品展示页 / 建筑方案板)
2. 区域划分:用方位词(左侧/右侧/上方/底部)划分语义区域,每个区域配简短的模块名称
3. 全局风格约束:色板 + 氛围 + 排版风格,不写具体像素参数
模块二:细节密度梯度
当 Prompt 需要在同图中展示同一主体的多个视角/细节时:
– 主视觉区:高密度外观描述(从轮廓到材质到装饰)
– 衍生视图区:仅声明视角名称,不重复外观描述
– 中间桥接:用气质/氛围描述连接两个区域
模块三:品类类型切换
不需要插件或工作流,只需在 Prompt 中加入品类锚定词(”角色设定海报””游戏美术设定集””产品白底图””建筑方案展示板”),模型会自动索引训练数据中对应品类的排版模板。关键原则:写品类,不写像素坐标。
FAQ
Q:为什么不直接写 14 个分栏的具体内容?
写了反而会更差。因为模型并不是在做”填充模板”——它是同时生成整张图。如果右侧每个分栏都写了具体描述,这些描述会跟左侧的角色外观产生竞争,导致角色在不同视图中走形。只写名称、不写内容,利用的是模型的”语义继承”能力:从左侧主视觉借外观,从全局色板借色调。
Q:这个策略在 Midjourney 或 SD 上也能用吗?
核心思路(品类类型切换 + 空间布局编码 + 细节密度梯度)是通用的,但不同模型的训练数据品类分布不同。gpt-image-2 的训练数据中游戏设定集品类覆盖较好,所以在角色设定板式上的排版表现更稳定。其他模型需要实测品类锚定词的效果。
Q:色彩方案只写了 4 个色名,够精确吗?
够。因为角色外观和场景描述中已经反复出现了对应的具体颜色词——浅青色长裙、白玉发簪、银白纹饰、冷色月光。全局色板声明起到的是”收敛器”作用:把所有分散的颜色词汇聚到同一个色调轴上,而不是通过色值对标来约束。这是扩散模型更擅长理解的颜色控制方式。
Q:14 个分栏模块,漏了怎么办?
实际测试中,14 个模块不太可能全部精确呈现——部分模块会被模型自动合并或省略。这不是 Prompt 的缺陷,而是”版式自由度”的副产品。如果某个模块对成品至关重要,可以把这个模块从右侧分栏的列表中提取出来,在 Prompt 中单独声明一行(如”确保配色方案色卡在右下角可见”)。

评论0