你有没有这种感觉:有些 AI 生成的街拍图,人物和背景像两个图层叠在一起——人是P上去的。
不是光影不对。也不是比例失调。而是人物和环境之间没有「力」。
风吹过街道,但她的头发纹丝不动。阳光洒在建筑上,但她的皮肤和墙壁的受光面完全不是一个逻辑。她站在那儿——但她是悬浮在那儿的。
这条韩国街头的 Prompt 做对了什么?它不是在「描述背景」,它是在描述环境如何对人物施加物理力。
这个框架,我管它叫「力场编码法」(Force Field Encoding)——把环境当成一个力场,每个元素都对人物产生可测量的物理效应。人物和背景不是两个图层——她们在互相拉扯。
和上篇「生活切片编码」的关系:切片编码管的是「还原真实的时空情境」,力场编码管的是「情境中各个元素之间怎么发生物理接触」。一个是宏观框架,一个是微观力学。互补。
风力场:风的表达,不是「头发在飘」
这条 Prompt 花了四句话在风上:「黑发被风掀起几缕」「发尾随动作轻扬」「被风吹动的碎发贴在脸颊」「表情松弛得毫无修饰」。
注意措辞——不是「头发飘逸」「发丝飞舞」。是「掀起」「轻扬」「贴」「松弛」。这些词描述的不是风的外观,是风对头发的物理作用力。
「掀起」意味着风有向上的分力——头发从静止位置被垂直抬起。「轻扬」意味着力不大,发尾只是微微摆动。「贴」意味着汗液或皮肤油脂产生附着力,碎发被吹到脸上后粘住了。「松弛」是风力为零的对照状态——面部的肌肉没有用力对抗风。
这四层力构成一个精确的风场模型:风从斜前方来(向前上方掀),中等强度(能扬起发尾但不够整束位移),伴随着温湿度适中(碎发能贴在皮肤上)。
对这个模型来说,Seedream 的响应逻辑是清晰的:受力的头发向量朝前上方偏移,不受力的头发(后侧)保持静止。这不是「把头发画乱」——是给每一根头发分配了受力方向。

光力场:光线不是「好看的光」,是打在脸上的几何
Prompt 写:「受光面与背光面过渡自然」「阴影顺着下颌线淡淡晕开」「项圈在光下泛着冷光」。
三个句子描述了三类完全不同的光-物交互:
「受光面与背光面过渡自然」——这是一句关于光在曲面上的行为的陈述。在 Seedream 的潜空间里,这意味着面部法线贴图从面向光源到背向光源的过渡不是硬切,而是连续渐变。皮肤的微起伏让光在移出高光区后不是「熄灭」,而是缓慢衰减。
「阴影顺着下颌线淡淡晕开」——这比上句更精确。它告诉模型两个信息:(1)主光源在上方略偏前(因为下颌阴影是「顺着」而非「覆盖」下颌线);(2)阴影不是硬边(「淡淡晕开」意味着光源有一个面积极大的漫射组件——云层或建筑反光造成的环境光填充了本应是深黑的部分)。
「项圈在光下泛着冷光」——金属的镜面反射。和皮肤完全不同的 BRDF(双向反射分布函数):光不进入材质,直接弹回。冷光意味着金属本身的色相偏蓝/银白,加上天空光(偏蓝)的镜面反射在金属表面特别显眼。
三句光线描述覆盖了三种光学行为:漫反射渐变(皮肤)→ 间接光填充(环境光)→ 镜面反射(金属)。一条 Prompt 里实现三种光-物交互模型,而且不需要写任何技术参数——只需要精准的物理观察。

空间力场:电线杆不是在「背景」里,是在「构图」里
Prompt 写:「她站在店铺招牌与电线杆间」「没有刻意构图」。
这两句的共同效果:把人物挤进两个垂直障碍物之间。不是「以人物为中心构图然后发现背景里恰好有招牌和电线杆」——而是「招牌和电线杆先在那里,人物被塞进它们之间的空隙」。
这产生了三层效果:
第一层:深度信息。当「站在A与B之间」被模型解析时,A和B被放置在不同的深度平面上,人物居中——这自动产生了前中后三层空间。相比之下,「背景是街道」只有一个平面。
第二层:比例约束。如果人物站在招牌和电线杆之间,三者必须共享同一个空间比例尺。招牌不能巨大得离谱(因为人物需要「站在它旁边」),电线杆不能细得像铅笔(因为它和人物有空间接触)。空间锚点自动锁定了所有元素的比例。
第三层:遮挡规则。「站在A与B之间」暗示A和B都在前方、人物居中——这意味着部分遮挡是合理的。A和B的某些部分可以遮住人物,人物也可以遮住A和B的某些部分。遮挡是真实感的最强信号——因为AI图片最不真实的地方永远是「元素之间永不重叠的干净边缘」。
情绪力场:矛盾指令的力学隐喻
Prompt 写:「神情带着忧郁的妖冶」「纯欲感混着疏离」「眼神望镜头像蒙着层薄雾」。
情绪编码也可以用力场的语言来理解:不是给一个情绪标签,是给一组方向不同、大小不同的力矢量。
「忧郁」往下拉——嘴角、眉尾、眼神亮度。「妖冶」往上提——嘴唇微启、眼睑半垂、肩部放松。「双重力」竞争的结果不是平均值,是一个在不稳定平衡点上的动态表情。
同理,「纯欲」推近——清澈的眼神、自然的姿态。「疏离」推远——冷淡的距离感、不对镜头做出回应。同时推近和推远的力矢量产生了一种「明明在看你却仿佛不在看你」的微表情——这是绝大多数脸谱化 Prompt 做不到的。
对 Seedream 来说,单一情绪词的渲染路径是收敛的(越接近训练分布的均值越好)。矛盾情绪词的渲染路径是未收敛的——它在两个分布中心之间振荡,产出的就是那个振荡过程中的样貌。真实的情绪从来不是纯的,是纠缠态的。
力场编码 vs 传统分层:一张对比表
| 维度 | 传统分层法 | 力场编码法 | 谁在施加力 |
|---|---|---|---|
| 风 | 「头发飘逸」 | 「被风掀起…碎发贴在脸颊」 | 气压梯度 → 发丝矢量 |
| 光 | 「暖光/柔光」 | 「阴影顺着下颌线晕开…项圈泛冷光」 | 光子 → 皮肤曲面法线 / 金属镜面 |
| 空间 | 「街道背景」 | 「站在招牌与电线杆间…没有刻意构图」 | 障碍物 → 人物位置 / 比例 / 遮挡 |
| 情绪 | 「高冷/甜美」 | 「忧郁的妖冶…纯欲混疏离」 | 对立情感矢量 → 未收敛表情 |
| 材质 | 「衣服好看」 | 「面料褶皱随肢体自然堆叠…底妆轻薄」 | 重力+拉伸 → 织物形变 / 化妆品覆盖 |
力场编码的底层原理:为什么「接触」比「并列」真实一百倍
回到开头的问题:为什么有些 AI 图的人物像P上去的?
因为默认 Prompt 写法是列表并列:「一个女孩 + 在韩国街头 + 高马尾 + CCD风格」。Seedream 的处理方式是为每个逗号分隔的元素独立采样一个视觉特征,再拼到一起。人物特征和背景特征之间没有交互项的约束——它们是在不同的潜空间子区域被独立解码的。
力场编码改变了这一点。当你在 Prompt 里写「被风吹起的碎发贴在脸颊」,你是在告诉模型:风特征需要和头发特征发生物理交互,而这个交互的结果需要和面部特征发生空间交叠。这不是三个独立元素的拼合——这是一个因果链条。
同样地,写「她站在店铺招牌与电线杆间」不是「人物」+「招牌」+「电线杆」三个并列标签——是「人物相对于招牌的空间位置」+「人物相对于电线杆的空间位置」+「三者之间的比例锁」。这不是加关系,是乘关系。乘法比加法的约束强度高一个数量级。
这解释了为什么力场编码做出来的 AI 图看起来更真实:真实感不来自细节多,来自因果互动多。因果互动越多,各个元素之间自由漂移的余地越小——最终图像就越收敛到一个逻辑自洽的视觉配置。而逻辑自洽,就是「真实感」的数学定义。
技术参数表
| 参数 | 值 |
|---|---|
| 模型 | doubao-seedream-4-0-250828 |
| 画质 | 2K |
| 图片比例 | 3:2(封面)/ 9:16(正文) |
| 力场维度 | 风力场(气压梯度→发丝矢量)→ 光力场(光子→曲面法线/金属镜面)→ 空间力场(障碍物→位置/比例/遮挡)→ 情绪力场(对立矢量→未收敛表情)→ 材质力场(重力/拉伸→织物形变) |
| 审美方向 | 韩国街头 / CCD质感 / 力场交互 / 随性抓拍 |
| 与上篇关系 | 生活切片编码 = 宏观时空框架 / 力场编码 = 微观物理接触 |
Prompt 完整附录
韩国街头的自然光漫过红砖建筑,高马尾少女的黑发被风掀起几缕,发尾随动作轻扬,颈间的项圈在光下泛着冷光。全身特写里,灰色开衫外套搭着白色内搭,面料褶皱随肢体舒展自然堆叠,透着休闲随性的时尚感。
冷白皮在柔和光线里泛着通透光泽,底妆轻薄均匀,瓜子脸配尖下巴,神情带着忧郁的妖冶,眼神望镜头时像蒙着层薄雾,纯欲感混着疏离。受光面与背光面过渡自然,发丝根根清晰,被风吹动的碎发贴在脸颊,阴影顺着下颌线淡淡晕开,契合街头光影逻辑。
CCD的颗粒感揉进画面,像iPhone随手拍下的瞬间——没有刻意构图,她站在店铺招牌与电线杆间,项圈勾勒着纤细脖颈,表情松弛得毫无修饰,却把都市街拍的随性、少女的忧郁与纯欲,都锁进了这帧真实的生活切片里,鲜活又带着点勾人的疏离。
FAQ
力场编码和之前那篇「生活切片编码」有什么区别?
切片编码是宏观框架——管你在 Prompt 里「构建什么」(时空情境)。力场编码是微观力学——管 Prompt 内部「各元素之间怎么接触」。可以组合使用:用切片编码搭时空框架,用力场编码填物理交互细节。两条框架独立有效,叠加效果最佳。
如果我的 Prompt 没有风、没有光、没有复杂空间关系,力场编码还能用吗?
能,但要重新定义你的「力场」是什么。室内肖像的力场可能是「窗外自然光 + 室内墙壁反光 + 织物褶皱 + 皮肤与布料摩擦力」;静物摄影的力场可能是「桌面反光 + 物体之间的投影 + 材质间的色彩反射」。力场编码不是一套固定元素清单,是一种思维方式——找到元素之间的因果接触点,而不是并列描述元素。
力场越多越好吗?
不是。力场编码的效力不是看力场数量,是看每个力场的交互质量。一条精准的「碎发贴在脸颊」胜过十条模糊的「背景好看」「氛围柔和」加在一起。因为前者产生了一个跨元素的因果约束,后者只是往画面上堆标签。力场编码的性价比法则是:一个精确的物理交互 > 十个模糊的风格形容词。

评论0