站在博物馆幽暗的展厅里,玻璃柜中两具相拥的干尸让人屏住呼吸。灯光打在深褐色、纸一样薄的皮肤上——肌肉脱水萎缩后,每一根肋骨、每一个指关节都贴在骨骼表面,轮廓分明。柜旁有人低声交谈,考古学家在讨论丧葬习俗和防腐技术。
这一切不是照片。是一段 Prompt 让 AI 生成的。
Prompt 的直觉感受
这段 Prompt 读起来像一份博物馆策展方案,不像画图指令。它说了玻璃柜的尺寸(长方形),说了灯光怎么打(展厅幽暗、灯光集中打在标本上),说了观众在哪儿(展柜旁边)以及他们可能在想什么(考古学意义)。甚至交代了织物残片的材质——”红褐色织物残片纹理逼真”。
大多数 AI 绘图 Prompt 只会说”画一个木乃伊”。这段 Prompt 说的是”构建一个你看木乃伊的体验”。
这是两件完全不同的事。
原创框架:「展陈叙事法」
这条 Prompt 的核心机制不是描述物体,是构建一个完整的观看情境。它像博物馆策展人布置一个展厅那样,分层级地组织信息。模型读到的不是”画什么”的清单,而是一个从物到境的递进式叙事。
这个框架有四个递进层——标本层、展陈层、语境层、氛围层。每一层往上推一个维度,模型的理解就从”这是个什么”往”这个场景里正在发生什么”走。
皮肤贴在骨头上:解剖学精度的「标本层」
Prompt 对干尸的描述用了大量解剖级词汇:干硬的深褐色皮肤紧贴骨骼、肌肉组织脱水萎缩、手臂关节清晰可见、躯干肋骨轮廓。
这些东西为什么重要?AI 图像模型做「真实感」有一条铁律:清晰的结构信号 > 模糊的风格词。
说”古老的木乃伊”,模型会给你一个万圣节道具。说”干硬的深褐色皮肤紧贴骨骼,肌肉组织脱水萎缩”,模型被迫调动它对人体解剖的理解——肋骨的位置应该在哪、尺骨和桡骨的比例、皮肤脱水后的褶皱方向。每一项都是几何约束。几何约束越多,模型的输出就越接近现实。
这就是标本层的核心逻辑:用可验证的解剖细节逼模型走写实路径,不给它走风格化捷径的空间。模型不是”想画得像”,是没有其他选择。

玻璃柜、红布、织物残片:策展的「展陈层」
接下来 Prompt 把场景从”两具干尸”扩展成一个博物馆展柜:博物馆长方形玻璃柜、年代久远红布条包裹、下半身红褐色织物残片纹理逼真。
这层在干嘛?它在告诉模型:你现在画的不是孤立物体,是一个被展示的物体。
玻璃柜这个元素很关键。柜子意味着反光、意味着光线透过玻璃的折射、意味着观察者和被观察物之间有一层介质。这些光学约束让模型的光照引擎自动进入”室内博物馆照明”模式——柔和的顶光、琥珀色暖调、深色木质或石材背景。
红布条和织物残片完成了”考古展品”的身份认证。文物级别的织物褪色——不是鲜红,是几百年氧化后的暗红褐色——这种色彩信号把模型的材质渲染引擎往”有机物老化”方向推。棉麻纤维在时间侵蚀下的脆化纹理、边缘磨损的毛边、折叠处的色差——这些细节模型学会画了,因为训练数据里满是博物馆的高清展品图。
一句话:展陈层做的事,是用场景道具给模型加载正确的材质和光照预设。
柜子旁的人在看什么:「语境层」
Prompt 的后半段,镜头拉远了:展柜旁边有几个人、对考古学探究丧葬习俗意义重大。
表面上看这是冗余信息——画几个小人站柜子旁边有什么难的?这层解决的是尺度锚定问题。
AI 画一个东西的时候,如果没有参照物,它不知道这个东西应该多大。写出”柜子旁边有人”的那一刻,模型就知道:柜子高约一米、干尸大概 160-180 厘米、展厅层高约四到六米。整个空间的比例系统被这几个字锁死了。
还有一个更隐蔽的效果:观众的存在制造了视点。模型会推断画面外有一个观察者,这个观察者站在柜子前、隔着玻璃往里看。构图自然变成中景或近景,视角带微微的俯视或平视,景深拉开——前景是玻璃反光,中景是干尸和红布,远景是展厅另一侧的展柜和墙面。
至于”考古学”那几个词——不是为了真的让模型理解学术意义,是为了让场景的人类学基调定下来。模型会把”考古””丧葬习俗”映射到学术场景、文献插图、博物馆纪录片的视觉语言上。你在给模型的风格库装一个学术滤镜。
庄重、神秘、历史厚重:「氛围层」
最后一段 Prompt 收在氛围词上:庄重神秘、历史厚重感。
很多人觉得氛围词是 Prompt 里最”虚”的部分,想删。但我劝你别删。这四个字做的事是前面的结构层做不了的。
“庄重”让模型压低色彩饱和度、减少高光区域的亮度跳跃。”神秘”让阴影更深、暗部占比更大、边缘对比度降低。”历史厚重感”触发暖色调偏棕、噪点和微纹理增多——像旧照片和老纪录片的质感。
这三组词不描述物、不描述空间、不描述光。它们描述的是观看者应该产生的情绪。模型训练的时候见过无数张被标注为”solemn””mysterious””historical”的图片,它知道这些情绪在视觉上对应什么。
氛围词不是画蛇添足,是给模型写的情绪注脚。

从一条 Prompt 到一套方法论
「展陈叙事法」的四层结构——标本→展陈→语境→氛围——遵循的是一个递进逻辑:你先告诉模型看什么,然后告诉它怎么看,然后告诉它谁在看,最后告诉它看完什么感觉。
把这个逻辑平移一下试试:
- 要画一道菜?先写食材的质感和切面(标本层),再写碗碟和餐桌(展陈层),再写窗外的光和桌旁的人(语境层),再写温暖的家的味道(氛围层)。
- 要画一辆车?先写漆面反光和轮胎花纹(标本层),再写停车场和路沿(展陈层),再写树影和远处的人(语境层),再写速度感和金属的凉意(氛围层)。
- 要画一个人?先写皮肤纹理和骨骼结构(标本层),再写衣服面料和配饰(展陈层),再写周围的光和环境(语境层),再写这个人的气质和情绪(氛围层)。
不是所有 Prompt 都需要四层铺满。简单场景只用标本层给出结构信号、氛围层给出情绪——也够用。但如果你想画出一张”像照片””像电影截图”的东西,把四层走一遍,结果会差一个量级。
技术参数
| 项目 | 详情 |
|---|---|
| 生成模型 | 豆包 Seedream 5.0 |
| 分辨率 | 4K |
| 图片比例 | 特色图 3:2 / 效果图 9:16 |
| Prompt 长度 | ~350 字符(中文) |
| 核心框架 | 展陈叙事法(标本→展陈→语境→氛围) |
Prompt 完整附录
8K 超写实新疆博物馆展厅场景,博物馆长方形玻璃柜中,全景,年代久远红布条,包裹俩具干尸一大一小,卷缩拥抱,古埃及木乃伊的上半身,无绷带包裹,干硬的深褐色皮肤紧贴骨骼,肌肉组织脱水萎缩,手臂关节、躯干肋骨轮廓清晰可见,下半身红褐色织物残片纹理逼真。背景是博物馆展柜环境,展柜旁边有几个人,木乃伊从保存状态看,或因特定环境自然风干,或经古时特殊防腐处理。对考古学探究丧葬习俗、人类学研究人体特征及防腐技术意义重大,场景营造出庄重神秘、满是历史厚重感的氛围。
FAQ
这个框架跟写实类 Prompt 常用的「细节堆砌法」有什么区别?
堆砌法是”把所有细节列出来,越多越好”——它依赖信息密度驱动真实感。展陈叙事法的差异在于它有空间结构:不是列出细节,而是把细节放进”标本→展陈→语境→氛围”的递进框架里,每层的细节服务于不同目的。堆砌法给你一堆正确的词,展陈叙事法给你一个正确的观看体验。
博物馆/展陈场景会不会太窄了?其他类型的画面能用吗?
框架可迁移。核心是”物→展示方式→观看者→情绪”,不是”博物馆”。”展示方式”可以换成自然光下的桌面、街头的橱窗、画廊的白墙——只要是”一个东西被放置在一个有语境的空间里被人看”,这个框架就能用。
学术词汇(考古学、丧葬习俗)真的起作用?模型又不理解。
模型不理解,但它见过带这些词的图片。你在训练数据池里扔了一个坐标,模型就会往那个坐标的视觉风格靠近。关键词不追求语义理解,追求风格锚定——就像你不需要知道”巴洛克”的定义,只要见过巴洛克建筑的图片,听到这个词就知道该往哪个方向调参数。

评论0