拾光存档记录微光 · 存入时间
N 31° 13′ 46.98″
PAGE.2607.3251 拾光集 TOOD.WIN / PAGE

AI 反推提示词教程:3 步从参考图片生成可复用的生图提示词

看到一张喜欢的图片,却不知道应该怎样写提示词?

可以使用“AI 反推提示词”工作流,让支持图片识别的 AI 先分析画面,再将分析结果整理成适合 Midjourney、Stable Diffusion、即梦、豆包或其他生图工具使用的提示词。

整个流程分为三个步骤:

  1. 拆解图片元素
  2. 生成基础提示词
  3. 优化成指定工具可直接使用的版本

需要注意的是,AI 反推得到的通常不是原作者输入的真实提示词,而是根据图片内容推测出的近似描述。它更适合用来学习画面的构图、风格、光影和视觉语言,而不是逐字恢复原始 Prompt。

ChatGPT_Image_2026728_17_21_16

第一步:拆解图片元素

先把参考图片上传给支持图片识别的 AI,例如 ChatGPTGeminiClaude 或其他多模态模型。

不要一开始就让 AI 直接生成提示词,而是先要求它对图片进行结构化拆解。

可直接复制的指令

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
请详细拆解这张图片,并按照以下维度进行分析:

1. 主体:画面中的主要人物、物体或视觉对象。
2. 场景:主体所处的环境、时间、地点和空间关系。
3. 动作:人物姿态、表情、动作方向,以及物体的运动状态。
4. 风格:写实摄影、商业广告、插画、动漫、3D渲染、赛博朋克或其他视觉风格。
5. 色调:主色、辅助色、色彩饱和度、冷暖关系和整体情绪。
6. 光线:光源方向、光线强弱、自然光或人工光,以及阴影和高光表现。
7. 构图:景别、拍摄角度、主体位置、视觉中心、前景、中景和背景关系。
8. 材质:皮肤、布料、金属、玻璃、木材或其他表面的纹理表现。
9. 镜头:可能使用的焦段、景深、透视关系和摄影机位。
10. 细节:画面中的道具、装饰、环境元素和容易被忽略的信息。

请尽量描述具体,不要只使用“高级感”“电影感”“氛围感”等空泛词语。
最后将分析结果整理成结构化列表。

为什么需要先拆解

直接让 AI 反推提示词,常见结果是:

1
一个女孩站在街道上,电影感,高清,细节丰富。

这种描述虽然没有错,但缺少人物姿态、服装材质、环境光线、镜头角度和构图关系,很难稳定复现参考图片的视觉效果。

先拆解图片,可以减少遗漏,也方便后续修改其中某一个元素。


第二步:反向生成基础提示词

完成图片拆解后,再让 AI 把分析结果组合成完整的生图提示词。

可直接复制的指令

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
请根据刚才的图片分析结果,反向生成一套完整的AI生图提示词。

要求:

1. 保留主体、场景、动作、构图、色调、光线、材质和镜头信息。
2. 使用具体、可视化的描述,不要只写“高级感”“震撼”“精美”等抽象词。
3. 按照以下顺序组织:
   主体 → 动作 → 场景 → 构图 → 光线 → 色彩 → 材质 → 风格 → 镜头 → 画质。
4. 不要添加原图中不存在的人物、物体、文字或装饰。
5. 分别输出中文提示词和英文提示词。
6. 额外提供一组负面提示词,用于避免文字、水印、变形、模糊和多余元素。

目标是尽可能还原参考图片的视觉氛围、构图方式和画面质感,而不是猜测原作者输入过的真实提示词。

推荐的提示词结构

1
主体 + 外观特征 + 动作姿态 + 场景环境 + 构图方式 + 光线条件 + 色彩关系 + 材质细节 + 艺术风格 + 镜头语言 + 画质要求

例如:

1
一座白色灯塔位于岩石海岸左侧,旁边是一栋红色屋顶的小屋,海浪拍打礁石,落日靠近海平面,暖金色阳光穿过橙粉色云层,三分法构图,低机位广角摄影,前景岩石形成视觉引导线,自然光,高动态范围,真实摄影质感,细节清晰。

第三步:优化成指定 AI 工具版本

不同 AI 生图工具对提示词的理解方式并不完全相同。

因此,基础提示词生成后,还需要告诉 AI 你准备使用哪一个生图工具。

通用优化指令

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
请将刚才的提示词优化成适合【工具名称】直接使用的版本。

要求:

1. 保留原图最重要的主体、构图、色调、光线和材质特征。
2. 调整语序和表达方式,使其符合该工具的提示词习惯。
3. 删除重复、矛盾和无法被模型理解的描述。
4. 不要随意改变原图内容。
5. 如果该工具支持参数,请补充合理参数。
6. 如果该工具不支持某项参数,请不要虚构。
7. 最终只输出:
   - 成品提示词
   - 负面提示词
   - 参数说明

提示词需要能够直接复制使用。

将其中的“工具名称”替换为:

1
2
3
4
5
6
7
8
Midjourney
Stable Diffusion
Flux
即梦AI
豆包
通义万相
Gemini
ChatGPT图像生成

Midjourney 提示词优化指令

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
请将这套图片描述优化成适合 Midjourney 使用的英文提示词。

要求:

1. 使用自然、连贯的英文视觉描述。
2. 优先描述主体、场景、构图、光线、色彩和镜头。
3. 删除重复词和没有实际视觉意义的形容词。
4. 不要添加原图中不存在的元素。
5. 根据参考图比例添加合适的 --ar 参数。
6. 根据画面需要添加合理的 --stylize 参数。
7. 最终只输出一条可以直接复制到 Midjourney 使用的完整提示词。

示例:

1
A realistic photograph of a white lighthouse standing on a rocky coastline at sunset, a small red-roofed house beside it, ocean waves crashing against dark rocks, warm golden sunlight passing through orange and pink clouds, rule-of-thirds composition, foreground rocks creating leading lines, wide-angle lens, natural cinematic lighting, realistic textures, high dynamic range, detailed coastal atmosphere --ar 4:3 --stylize 150

Stable Diffusion 提示词优化指令

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
请将这套图片描述优化成适合 Stable Diffusion 或 Flux 使用的提示词。

请分别输出:

1. Positive Prompt
2. Negative Prompt
3. 推荐画面比例
4. 推荐采样步数
5. 推荐 CFG 范围

要求:

- 主体描述放在前面。
- 使用清晰、具体的视觉关键词。
- 避免重复堆砌 masterpiece、best quality 等质量词。
- 负面提示词重点排除文字、水印、模糊、畸形和多余主体。
- 参数只提供通用建议,不要声称所有模型都使用相同设置。

通用负面提示词示例:

1
low quality, blurry, distorted perspective, malformed objects, duplicated subjects, extra limbs, bad anatomy, oversaturated colors, text, watermark, logo, frame, compression artifacts

让反推结果更准确的补充指令

第一次生成的提示词不够准确时,可以继续让 AI 对比和修正。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
请重新检查参考图片和刚才生成的提示词,找出提示词中遗漏、描述错误或权重不足的部分。

重点检查:

1. 主体位置是否准确。
2. 人物或物体数量是否正确。
3. 拍摄角度和景别是否一致。
4. 光源方向是否正确。
5. 主色调和冷暖关系是否准确。
6. 前景、中景和背景是否完整。
7. 是否加入了原图中不存在的元素。

请根据检查结果重新输出一版更准确、更简洁的提示词。

一个更高效的一次性提示词

不想分三次操作,也可以使用下面这套完整指令:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
请根据我上传的参考图片,完成一次AI生图提示词反向分析。

第一步,详细分析图片中的主体、场景、人物动作、视觉风格、色调、光线、构图、材质、镜头和关键细节。

第二步,根据分析结果生成一套能够尽量还原原图视觉效果的中文和英文提示词。

第三步,将提示词优化成适合【工具名称】直接使用的版本,并补充负面提示词与必要参数。

要求:

- 使用具体、可视化的描述。
- 不要只使用“高级感”“电影感”“精美”等空泛词语。
- 不要添加原图中不存在的内容。
- 清楚区分图片中能够确认的信息和根据画面推测的信息。
- 不要声称能够恢复原作者的真实提示词。
- 最终结果必须可以直接复制使用。

使用时需要注意的三个问题

1. AI 无法保证恢复原始提示词

同一张图片可以由多套不同提示词生成。反推提示词的本质,是根据最终画面重新描述视觉信息,而不是读取图片背后的原始 Prompt。

2. 图片中的文字需要单独处理

AI 对招牌、海报、包装和界面文字的识别可能出现错误。涉及准确文字时,应手动提供文字内容,不要完全依赖图片反推。

3. 参数不能机械照搬

采样器、步数、CFG、模型版本和 LoRA 权重主要适用于 Stable Diffusion 类工具。Midjourney、Gemini、ChatGPT 图像生成和即梦等平台使用不同的控制方式,不应强行套用相同参数。


适用场景

这套 AI 反推提示词工作流适合用于:

  • 分析优秀摄影作品的构图和光线
  • 学习商业海报的视觉结构
  • 复刻相近的插画或 3D 风格
  • 提取网站 Banner 的画面语言
  • 优化产品图和电商主图提示词
  • 将参考图片转换成 Midjourney 或 Stable Diffusion Prompt
  • 建立个人 AI 图片提示词素材库

建议把反推得到的内容当作初始版本,再根据实际生成结果不断调整主体、构图和光线,而不是一次生成后直接结束。


相关 GitHub 项目

下面这些开源项目可用于了解 Image to Prompt、图片描述和提示词工程:

开源项目的运行环境、模型版本和维护状态可能变化,使用前建议先查看项目 README、最近提交时间和 Issues。