拾光存档记录微光 · 存入时间
N 31° 13′ 46.98″
PAGE.2607.6507 拾光集 TOOD.WIN / PAGE

用 AI 做深度研究:STORM 方法图解与 4 组实用提示词

很多人使用 AI 做研究时,采用的方式仍然是:

提出一个问题,等待 AI 给出一段完整答案。

这种方法适合快速了解概念,却很难完成真正的深度研究。

原因很简单:当问题比较复杂时,不同领域、不同利益关系和不同立场的人,往往会得出完全不同的结论。只让 AI 给出一个答案,通常只能得到经过压缩的主流观点,而看不到观点之间的矛盾、证据强弱和尚未解决的问题。

更有效的方法,是让 AI 先从多个视角提出问题,再检索资料、比较证据、整理冲突,最后形成结构化结论。

这正是斯坦福大学 OVAL 实验室提出的 STORM 方法所关注的问题。

STORM

一、什么是 STORM?

STORM 的全称是:

Synthesis of Topic Outlines through Retrieval and Multi-perspective Question Asking

可以理解为:

通过信息检索和多视角提问,综合生成主题大纲。

STORM 是斯坦福 OVAL 实验室开发的一套 AI 知识研究与长文生成系统。它的目标并不是让 AI 直接写出答案,而是在写作之前先完成更充分的资料调查。

其核心流程包括:

  1. 发现与研究主题相关的不同视角;
  2. 模拟不同视角的提问者;
  3. 根据可靠的网络资料回答问题;
  4. 整理收集到的信息;
  5. 生成结构化文章大纲;
  6. 按照大纲撰写带有引用来源的长文。

因此,STORM 更适合处理需要多来源、多视角和结构化分析的复杂问题。

例如:

  • 某项新技术是否值得采用;
  • 一个商业模式是否可持续;
  • 某个行业未来可能如何变化;
  • 一项政策会影响哪些群体;
  • 一个产品是否值得长期投入;
  • 某个社会观点是否有充分证据支持。

需要注意的是,下面介绍的“四步提示词工作流”并不是 STORM 官方固定模板,而是根据其多视角提问、检索、整理与验证思想改造出来的实用方法。


二、第一步:多视角扫描

面对复杂问题时,不要立即要求 AI 给出最终结论。

第一步应该让 AI 从多个角色出发,分别提出观点、证据和疑问。

推荐的五个专家视角

1. 实践者

实践者关注真实执行过程中发生了什么。

他通常会分析:

  • 理论与实际操作之间有什么差距;
  • 哪些方法看起来正确,但实际很难执行;
  • 一线人员遇到了哪些问题;
  • 哪些成本经常被忽略;
  • 哪些建议只有在特定条件下才有效。

2. 学者

学者关注已有研究、理论模型和证据质量。

他通常会分析:

  • 是否存在同行评审研究;
  • 不同研究的结论是否一致;
  • 样本规模是否足够;
  • 研究方法是否可靠;
  • 当前学术界是否已经形成共识。

3. 怀疑者

怀疑者负责挑战主流结论。

他通常会提出:

  • 当前观点可能建立在哪些错误假设上;
  • 是否存在幸存者偏差;
  • 是否只选择了支持结论的证据;
  • 有哪些强有力的反方观点;
  • 在什么情况下当前结论会失效。

4. 经济学家

经济学家关注利益、成本和激励机制。

他通常会分析:

  • 谁会从当前叙事中获益;
  • 谁在承担成本;
  • 不同参与者的真实动机是什么;
  • 市场激励会不会改变行为;
  • 短期收益和长期收益是否冲突。

5. 历史学家

历史学家关注类似事件和长期规律。

他通常会分析:

  • 历史上是否发生过类似情况;
  • 当时采用了什么解决方案;
  • 哪些因素导致成功或失败;
  • 当前情况与历史案例有哪些差异;
  • 哪些历史经验可能无法直接套用。

多视角扫描提示词

将下面的提示词复制给支持联网搜索的 AI,并替换其中的研究主题。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
你是一名深度研究助手。

请围绕以下主题展开多视角研究:

【研究主题】
在这里填写需要研究的问题。

请分别模拟以下五种角色:

1. 实践者:关注真实执行经验、现实限制和理论与实际之间的差距。
2. 学者:关注同行评审研究、理论模型、数据质量和学术共识。
3. 怀疑者:挑战主流观点,提出最有力的反方论证。
4. 经济学家:分析利益关系、成本结构、激励机制和资源分配。
5. 历史学家:寻找历史案例、长期规律和类似事件。

每个角色分别输出:

- 核心立场;
- 支持该立场的三个主要论据;
- 可以查证的证据或来源;
- 该视角最担心的问题;
- 一个其他角色可能忽略的重要信息;
- 当前结论的置信度,使用高、中、低表示。

要求:

- 不得虚构研究、统计数据、专家观点或来源;
- 将事实、推测和观点分开表达;
- 优先引用原始资料、官方文件和学术论文;
- 无法确认的信息必须明确标注;
- 不要急于给出统一结论。

这一步的重点不是马上判断谁对谁错,而是尽可能展开问题的不同侧面。


三、第二步:绘制矛盾图

多视角研究真正有价值的地方,不是得到五段相似的介绍,而是发现它们之间的分歧。

例如:

  • 学术研究认为某种方法有效,但实践者认为执行成本太高;
  • 经济学家认为市场会迅速接受,但历史学家发现类似技术曾多次失败;
  • 多数观点支持某项政策,但怀疑者指出研究样本存在偏差。

这些冲突往往比单独的观点更值得研究。

矛盾图需要分析什么?

1. 直接矛盾

找出无法同时成立的结论。

例如:

1
2
3
观点 A:AI 可以显著降低企业运营成本。

观点 B:企业部署 AI 后,短期运营成本反而会上升。

这两个观点看似冲突,但可能分别讨论了长期成本和短期成本。

因此,还需要继续检查:

  • 双方讨论的是不是同一时间范围;
  • 使用的是不是同一种衡量标准;
  • 研究对象是否相同;
  • 是否存在隐藏的前提条件。

2. 证据强弱

不是所有观点都具有相同可信度。

可以按照以下顺序评估来源:

  1. 原始数据和官方文件;
  2. 同行评审论文;
  3. 系统性综述或专业机构报告;
  4. 企业公开报告;
  5. 专家访谈;
  6. 新闻报道;
  7. 个人经验;
  8. 无法验证的网络观点。

来源级别高,并不代表结论一定正确,但通常更容易核验。

3. 跨视角共识

如果立场不同的角色仍然同意某个判断,这部分信息通常更值得重视。

例如,实践者、学者和怀疑者可能都认为:

当前证据不足以支持大规模部署。

这类跨立场共识,可以作为阶段性判断的重要依据。

4. 研究空白

还要检查哪些关键问题没有被任何角色提到。

常见空白包括:

  • 缺乏长期数据;
  • 没有分析失败案例;
  • 忽略特定地区或人群;
  • 缺少实际成本数据;
  • 没有讨论实施条件;
  • 没有考虑政策变化;
  • 只引用单一语言或单一国家的资料。

矛盾分析提示词

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
请基于上一轮五个角色的研究结果,绘制一份“观点矛盾图”。

按照以下结构输出:

## 一、主要观点列表

列出每个角色最核心的结论。

## 二、直接冲突

找出彼此对立或无法同时成立的观点。

对每组冲突分别说明:

- 冲突双方;
- 具体分歧;
- 双方使用的证据;
- 双方是否讨论了不同对象、时间范围或前提条件;
- 当前哪一方的证据更强;
- 还需要什么信息才能解决争议。

## 三、证据强度排序

将主要观点按照证据可靠性排序,并说明理由。

优先考虑:

1. 原始数据;
2. 官方资料;
3. 同行评审论文;
4. 专业机构报告;
5. 企业资料;
6. 新闻报道;
7. 专家或个人观点。

## 四、跨视角共识

找出多个角色共同认可的部分,并说明:

- 有多少角色支持;
- 是否存在可靠来源;
- 是否可以视为阶段性事实;
- 仍有哪些限制条件。

## 五、研究盲区

指出当前分析中无人讨论或证据不足的领域。

要求:

- 不要为了形成结论而强行消除矛盾;
- 将事实冲突和价值判断冲突分开;
- 对证据不足的部分明确标注“不确定”;
- 不得用来源数量代替来源质量。

四、第三步:合成研究简报

完成多视角扫描和矛盾分析后,再让 AI 整合信息。

这时生成的结论会比直接提问更有层次,因为 AI 已经知道:

  • 有哪些主要观点;
  • 哪些观点存在冲突;
  • 哪些证据比较可靠;
  • 哪些问题仍然没有答案。

一份合格的研究简报应该包含什么?

1. 一句话总结

用一句话概括当前最重要的研究结论。

它不应该只是重复标题,而应该直接回答:

综合现有证据,目前最合理的判断是什么?

2. 五个关键发现

按照可靠程度排序,而不是按照表达是否精彩排序。

每个发现应该包含:

  • 结论;
  • 主要证据;
  • 反方意见;
  • 适用条件;
  • 置信度。

3. 隐藏的关联

寻找只有结合多个视角才能发现的关系。

例如:

  • 技术效果很好,但组织激励阻碍了落地;
  • 市场需求真实存在,但现有商业模式无法盈利;
  • 学术证据支持短期效果,却缺少长期风险数据;
  • 历史案例失败,并非技术问题,而是成本和监管问题。

这类跨视角联系,往往是深度研究最有价值的部分。

4. 可操作建议

研究结果最终要能够帮助用户做出判断或采取行动。

建议应该具体到:

  • 先做什么;
  • 暂时不要做什么;
  • 需要验证什么;
  • 应该设置什么条件;
  • 在什么情况下停止;
  • 在什么情况下扩大投入。

5. 下一步研究问题

一份可信的研究不会假装所有问题都已经解决。

它应该明确指出:

  • 哪些结论仍然不确定;
  • 需要补充哪些数据;
  • 哪些变量最可能改变结论;
  • 未来应该持续关注什么。

研究简报提示词

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
请基于前面的多视角研究和矛盾分析,生成一份结构化研究简报。

按照以下格式输出:

# 研究主题

## 一句话结论

用一句准确、克制的语言概括当前最重要的发现。

## 五个关键发现

按照可靠性从高到低排序。

每个发现包含:

- 结论;
- 主要证据;
- 支持来源;
- 反方观点;
- 适用条件;
- 置信度。

## 主要争议

总结目前仍未解决的核心矛盾,并说明争议产生的原因。

## 隐藏的关联

列出至少三个只有综合多个视角才能发现的深层联系。

## 可操作建议

分别给出:

- 现在可以执行的行动;
- 执行前需要验证的条件;
- 暂时不建议采取的行动;
- 需要持续观察的指标。

## 研究限制

说明资料、数据、时间范围、地域和研究方法存在的限制。

## 下一步问题

列出五个值得进一步研究的问题。

要求:

- 不要把推测写成事实;
- 不要隐藏相互矛盾的证据;
- 每项重要结论尽量附带可核验来源;
- 建议必须能够追溯到前面的研究发现;
- 没有充分证据时,使用审慎措辞。

五、第四步:让 AI 自我评估

AI 给出结构化报告之后,还不能立即把它当作最终答案。

最后一步是让 AI 重新审视自己的研究过程。

这一步主要用于发现:

  • 证据不足;
  • 来源质量不高;
  • 观点偏向单一;
  • 推理跳跃;
  • 结论过度确定;
  • 忽略反例;
  • 将相关性误写成因果关系。

自我评估的四个重点

1. 结论置信度

让 AI 对每个关键结论分别评分,而不是只给整篇报告一个总分。

可以采用以下标准:

  • 高置信度:多个高质量独立来源相互支持;
  • 中等置信度:有一定证据,但存在范围或方法限制;
  • 低置信度:证据较少、来源单一或主要依赖推测。

2. 最薄弱的部分

要求 AI 主动指出:

  • 哪个发现证据最少;
  • 哪条因果关系最可疑;
  • 哪个数据最可能过时;
  • 哪个来源可能存在利益冲突;
  • 哪项建议最依赖特定假设。

3. 视角偏差

检查研究是否遗漏了重要群体。

例如:

  • 只分析企业,没有分析消费者;
  • 只分析支持者,没有分析反对者;
  • 只分析欧美市场,没有分析其他地区;
  • 只关注技术,没有关注法律和伦理;
  • 只看成功案例,没有看失败案例。

4. 外部专家审查

可以让 AI 模拟教授、行业专家或审稿人进行批评。

但要注意:模拟评分只是帮助发现问题,不能代替真实专家评审。


自我评估提示词

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
请对上一份研究简报进行严格的自我评估。

不要继续扩写报告,而是站在审稿人的角度寻找问题。

按照以下结构输出:

## 一、结论置信度

对每个关键发现分别给出:

- 置信度:高、中或低;
- 支持该结论的证据;
- 降低可信度的因素;
- 哪些新证据可能改变结论。

## 二、最薄弱的三个环节

分别说明:

- 薄弱点是什么;
- 为什么薄弱;
- 是否存在推理跳跃;
- 应该补充什么资料。

## 三、来源质量检查

检查:

- 是否过度依赖单一来源;
- 是否引用了二手资料而没有找到原始来源;
- 是否存在利益冲突;
- 是否混用了不同时间、地区或统计口径的数据;
- 是否存在无法核验的来源。

## 四、视角偏差检查

分析:

- 哪个角色的影响过大;
- 哪些关键利益相关者没有被纳入;
- 是否遗漏法律、伦理、环境、地域或文化视角;
- 是否忽略失败案例和反例。

## 五、推理错误检查

重点检查:

- 是否把相关性当成因果关系;
- 是否存在过度概括;
- 是否以偏概全;
- 是否使用未经证明的前提;
- 是否因为多数观点一致就直接判断为事实。

## 六、模拟专家评分

假设由一位严格的大学教授或行业研究负责人评分:

- 研究广度:满分20分;
- 证据质量:满分20分;
- 逻辑严谨性:满分20分;
- 反方观点处理:满分20分;
- 可操作性:满分20分。

给出总分,并说明最需要修改的三处内容。

## 七、修订建议

按优先级列出下一轮研究需要完成的工作。

要求:

- 不要为原报告辩护;
- 优先寻找可能推翻结论的证据;
- 明确区分已知事实、合理推断和未知信息;
- 不得虚构新的来源。

六、如何连续使用这四组提示词?

实际操作时,可以按照以下顺序执行:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
确定研究问题
多视角扫描
绘制矛盾图
合成研究简报
执行自我评估
补充检索与人工核验
形成最终结论

不要一次把四组提示词全部发给 AI。

更合适的方法是逐步执行,因为每一步都需要检查上一轮结果。

例如:

  1. 先执行多视角扫描;
  2. 删除明显无关或重复的观点;
  3. 要求 AI 补充缺失来源;
  4. 再执行矛盾分析;
  5. 检查冲突是否真实存在;
  6. 再生成研究简报;
  7. 最后执行自我评估;
  8. 人工打开关键来源进行核验。

这样能够减少错误在不同阶段不断累积。


七、如何提出一个适合深度研究的问题?

问题越模糊,研究结果越容易变成泛泛介绍。

不推荐这样问:

1
AI 未来怎么样?

可以改成:

1
未来三年,生成式 AI 会如何影响中国中小型外贸企业的内容营销、人力成本和客户服务?请重点分析实际部署成本、数据安全和投资回报。

不推荐这样问:

1
独立站还有必要做吗?

可以改成:

1
对于预算有限的中国中小企业,在 Google 搜索流量受到 AI Overview 影响的情况下,2026 年继续建设品牌独立站是否仍然具有长期价值?

一个好的研究问题通常包含:

  • 研究对象;
  • 时间范围;
  • 地域范围;
  • 需要比较的方案;
  • 关注的指标;
  • 最终需要支持的决策。

八、STORM 方法适合哪些场景?

STORM 式多视角研究更适合以下任务:

商业决策

例如:

  • 是否进入一个新市场;
  • 是否采用某项新技术;
  • 是否更换供应商;
  • 是否开发某类产品;
  • 是否调整营销渠道。

行业研究

例如:

  • AI 搜索会如何影响传统 SEO
  • 自动化会如何改变某个职业;
  • 某类材料是否具备增长潜力;
  • 某项政策会怎样影响行业。

产品与技术选型

例如:

  • WordPressNext.js 如何选择;
  • 是否需要自建大模型;
  • 某个开源项目是否适合生产环境;
  • 云服务与本地部署哪个成本更低。

内容创作

例如:

  • 深度博客文章;
  • 行业趋势报告;
  • 产品研究报告;
  • 商业分析文章;
  • 带引用的知识型内容。

学习复杂概念

例如:

  • 比较不同经济理论;
  • 分析历史事件;
  • 理解存在争议的科学问题;
  • 梳理一个跨学科主题。

九、哪些情况不需要使用 STORM?

并不是所有问题都需要深度研究。

以下任务通常直接提问即可:

  • 查询一个明确日期;
  • 翻译一段文字;
  • 修正错别字;
  • 进行简单计算;
  • 编写一个基础函数;
  • 查询一个稳定定义;
  • 调整一段文案语气。

如果一个问题只有明确答案,就没有必要模拟多个专家制造无意义的分歧。

STORM 更适合以下特征的问题:

  • 问题本身比较复杂;
  • 存在明显争议;
  • 不同群体立场不同;
  • 需要综合多个来源;
  • 结论会影响重要决策;
  • 需要形成长篇研究报告。

十、使用 AI 深度研究时需要注意什么?

1. 多视角不等于真实专家

AI 模拟的实践者、学者或经济学家,并不是真实专家。

这些角色的作用是帮助展开问题,而不是提供专家资质。

2. 有引用不代表引用正确

AI 可能出现:

  • 链接与结论不匹配;
  • 引用二手报道;
  • 错误理解论文内容;
  • 引用已经过时的数据;
  • 找到同名但无关的资料。

关键来源仍然需要人工打开核验。

3. 共识不一定就是事实

多个 AI 角色可能共享同一训练偏差,因此它们同时认同某个观点,并不能自动证明观点正确。

4. 复杂输出可能掩盖错误

表格、评分、引用和专业术语会让报告看起来更可信,但排版精美不等于证据可靠。

5. 研究结果具有时间限制

涉及技术、市场、法律、价格、公司和政策的信息可能快速变化。

最终报告中应该标明:

  • 检索日期;
  • 数据时间范围;
  • 资料来源;
  • 尚未核实的内容;
  • 研究适用边界。

总结:不要让 AI 只给答案,要让它展示研究过程

传统的 AI 问答通常是:

1
2
3
提出问题
生成答案

STORM 式研究则更接近:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
拆解问题
发现不同视角
提出多维度问题
检索外部资料
比较证据与矛盾
形成结构化大纲
生成研究简报
评估结论可信度

两者最大的区别,不是最终文章更长,而是研究过程更加透明。

当一个问题涉及争议、利益、风险或长期决策时,不要急着让 AI 给出确定答案。先让它寻找不同视角、展示矛盾、比较证据,再决定哪些结论值得相信。

AI 深度研究真正有价值的地方,不是替你思考,而是帮助你发现原本没有想到的问题。


项目地址

STORM 在线版属于研究预览,生成的报告仍可能包含错误。涉及医疗、法律、金融、商业投资或其他重要决策时,应进一步核对原始资料,并咨询对应领域的专业人士。