很多人使用 AI 做研究时,采用的方式仍然是:
提出一个问题,等待 AI 给出一段完整答案。
这种方法适合快速了解概念,却很难完成真正的深度研究。
原因很简单:当问题比较复杂时,不同领域、不同利益关系和不同立场的人,往往会得出完全不同的结论。只让 AI 给出一个答案,通常只能得到经过压缩的主流观点,而看不到观点之间的矛盾、证据强弱和尚未解决的问题。
更有效的方法,是让 AI 先从多个视角提出问题,再检索资料、比较证据、整理冲突,最后形成结构化结论。
这正是斯坦福大学 OVAL 实验室提出的 STORM 方法所关注的问题。

一、什么是 STORM?
STORM 的全称是:
Synthesis of Topic Outlines through Retrieval and Multi-perspective Question Asking
可以理解为:
通过信息检索和多视角提问,综合生成主题大纲。
STORM 是斯坦福 OVAL 实验室开发的一套 AI 知识研究与长文生成系统。它的目标并不是让 AI 直接写出答案,而是在写作之前先完成更充分的资料调查。
其核心流程包括:
- 发现与研究主题相关的不同视角;
- 模拟不同视角的提问者;
- 根据可靠的网络资料回答问题;
- 整理收集到的信息;
- 生成结构化文章大纲;
- 按照大纲撰写带有引用来源的长文。
因此,STORM 更适合处理需要多来源、多视角和结构化分析的复杂问题。
例如:
- 某项新技术是否值得采用;
- 一个商业模式是否可持续;
- 某个行业未来可能如何变化;
- 一项政策会影响哪些群体;
- 一个产品是否值得长期投入;
- 某个社会观点是否有充分证据支持。
需要注意的是,下面介绍的“四步提示词工作流”并不是 STORM 官方固定模板,而是根据其多视角提问、检索、整理与验证思想改造出来的实用方法。
二、第一步:多视角扫描
面对复杂问题时,不要立即要求 AI 给出最终结论。
第一步应该让 AI 从多个角色出发,分别提出观点、证据和疑问。
推荐的五个专家视角
1. 实践者
实践者关注真实执行过程中发生了什么。
他通常会分析:
- 理论与实际操作之间有什么差距;
- 哪些方法看起来正确,但实际很难执行;
- 一线人员遇到了哪些问题;
- 哪些成本经常被忽略;
- 哪些建议只有在特定条件下才有效。
2. 学者
学者关注已有研究、理论模型和证据质量。
他通常会分析:
- 是否存在同行评审研究;
- 不同研究的结论是否一致;
- 样本规模是否足够;
- 研究方法是否可靠;
- 当前学术界是否已经形成共识。
3. 怀疑者
怀疑者负责挑战主流结论。
他通常会提出:
- 当前观点可能建立在哪些错误假设上;
- 是否存在幸存者偏差;
- 是否只选择了支持结论的证据;
- 有哪些强有力的反方观点;
- 在什么情况下当前结论会失效。
4. 经济学家
经济学家关注利益、成本和激励机制。
他通常会分析:
- 谁会从当前叙事中获益;
- 谁在承担成本;
- 不同参与者的真实动机是什么;
- 市场激励会不会改变行为;
- 短期收益和长期收益是否冲突。
5. 历史学家
历史学家关注类似事件和长期规律。
他通常会分析:
- 历史上是否发生过类似情况;
- 当时采用了什么解决方案;
- 哪些因素导致成功或失败;
- 当前情况与历史案例有哪些差异;
- 哪些历史经验可能无法直接套用。
多视角扫描提示词
将下面的提示词复制给支持联网搜索的 AI,并替换其中的研究主题。
|
|
这一步的重点不是马上判断谁对谁错,而是尽可能展开问题的不同侧面。
三、第二步:绘制矛盾图
多视角研究真正有价值的地方,不是得到五段相似的介绍,而是发现它们之间的分歧。
例如:
- 学术研究认为某种方法有效,但实践者认为执行成本太高;
- 经济学家认为市场会迅速接受,但历史学家发现类似技术曾多次失败;
- 多数观点支持某项政策,但怀疑者指出研究样本存在偏差。
这些冲突往往比单独的观点更值得研究。
矛盾图需要分析什么?
1. 直接矛盾
找出无法同时成立的结论。
例如:
|
|
这两个观点看似冲突,但可能分别讨论了长期成本和短期成本。
因此,还需要继续检查:
- 双方讨论的是不是同一时间范围;
- 使用的是不是同一种衡量标准;
- 研究对象是否相同;
- 是否存在隐藏的前提条件。
2. 证据强弱
不是所有观点都具有相同可信度。
可以按照以下顺序评估来源:
- 原始数据和官方文件;
- 同行评审论文;
- 系统性综述或专业机构报告;
- 企业公开报告;
- 专家访谈;
- 新闻报道;
- 个人经验;
- 无法验证的网络观点。
来源级别高,并不代表结论一定正确,但通常更容易核验。
3. 跨视角共识
如果立场不同的角色仍然同意某个判断,这部分信息通常更值得重视。
例如,实践者、学者和怀疑者可能都认为:
当前证据不足以支持大规模部署。
这类跨立场共识,可以作为阶段性判断的重要依据。
4. 研究空白
还要检查哪些关键问题没有被任何角色提到。
常见空白包括:
- 缺乏长期数据;
- 没有分析失败案例;
- 忽略特定地区或人群;
- 缺少实际成本数据;
- 没有讨论实施条件;
- 没有考虑政策变化;
- 只引用单一语言或单一国家的资料。
矛盾分析提示词
|
|
四、第三步:合成研究简报
完成多视角扫描和矛盾分析后,再让 AI 整合信息。
这时生成的结论会比直接提问更有层次,因为 AI 已经知道:
- 有哪些主要观点;
- 哪些观点存在冲突;
- 哪些证据比较可靠;
- 哪些问题仍然没有答案。
一份合格的研究简报应该包含什么?
1. 一句话总结
用一句话概括当前最重要的研究结论。
它不应该只是重复标题,而应该直接回答:
综合现有证据,目前最合理的判断是什么?
2. 五个关键发现
按照可靠程度排序,而不是按照表达是否精彩排序。
每个发现应该包含:
- 结论;
- 主要证据;
- 反方意见;
- 适用条件;
- 置信度。
3. 隐藏的关联
寻找只有结合多个视角才能发现的关系。
例如:
- 技术效果很好,但组织激励阻碍了落地;
- 市场需求真实存在,但现有商业模式无法盈利;
- 学术证据支持短期效果,却缺少长期风险数据;
- 历史案例失败,并非技术问题,而是成本和监管问题。
这类跨视角联系,往往是深度研究最有价值的部分。
4. 可操作建议
研究结果最终要能够帮助用户做出判断或采取行动。
建议应该具体到:
- 先做什么;
- 暂时不要做什么;
- 需要验证什么;
- 应该设置什么条件;
- 在什么情况下停止;
- 在什么情况下扩大投入。
5. 下一步研究问题
一份可信的研究不会假装所有问题都已经解决。
它应该明确指出:
- 哪些结论仍然不确定;
- 需要补充哪些数据;
- 哪些变量最可能改变结论;
- 未来应该持续关注什么。
研究简报提示词
|
|
五、第四步:让 AI 自我评估
AI 给出结构化报告之后,还不能立即把它当作最终答案。
最后一步是让 AI 重新审视自己的研究过程。
这一步主要用于发现:
- 证据不足;
- 来源质量不高;
- 观点偏向单一;
- 推理跳跃;
- 结论过度确定;
- 忽略反例;
- 将相关性误写成因果关系。
自我评估的四个重点
1. 结论置信度
让 AI 对每个关键结论分别评分,而不是只给整篇报告一个总分。
可以采用以下标准:
- 高置信度:多个高质量独立来源相互支持;
- 中等置信度:有一定证据,但存在范围或方法限制;
- 低置信度:证据较少、来源单一或主要依赖推测。
2. 最薄弱的部分
要求 AI 主动指出:
- 哪个发现证据最少;
- 哪条因果关系最可疑;
- 哪个数据最可能过时;
- 哪个来源可能存在利益冲突;
- 哪项建议最依赖特定假设。
3. 视角偏差
检查研究是否遗漏了重要群体。
例如:
- 只分析企业,没有分析消费者;
- 只分析支持者,没有分析反对者;
- 只分析欧美市场,没有分析其他地区;
- 只关注技术,没有关注法律和伦理;
- 只看成功案例,没有看失败案例。
4. 外部专家审查
可以让 AI 模拟教授、行业专家或审稿人进行批评。
但要注意:模拟评分只是帮助发现问题,不能代替真实专家评审。
自我评估提示词
|
|
六、如何连续使用这四组提示词?
实际操作时,可以按照以下顺序执行:
|
|
不要一次把四组提示词全部发给 AI。
更合适的方法是逐步执行,因为每一步都需要检查上一轮结果。
例如:
- 先执行多视角扫描;
- 删除明显无关或重复的观点;
- 要求 AI 补充缺失来源;
- 再执行矛盾分析;
- 检查冲突是否真实存在;
- 再生成研究简报;
- 最后执行自我评估;
- 人工打开关键来源进行核验。
这样能够减少错误在不同阶段不断累积。
七、如何提出一个适合深度研究的问题?
问题越模糊,研究结果越容易变成泛泛介绍。
不推荐这样问:
|
|
可以改成:
|
|
不推荐这样问:
|
|
可以改成:
|
|
一个好的研究问题通常包含:
- 研究对象;
- 时间范围;
- 地域范围;
- 需要比较的方案;
- 关注的指标;
- 最终需要支持的决策。
八、STORM 方法适合哪些场景?
STORM 式多视角研究更适合以下任务:
商业决策
例如:
- 是否进入一个新市场;
- 是否采用某项新技术;
- 是否更换供应商;
- 是否开发某类产品;
- 是否调整营销渠道。
行业研究
例如:
- AI 搜索会如何影响传统 SEO;
- 自动化会如何改变某个职业;
- 某类材料是否具备增长潜力;
- 某项政策会怎样影响行业。
产品与技术选型
例如:
内容创作
例如:
- 深度博客文章;
- 行业趋势报告;
- 产品研究报告;
- 商业分析文章;
- 带引用的知识型内容。
学习复杂概念
例如:
- 比较不同经济理论;
- 分析历史事件;
- 理解存在争议的科学问题;
- 梳理一个跨学科主题。
九、哪些情况不需要使用 STORM?
并不是所有问题都需要深度研究。
以下任务通常直接提问即可:
- 查询一个明确日期;
- 翻译一段文字;
- 修正错别字;
- 进行简单计算;
- 编写一个基础函数;
- 查询一个稳定定义;
- 调整一段文案语气。
如果一个问题只有明确答案,就没有必要模拟多个专家制造无意义的分歧。
STORM 更适合以下特征的问题:
- 问题本身比较复杂;
- 存在明显争议;
- 不同群体立场不同;
- 需要综合多个来源;
- 结论会影响重要决策;
- 需要形成长篇研究报告。
十、使用 AI 深度研究时需要注意什么?
1. 多视角不等于真实专家
AI 模拟的实践者、学者或经济学家,并不是真实专家。
这些角色的作用是帮助展开问题,而不是提供专家资质。
2. 有引用不代表引用正确
AI 可能出现:
- 链接与结论不匹配;
- 引用二手报道;
- 错误理解论文内容;
- 引用已经过时的数据;
- 找到同名但无关的资料。
关键来源仍然需要人工打开核验。
3. 共识不一定就是事实
多个 AI 角色可能共享同一训练偏差,因此它们同时认同某个观点,并不能自动证明观点正确。
4. 复杂输出可能掩盖错误
表格、评分、引用和专业术语会让报告看起来更可信,但排版精美不等于证据可靠。
5. 研究结果具有时间限制
涉及技术、市场、法律、价格、公司和政策的信息可能快速变化。
最终报告中应该标明:
- 检索日期;
- 数据时间范围;
- 资料来源;
- 尚未核实的内容;
- 研究适用边界。
总结:不要让 AI 只给答案,要让它展示研究过程
传统的 AI 问答通常是:
|
|
STORM 式研究则更接近:
|
|
两者最大的区别,不是最终文章更长,而是研究过程更加透明。
当一个问题涉及争议、利益、风险或长期决策时,不要急着让 AI 给出确定答案。先让它寻找不同视角、展示矛盾、比较证据,再决定哪些结论值得相信。
AI 深度研究真正有价值的地方,不是替你思考,而是帮助你发现原本没有想到的问题。
项目地址
STORM 在线版属于研究预览,生成的报告仍可能包含错误。涉及医疗、法律、金融、商业投资或其他重要决策时,应进一步核对原始资料,并咨询对应领域的专业人士。