更清晰地讨论AI的未来

你对AI有何预期,为什么会有这样的预期,又有什么可能改变你的看法?

Doom or Bloom通过几个开放式问题,帮助你探索关于AI的各种观点,并梳理自己的想法。无需专业知识,也无需账户。完全免费且开源。

为什么要开发这个?

AI的潜在益处和风险值得谨慎、立足事实的讨论。随着能力提升、决策影响日益重大,我们需要易于使用的方式,在差异巨大的观点之间进行清晰思考。

我开发这个网站,是为了探索这一领域中的各种声音,并帮助人们理清相互冲突的直觉。它已经让我自己的观点更加清晰。目标是在尽可能少地进行编辑引导的情况下,如实呈现你的观点。

方法说明

影响你结果的一切均为开源。带编号的注释链接到具体文件和研究。

访谈如何进行

  1. 开场问题每个人都相同
  2. 地图问题总体影响、变革规模和 P(doom),每项最多询问一次
  3. 追问针对仍不明确之处的人工编写问题,总计最多 12 个
  4. 你的结果当你的地图可以定位时显示;你可以继续回答

每次回答后

Jev 判断

  • 回答是否可用
  • 哪项人工编写的描述与回答相符
  • 每个候选问题能在多大程度上澄清情况

代码决定

  • 接下来提出哪个问题
  • 结果何时准备好
  • 你的地图位置、范围和 P(doom)

代码从一份固定的人工编写问题列表中,为每次追问⁠[1]选择问题,⁠[2]大多数人在回答其中 4–8 个问题后就能看到结果。TypeSafe 的 Jev依据人工编写的评分标准⁠[3],通过小而聚焦的判断来解读你的回答,绝不会编写问题或对你下定论。⁠[4]代码将这些判断汇总成你的地图、相应范围和 P(doom)。⁠[5]将小判断批量处理,使成本足够低,从而可以免费运行。

你的结果是什么,又不是什么

地图
这是我们对你所写内容的解读,而不是裁决、测试或预测。虚线框表示其他合理的解读,而不是你正确的概率。⁠[6]
地图背后
八个世界观维度和七项推理品质,例如修正观点的意愿。缺少证据的项目会保持未定位;绝不会被算作低分。⁠[5]
P(doom)
要么是你输入的数字,要么是根据你的回答推断出的估计值,并且会注明是哪一种。⁠[7]
编辑选择
回答不会经过事实核查。问题、评分标准,甚至名称都涉及编辑选择,而名称可能会促使你倾向于关注风险和益处。混合观点、不确定性和连贯的极端观点都是有效的。⁠[8]
意见领袖
模拟:另一个模型(GPT-5.6 Sol)依据每个人所链接的公开来源,代其回答相同的问题,⁠[9]我们的引擎在不知道回答者身份的情况下解读这些回答。⁠[10]这些并非本人作答,也不代表本人认可。请将它们视为原型:在 2026 年 Pew 的一项测试中,AI 替身的回答与真人回答平均相差 12 个百分点。⁠[11]

目前的证据

对前景的不同解读在定位上相差多远

对相同回答的两次解读

Jev,对回答解读两次
0.007
Jev,在保持原意的改写后进行解读
0.019
Jev 与 GPT-5.6 Sol 的对比
0.060

相对于本人自我定位的解读

Jev
0.141
GPT-5.6 Sol
0.135
对所有人采用相同的猜测
0.233

0–1 Doom–Bloom 轴上的平均距离;条形延伸至 0.3,越短表示越接近。数据来自 219 次自我定位和 60 次改写后的访谈,2026年9月29日⁠[12]

你自己的定位
解读结果比对所有人采用同一个猜测更接近人们自己的定位,且平均而言不偏向希望或担忧。⁠[13]不同解读者之间的一致程度远高于他们与受访者之间的一致程度,因此大部分差距源于人们的表述方式与自我认知之间的差异。如果两者在任一轴上的差异超过四分之一,你的结果会就此提问。
重新解读和改写措辞
对于含义相同的回答,无论重新解读还是改写访谈,展望的变化都未超过我们设定的 0.10 上限。⁠[14] 地图范围绝不会绘制得窄于 ±0.05,这是模拟人物重新参加访谈时观察到的变化幅度。
更大的模型
Jev 与 GPT-5.6 Sol 的结果差异在噪声范围内,而成本约为后者的 1/21。⁠[12]
“这感觉准确吗?”
80 人中有 68 人回答是(85%)。⁠[13]应将其视为上限:人们往往会认同 AI 对自己的解读。在一项 NORC 研究中,独立编码者认可 AI 编码的频率比受访者低约 20%。⁠[15]
推断的 P(doom)
粗略估计。在隐藏人们输入的 113 个数值后,用这些数值检验时,它解读了其中的 96 个,但按赔率计算,结果在 2× 范围内的情况仅占 22%,并不比对所有人都猜测 12.5% 更准确。它确实能合理地对人们进行排序,而你输入的百分比(例如“20%”)始终优先采用。⁠[12]
尚未完成
我们还没有按照评估计划的要求,建立由独立评审者标注的盲测集。⁠[14]在此之前,这里的每项检验都是将解读结果与自我定位、重新运行的结果或其他模型进行比较。不同访谈语言的结果也尚未进行比较。

哪些人参加过

截至 2026年10月3日,已有 963 人得出了结果。⁠[13]他们选择参加评估,主要是通过 Hacker News 上的一个讨论帖(9/25 – 9/26)和 X 上的帖子(9/27 – 9/28),而这两批人的结果相差很大:在 0–1 Doom–Bloom 轴上,前者的展望中位数为 0.32,后者为 0.68(查看比较)。因此,我们的数据描述的是参与者,而不是公众;并且我们只公布人数至少为 10 的群体的数据。

为什么问题由人工编写

AI 可以即兴进行访谈。采用固定的人工编写问题,可以让措辞保持中立且完全一致,使每位参与者和每位模拟的意见领袖都回答相同的问题,从而使比较具有意义。AAPOR 的 2026 年指南将生成问题、改变问题措辞或影响访谈流程的 AI 访谈员评为高风险。⁠[16]在这里,措辞从不改变,而 Jev 仅通过判断来影响流程,代码会根据这些判断从问题中进行选择。

版本和变更

算法
0.7.5
问题
0.4.0-draft
评分标准
0.1.0-draft
模型
jev-1.13.0

每个已保存的结果都会保留生成该结果时所用的版本。无需重新判断的修正也会在显示较早的结果时应用于这些结果。

  1. · 0.7.5将人们定位在地图的五个级别之间,而不再只定位在这些级别上,并重新解读已保存的结果⁠[17]
  2. · 0.7.4支持使用 10 种语言进行访谈;Jev 按回答的原文进行解读,并会获知访谈所用的语言
  3. · 0.7.2–0.7.3保留像“30%”这样简短的手动输入 P(doom) 回答(此前会被推断值取代),并在解读结果存在分歧或与你自己的定位相差很大时多问一个问题⁠[12]
  4. · 0.7.0–0.7.1修正 P(doom) 的显示方式(手动输入的 20% 曾显示为大约 3%),直接询问变革规模和 P(doom),不再因推理覆盖度不足而暂不提供结果,并重新解读已保存的结果⁠[18]

GitHub 上的研究笔记记录了每项变更及其依据。

以Elon Musk为例

以下是Elon Musk的模拟评估所生成的一些JSON结果示例。

评估输入

Depth 1+ folded · dotted keys have hover help

}

为单次模拟评估提供给Jev的回答和背景信息。

生成的结果

Depth 1+ folded · dotted keys have hover help

"evidenceRevision": 5,
"sources": [],
true,
"capped": false,
"insufficient": false,
"reason": "Your answers place your outlook and the scale of change you expect, which is what the map needs. More answers can sharpen it."
}

我们的应用用于推断结果的一组综合判断。

你的回答仍归你所有

你的回答和结果默认保密。如果你想分享,可以选择将其公开。无需注册。请阅读隐私政策了解更多详情。

接下来是什么?

这个初始版本侧重于理解你的观点,而不试图改变它们。未来的苏格拉底式模式可以质疑假设、提供来源可靠的反例,并帮助你强化推理。

我们的目标是提供人人都能使用的、更有助于清晰思考的工具。无论你处于地图上的哪个位置,我都很想知道哪些地方让你觉得有用、哪些地方似乎有误,以及还缺少什么。在 GitHub 上分享反馈。

来源

  1. 1.
  2. 2.
  3. 3.
  4. 4.
    What Jev judges and what code decides

    Doom or Bloom on GitHub · 2026

  5. 5.
  6. 6.
    How the map is placed and what its ranges mean

    Doom or Bloom on GitHub · 2026

  7. 7.
  8. 8.
  9. 9.
  10. 10.
    How simulated thought leaders are made

    Doom or Bloom on GitHub · 2026

  1. 11.
  2. 12.
    Engine design review, September 29, 2026

    Doom or Bloom research notes · 2026

  3. 13.
  4. 14.
    Evaluation protocol and its tolerances

    Doom or Bloom on GitHub · 2026

  5. 15.
  6. 16.
    Responsible AI Integration in Survey Research

    AAPOR Task Force on Responsible AI Integration in Survey Research · 2026

  7. 17.
    Why the map showed five columns, October 3, 2026

    Doom or Bloom research notes · 2026

  8. 18.
    Interview and modeling audit, September 27, 2026

    Doom or Bloom research notes · 2026

你的立场在哪里?
回答几个简单问题,探索你自己的AI世界观。
描绘你自己的世界观