更清晰地讨论AI的未来
你对AI有何预期,为什么会有这样的预期,又有什么可能改变你的看法?
Doom or Bloom通过几个开放式问题,帮助你探索关于AI的各种观点,并梳理自己的想法。无需专业知识,也无需账户。完全免费且开源。
为什么要开发这个?
AI的潜在益处和风险值得谨慎、立足事实的讨论。随着能力提升、决策影响日益重大,我们需要易于使用的方式,在差异巨大的观点之间进行清晰思考。
我开发这个网站,是为了探索这一领域中的各种声音,并帮助人们理清相互冲突的直觉。它已经让我自己的观点更加清晰。目标是在尽可能少地进行编辑引导的情况下,如实呈现你的观点。
方法说明
影响你结果的一切均为开源。带编号的注释链接到具体文件和研究。
访谈如何进行
- 开场问题每个人都相同
- 地图问题总体影响、变革规模和 P(doom),每项最多询问一次
- 追问针对仍不明确之处的人工编写问题,总计最多 12 个
- 你的结果当你的地图可以定位时显示;你可以继续回答
每次回答后
Jev 判断
- 回答是否可用
- 哪项人工编写的描述与回答相符
- 每个候选问题能在多大程度上澄清情况
代码决定
- 接下来提出哪个问题
- 结果何时准备好
- 你的地图位置、范围和 P(doom)
代码从一份固定的人工编写问题列表中,为每次追问[1]选择问题,[2]大多数人在回答其中 4–8 个问题后就能看到结果。TypeSafe 的 Jev依据人工编写的评分标准[3],通过小而聚焦的判断来解读你的回答,绝不会编写问题或对你下定论。[4]代码将这些判断汇总成你的地图、相应范围和 P(doom)。[5]将小判断批量处理,使成本足够低,从而可以免费运行。
你的结果是什么,又不是什么
目前的证据
对相同回答的两次解读
相对于本人自我定位的解读
0–1 Doom–Bloom 轴上的平均距离;条形延伸至 0.3,越短表示越接近。数据来自 219 次自我定位和 60 次改写后的访谈,2026年9月29日[12]
- 你自己的定位
- 解读结果比对所有人采用同一个猜测更接近人们自己的定位,且平均而言不偏向希望或担忧。[13]不同解读者之间的一致程度远高于他们与受访者之间的一致程度,因此大部分差距源于人们的表述方式与自我认知之间的差异。如果两者在任一轴上的差异超过四分之一,你的结果会就此提问。
- 重新解读和改写措辞
- 对于含义相同的回答,无论重新解读还是改写访谈,展望的变化都未超过我们设定的 0.10 上限。[14] 地图范围绝不会绘制得窄于 ±0.05,这是模拟人物重新参加访谈时观察到的变化幅度。
- 更大的模型
- Jev 与 GPT-5.6 Sol 的结果差异在噪声范围内,而成本约为后者的 1/21。[12]
- “这感觉准确吗?”
- 80 人中有 68 人回答是(85%)。[13]应将其视为上限:人们往往会认同 AI 对自己的解读。在一项 NORC 研究中,独立编码者认可 AI 编码的频率比受访者低约 20%。[15]
- 推断的 P(doom)
- 粗略估计。在隐藏人们输入的 113 个数值后,用这些数值检验时,它解读了其中的 96 个,但按赔率计算,结果在 2× 范围内的情况仅占 22%,并不比对所有人都猜测 12.5% 更准确。它确实能合理地对人们进行排序,而你输入的百分比(例如“20%”)始终优先采用。[12]
- 尚未完成
- 我们还没有按照评估计划的要求,建立由独立评审者标注的盲测集。[14]在此之前,这里的每项检验都是将解读结果与自我定位、重新运行的结果或其他模型进行比较。不同访谈语言的结果也尚未进行比较。
哪些人参加过
截至 2026年10月3日,已有 963 人得出了结果。[13]他们选择参加评估,主要是通过 Hacker News 上的一个讨论帖(9/25 – 9/26)和 X 上的帖子(9/27 – 9/28),而这两批人的结果相差很大:在 0–1 Doom–Bloom 轴上,前者的展望中位数为 0.32,后者为 0.68(查看比较)。因此,我们的数据描述的是参与者,而不是公众;并且我们只公布人数至少为 10 的群体的数据。
为什么问题由人工编写
AI 可以即兴进行访谈。采用固定的人工编写问题,可以让措辞保持中立且完全一致,使每位参与者和每位模拟的意见领袖都回答相同的问题,从而使比较具有意义。AAPOR 的 2026 年指南将生成问题、改变问题措辞或影响访谈流程的 AI 访谈员评为高风险。[16]在这里,措辞从不改变,而 Jev 仅通过判断来影响流程,代码会根据这些判断从问题中进行选择。
版本和变更
- 算法
- 0.7.5
- 问题
- 0.4.0-draft
- 评分标准
- 0.1.0-draft
- 模型
- jev-1.13.0
每个已保存的结果都会保留生成该结果时所用的版本。无需重新判断的修正也会在显示较早的结果时应用于这些结果。
- · 0.7.5将人们定位在地图的五个级别之间,而不再只定位在这些级别上,并重新解读已保存的结果[17]
- · 0.7.4支持使用 10 种语言进行访谈;Jev 按回答的原文进行解读,并会获知访谈所用的语言
- · 0.7.2–0.7.3保留像“30%”这样简短的手动输入 P(doom) 回答(此前会被推断值取代),并在解读结果存在分歧或与你自己的定位相差很大时多问一个问题[12]
- · 0.7.0–0.7.1修正 P(doom) 的显示方式(手动输入的 20% 曾显示为大约 3%),直接询问变革规模和 P(doom),不再因推理覆盖度不足而暂不提供结果,并重新解读已保存的结果[18]
GitHub 上的研究笔记记录了每项变更及其依据。
以Elon Musk为例
以下是Elon Musk的模拟评估所生成的一些JSON结果示例。
评估输入
Depth 1+ folded · dotted keys have hover help
为单次模拟评估提供给Jev的回答和背景信息。
生成的结果
Depth 1+ folded · dotted keys have hover help
我们的应用用于推断结果的一组综合判断。
你的回答仍归你所有
你的回答和结果默认保密。如果你想分享,可以选择将其公开。无需注册。请阅读隐私政策了解更多详情。
接下来是什么?
这个初始版本侧重于理解你的观点,而不试图改变它们。未来的苏格拉底式模式可以质疑假设、提供来源可靠的反例,并帮助你强化推理。
我们的目标是提供人人都能使用的、更有助于清晰思考的工具。无论你处于地图上的哪个位置,我都很想知道哪些地方让你觉得有用、哪些地方似乎有误,以及还缺少什么。在 GitHub 上分享反馈。
来源
- 1.
How the next question is chosen (lib/assessment/routing.ts)Doom or Bloom on GitHub · 2026
- 2.
The authored questions, content release 0.4.0-draftDoom or Bloom on GitHub · 2026
- 3.
The rubric Jev judges answers against, version 0.1.0-draftDoom or Bloom on GitHub · 2026
- 4.
What Jev judges and what code decidesDoom or Bloom on GitHub · 2026
- 5.
Where each part of a result comes from, with links to its codeDoom or Bloom on GitHub · 2026
- 6.
How the map is placed and what its ranges meanDoom or Bloom on GitHub · 2026
- 7.
How P(doom) is read: a typed number, or an estimate from your answersDoom or Bloom on GitHub · 2026
- 8.
Procedural neutrality and the framing choices we acceptDoom or Bloom on GitHub · 2026
- 9.
Example source briefs for simulated thought leaders, including Elon MuskDoom or Bloom on GitHub · 2026
- 10.
How simulated thought leaders are madeDoom or Bloom on GitHub · 2026
- 11.
Can AI Stand In for Human Survey-Takers? Not ReallyPew Research Center · 2026
- 12.
Engine design review, September 29, 2026Doom or Bloom research notes · 2026
- 13.
Participant aggregates as of 2026-10-03 (participants.json)Doom or Bloom on GitHub · 2026
- 14.
Evaluation protocol and its tolerancesDoom or Bloom on GitHub · 2026
- 15.
AI-Assisted Conversational Interviewing: Effects on Data Quality and Respondent ExperienceBarari et al., NORC at the University of Chicago · 2025
- 16.
Responsible AI Integration in Survey ResearchAAPOR Task Force on Responsible AI Integration in Survey Research · 2026
- 17.
Why the map showed five columns, October 3, 2026Doom or Bloom research notes · 2026
- 18.
Interview and modeling audit, September 27, 2026Doom or Bloom research notes · 2026