AIの未来について、より明確に対話する
AIに何を期待し、なぜそう期待し、何があれば考えが変わるでしょうか?
Doom or Bloomでは、いくつかの自由回答形式の質問を通して、AIに関するさまざまな見解を検討し、自分の考えをマッピングできます。専門知識もアカウントも必要ありません。すべて無料で、オープンソースです。
なぜこれを作ったのでしょうか?
AIがもたらし得る恩恵とリスクについては、慎重かつ根拠に基づいて議論する必要があります。能力が進歩し、意思決定がより重大な結果を伴うようになるにつれ、大きく異なる見解を横断して明確に考えるための、利用しやすい方法が必要になります。
この分野のさまざまな意見を探り、人々が相反する直感を整理できるようにするため、これを作りました。すでに私自身の見解も明確になりました。目標は、編集上の誘導をできるだけ抑えながら、あなたの見解を忠実に表すことです。
方法論
結果を形作るすべての要素はオープンソースです。番号付きの注記から、該当するファイルや研究に直接アクセスできます。
インタビューの仕組み
- 最初の質問全員に同じ質問
- マップに関する質問全体的な影響、変化の規模、P(doom)について、それぞれ最大1回質問
- フォローアップ質問まだ不明な点について作成された質問、合計で最大12問
- あなたの結果マップ上の位置を決められた時点で表示され、その後も回答を続けられます
回答するたびに
Jevによる判断
- 回答を使用できるか
- 作成済みのどの記述が回答に当てはまるか
- 各候補質問によってどの程度明確になるか
コードによる決定
- 次にどの質問をするか
- いつ結果を表示できるか
- マップ上の位置、範囲、P(doom)
コードが、あらかじめ作成された質問の固定リストから各フォローアップ質問[1]を選び[2]、ほとんどの人は4~8問に答えた後に結果を確認できます。TypeSafeのJevは、作成済みの評価基準[3]に照らして、小さく焦点を絞った判断を行うことで回答を読み取り、質問やあなたに対する判定を生成することはありません。[4]コードはそれらの判断を組み合わせ、あなたのマップ、その範囲、P(doom)を算出します。[5]小さな判断をまとめて処理することで、無料で提供できるほど低コストに抑えています。
結果が示すものと、示さないもの
- マップ
- これは、あなたが書いた内容についての私たちの解釈であり、判定やテスト、予測ではありません。破線の枠は、あなたが正しい確率ではなく、ほかにも妥当な解釈があることを示しています。[6]
- マップの背景
- 更新する意思など、世界観の8つの次元と推論の7つの特性を示します。根拠がない項目は未配置のままで、低いスコアとして扱われることはありません。[5]
- P(doom)
- あなたが入力した数値、または回答から推定された数値のいずれかであり、どちらなのかが示されています。[7]
- 編集上の選択
- 回答の事実確認は行われません。質問、評価基準、さらには名称にも編集上の選択が含まれており、名称によってリスクと恩恵を意識する方向へ誘導される可能性があります。複合的な見解、不確実性、整合性のある極端な見解は、いずれも妥当です。[8]
これまでのエビデンス
同じ回答に対する2つの解釈
本人による自己配置に照らした読み取り
0–1のDoom–Bloom軸上の平均距離。バーは0.3までで、短いほど近いことを示します。219件の自己配置と60件の言い換え版インタビューに基づきます(2026年9月29日)[12]
- あなた自身の配置
- 読み取り結果は、全員に同じ予想を当てはめる場合よりも、本人による自己配置に近く、平均すると期待にも懸念にも偏っていません。[13] 読み取りを行うAI同士は、人との間よりもはるかに一致しているため、差の大半は、人がどう書くかと自分をどう捉えるかの間にあります。両者がいずれかの軸で4分の1を超えて異なる場合は、結果の中でその点について質問します。
- 再読み取りと言い換え
- 同じ意味の回答について、読み直した場合も、表現を変えたインタビューの場合も、見通しが上限の0.10を超えて動くことはありませんでした。[14] マップの範囲は、シミュレーションされた人物がインタビューを再度受けた際に見られた変動幅である±0.05より狭く描かれることはありません。
- より大きなモデル
- Jevは、約1/21のコストで、ノイズの範囲内でGPT-5.6 Solと一致します。[12]
- 「これは適切だと感じますか?」
- 80人中68人が「はい」と回答しました(85%)。[13] これは上限として解釈してください。人はAIによる自分自身の読み取りに同意する傾向があります。NORCの研究では、独立したコーダーがAIによる分類を支持した割合は、回答者自身が支持した割合より約20%低いものでした。[15]
- 推論されたP(doom)
- 大まかな推定です。人々が入力した113個の数値を伏せた状態で照合したところ、そのうち96個を読み取りましたが、オッズで2×以内に収まったのは全体の22%にすぎず、全員について12.5%と推測する場合と比べて良くありませんでした。ただし、人々の順位付けは妥当であり、「20%」のように入力した割合が常に優先されます。[12]
- まだ完了していないこと
- 評価計画で必要としている、独立した評価者がラベル付けしたブラインドテストセットはまだありません。[14] それまでは、ここでの各検証は、読み取り結果を自己配置、再実行結果、または他のモデルと比較するものです。インタビューの言語間での結果も、まだ比較されていません。
回答した人々
2026年10月3日時点で、963人が結果に到達していました。[13]参加者は自らこれを受けることを選び、その大半はHacker Newsのスレッド(09/25~09/26)とXへの投稿(09/27~09/28)を通じて参加しました。この2つの流入の波は大きく異なる位置となり、0–1のDoom–Bloom軸上の見通しの中央値は、Hacker Newsでは0.32、Xでは0.68でした(比較を見る)。したがって、私たちの数値が表すのは参加した人々であり、一般の人々ではありません。また、数値を公表するのは、少なくとも10人で構成されるグループについてのみです。
質問をあらかじめ作成している理由
AIにインタビューを即興で行わせることもできます。固定された、あらかじめ作成済みの質問なら、文言を中立かつ同一に保てるため、すべての参加者とシミュレーションされたすべてのオピニオンリーダーが同じ質問に答え、その比較に意味が生まれます。AAPORの2026年のガイダンスでは、質問を生成したり、その文言を変えたり、進行に影響を与えたりするAIインタビュアーを高リスクと評価しています。[16]ここでは文言は一切変わらず、Jevは、質問の中から選ぶためにコードが使用する判断を通じてのみ、進行を調整します。
バージョンと変更
- アルゴリズム
- 0.7.5
- 質問
- 0.4.0-draft
- 評価基準
- 0.1.0-draft
- モデル
- jev-1.13.0
保存された各結果には、その作成に使用されたバージョンが保持されます。新たな判断を必要としない修正は、過去の結果を表示する際にも反映されます。
- · 0.7.5人々をマップの5段階上だけでなく、その間にも配置し、保存された結果を再解釈します[17]
- · 0.7.410言語でのインタビューに対応し、Jevは回答を記述されたとおりに読み取り、インタビューの言語も伝えられます
- · 0.7.2–0.7.3「30%」のように短く入力されたP(doom)の回答を保持します。以前は推定値に置き換えられていました。また、解釈が分かれる場合や、あなた自身が配置した位置から大きく離れている場合には、もう1つ質問します[12]
- · 0.7.0–0.7.1P(doom)の表示方法を修正し(入力された20%が約3%と表示されていました)、変化の規模とP(doom)について直接質問し、推論の網羅性を確保するために結果の表示を保留することをやめ、保存された結果を再解釈します[18]
GitHubの調査ノートには、各変更とその根拠が記録されています。
Elon Muskを用いた例
Elon Muskのシミュレーション評価から得られたJSON結果の例をいくつか示します。
評価への入力
Depth 1+ folded · dotted keys have hover help
1回のシミュレーション評価のためにJevへ提供された回答とコンテキストです。
生成された結果
Depth 1+ folded · dotted keys have hover help
アプリが結果を推定するために使用する判断の組み合わせです。
あなたの回答はあなたのものです
あなたの回答と結果は、デフォルトでは非公開です。共有したい場合は、公開を選択できます。登録は必要ありません。詳しくは、プライバシーポリシーをご覧ください。
次は?
この最初のバージョンでは、あなたの見解を変えようとせずに理解することに重点を置いています。将来のソクラテス式モードでは、前提を問い直し、十分な情報源に裏付けられた反例を提示し、推論を強化する手助けができるかもしれません。
目標は、誰もが使える、明確に考えるためのより良いツールを作ることです。マップ上のどこに位置するにせよ、何が役立つと感じるか、何が間違っているように思えるか、何が欠けているかをぜひお聞かせください。GitHubでフィードバックを共有する。
出典
- 1.
How the next question is chosen (lib/assessment/routing.ts)Doom or Bloom on GitHub · 2026
- 2.
The authored questions, content release 0.4.0-draftDoom or Bloom on GitHub · 2026
- 3.
The rubric Jev judges answers against, version 0.1.0-draftDoom or Bloom on GitHub · 2026
- 4.
What Jev judges and what code decidesDoom or Bloom on GitHub · 2026
- 5.
Where each part of a result comes from, with links to its codeDoom or Bloom on GitHub · 2026
- 6.
How the map is placed and what its ranges meanDoom or Bloom on GitHub · 2026
- 7.
How P(doom) is read: a typed number, or an estimate from your answersDoom or Bloom on GitHub · 2026
- 8.
Procedural neutrality and the framing choices we acceptDoom or Bloom on GitHub · 2026
- 9.
Example source briefs for simulated thought leaders, including Elon MuskDoom or Bloom on GitHub · 2026
- 10.
How simulated thought leaders are madeDoom or Bloom on GitHub · 2026
- 11.
Can AI Stand In for Human Survey-Takers? Not ReallyPew Research Center · 2026
- 12.
Engine design review, September 29, 2026Doom or Bloom research notes · 2026
- 13.
Participant aggregates as of 2026-10-03 (participants.json)Doom or Bloom on GitHub · 2026
- 14.
Evaluation protocol and its tolerancesDoom or Bloom on GitHub · 2026
- 15.
AI-Assisted Conversational Interviewing: Effects on Data Quality and Respondent ExperienceBarari et al., NORC at the University of Chicago · 2025
- 16.
Responsible AI Integration in Survey ResearchAAPOR Task Force on Responsible AI Integration in Survey Research · 2026
- 17.
Why the map showed five columns, October 3, 2026Doom or Bloom research notes · 2026
- 18.
Interview and modeling audit, September 27, 2026Doom or Bloom research notes · 2026