AIの未来について、より明確に対話する

AIに何を期待し、なぜそう期待し、何があれば考えが変わるでしょうか?

Doom or Bloomでは、いくつかの自由回答形式の質問を通して、AIに関するさまざまな見解を検討し、自分の考えをマッピングできます。専門知識もアカウントも必要ありません。すべて無料で、オープンソースです。

なぜこれを作ったのでしょうか?

AIがもたらし得る恩恵とリスクについては、慎重かつ根拠に基づいて議論する必要があります。能力が進歩し、意思決定がより重大な結果を伴うようになるにつれ、大きく異なる見解を横断して明確に考えるための、利用しやすい方法が必要になります。

この分野のさまざまな意見を探り、人々が相反する直感を整理できるようにするため、これを作りました。すでに私自身の見解も明確になりました。目標は、編集上の誘導をできるだけ抑えながら、あなたの見解を忠実に表すことです。

方法論

結果を形作るすべての要素はオープンソースです。番号付きの注記から、該当するファイルや研究に直接アクセスできます。

インタビューの仕組み

  1. 最初の質問全員に同じ質問
  2. マップに関する質問全体的な影響、変化の規模、P(doom)について、それぞれ最大1回質問
  3. フォローアップ質問まだ不明な点について作成された質問、合計で最大12問
  4. あなたの結果マップ上の位置を決められた時点で表示され、その後も回答を続けられます

回答するたびに

Jevによる判断

  • 回答を使用できるか
  • 作成済みのどの記述が回答に当てはまるか
  • 各候補質問によってどの程度明確になるか

コードによる決定

  • 次にどの質問をするか
  • いつ結果を表示できるか
  • マップ上の位置、範囲、P(doom)

コードが、あらかじめ作成された質問の固定リストから各フォローアップ質問⁠[1]を選び⁠[2]、ほとんどの人は4~8問に答えた後に結果を確認できます。TypeSafeのJevは、作成済みの評価基準⁠[3]に照らして、小さく焦点を絞った判断を行うことで回答を読み取り、質問やあなたに対する判定を生成することはありません。⁠[4]コードはそれらの判断を組み合わせ、あなたのマップ、その範囲、P(doom)を算出します。⁠[5]小さな判断をまとめて処理することで、無料で提供できるほど低コストに抑えています。

結果が示すものと、示さないもの

マップ
これは、あなたが書いた内容についての私たちの解釈であり、判定やテスト、予測ではありません。破線の枠は、あなたが正しい確率ではなく、ほかにも妥当な解釈があることを示しています。⁠[6]
マップの背景
更新する意思など、世界観の8つの次元と推論の7つの特性を示します。根拠がない項目は未配置のままで、低いスコアとして扱われることはありません。⁠[5]
P(doom)
あなたが入力した数値、または回答から推定された数値のいずれかであり、どちらなのかが示されています。⁠[7]
編集上の選択
回答の事実確認は行われません。質問、評価基準、さらには名称にも編集上の選択が含まれており、名称によってリスクと恩恵を意識する方向へ誘導される可能性があります。複合的な見解、不確実性、整合性のある極端な見解は、いずれも妥当です。⁠[8]
オピニオンリーダー
シミュレーションです。別のモデル(GPT-5.6 Sol)が、各人物についてリンクされた公開情報源に基づいて同じ質問に回答し⁠[9]、当サイトのエンジンは、それが誰の回答かを知らずに回答を読み取ります。⁠[10]これらは本人による回答でも、本人の支持を示すものでもありません。プロトタイプとして扱ってください。2026年のPewによるテストでは、AIによる代理回答と実在する本人の回答との間に、平均で12パーセントポイントの差がありました。⁠[11]

これまでのエビデンス

見通しの解釈がどの程度離れた位置になるか

同じ回答に対する2つの解釈

Jevが同じ回答を2回読み取った場合
0.007
意味を保ったまま言い換えた後にJevが読み取った場合
0.019
JevとGPT-5.6 Solの比較
0.060

本人による自己配置に照らした読み取り

Jev
0.141
GPT-5.6 Sol
0.135
全員に同じ予想
0.233

0–1のDoom–Bloom軸上の平均距離。バーは0.3までで、短いほど近いことを示します。219件の自己配置と60件の言い換え版インタビューに基づきます(2026年9月29日)⁠[12]

あなた自身の配置
読み取り結果は、全員に同じ予想を当てはめる場合よりも、本人による自己配置に近く、平均すると期待にも懸念にも偏っていません。⁠[13] 読み取りを行うAI同士は、人との間よりもはるかに一致しているため、差の大半は、人がどう書くかと自分をどう捉えるかの間にあります。両者がいずれかの軸で4分の1を超えて異なる場合は、結果の中でその点について質問します。
再読み取りと言い換え
同じ意味の回答について、読み直した場合も、表現を変えたインタビューの場合も、見通しが上限の0.10を超えて動くことはありませんでした。⁠[14] マップの範囲は、シミュレーションされた人物がインタビューを再度受けた際に見られた変動幅である±0.05より狭く描かれることはありません。
より大きなモデル
Jevは、約1/21のコストで、ノイズの範囲内でGPT-5.6 Solと一致します。⁠[12]
「これは適切だと感じますか?」
80人中68人が「はい」と回答しました(85%)。⁠[13] これは上限として解釈してください。人はAIによる自分自身の読み取りに同意する傾向があります。NORCの研究では、独立したコーダーがAIによる分類を支持した割合は、回答者自身が支持した割合より約20%低いものでした。⁠[15]
推論されたP(doom)
大まかな推定です。人々が入力した113個の数値を伏せた状態で照合したところ、そのうち96個を読み取りましたが、オッズで2×以内に収まったのは全体の22%にすぎず、全員について12.5%と推測する場合と比べて良くありませんでした。ただし、人々の順位付けは妥当であり、「20%」のように入力した割合が常に優先されます。⁠[12]
まだ完了していないこと
評価計画で必要としている、独立した評価者がラベル付けしたブラインドテストセットはまだありません。⁠[14] それまでは、ここでの各検証は、読み取り結果を自己配置、再実行結果、または他のモデルと比較するものです。インタビューの言語間での結果も、まだ比較されていません。

回答した人々

2026年10月3日時点で、963人が結果に到達していました。⁠[13]参加者は自らこれを受けることを選び、その大半はHacker Newsのスレッド(09/25~09/26)とXへの投稿(09/27~09/28)を通じて参加しました。この2つの流入の波は大きく異なる位置となり、0–1のDoom–Bloom軸上の見通しの中央値は、Hacker Newsでは0.32、Xでは0.68でした(比較を見る)。したがって、私たちの数値が表すのは参加した人々であり、一般の人々ではありません。また、数値を公表するのは、少なくとも10人で構成されるグループについてのみです。

質問をあらかじめ作成している理由

AIにインタビューを即興で行わせることもできます。固定された、あらかじめ作成済みの質問なら、文言を中立かつ同一に保てるため、すべての参加者とシミュレーションされたすべてのオピニオンリーダーが同じ質問に答え、その比較に意味が生まれます。AAPORの2026年のガイダンスでは、質問を生成したり、その文言を変えたり、進行に影響を与えたりするAIインタビュアーを高リスクと評価しています。⁠[16]ここでは文言は一切変わらず、Jevは、質問の中から選ぶためにコードが使用する判断を通じてのみ、進行を調整します。

バージョンと変更

アルゴリズム
0.7.5
質問
0.4.0-draft
評価基準
0.1.0-draft
モデル
jev-1.13.0

保存された各結果には、その作成に使用されたバージョンが保持されます。新たな判断を必要としない修正は、過去の結果を表示する際にも反映されます。

  1. · 0.7.5人々をマップの5段階上だけでなく、その間にも配置し、保存された結果を再解釈します⁠[17]
  2. · 0.7.410言語でのインタビューに対応し、Jevは回答を記述されたとおりに読み取り、インタビューの言語も伝えられます
  3. · 0.7.2–0.7.3「30%」のように短く入力されたP(doom)の回答を保持します。以前は推定値に置き換えられていました。また、解釈が分かれる場合や、あなた自身が配置した位置から大きく離れている場合には、もう1つ質問します⁠[12]
  4. · 0.7.0–0.7.1P(doom)の表示方法を修正し(入力された20%が約3%と表示されていました)、変化の規模とP(doom)について直接質問し、推論の網羅性を確保するために結果の表示を保留することをやめ、保存された結果を再解釈します⁠[18]

GitHubの調査ノートには、各変更とその根拠が記録されています。

Elon Muskを用いた例

Elon Muskのシミュレーション評価から得られたJSON結果の例をいくつか示します。

評価への入力

Depth 1+ folded · dotted keys have hover help

}

1回のシミュレーション評価のためにJevへ提供された回答とコンテキストです。

生成された結果

Depth 1+ folded · dotted keys have hover help

"evidenceRevision": 5,
"sources": [],
true,
"capped": false,
"insufficient": false,
"reason": "Your answers place your outlook and the scale of change you expect, which is what the map needs. More answers can sharpen it."
}

アプリが結果を推定するために使用する判断の組み合わせです。

あなたの回答はあなたのものです

あなたの回答と結果は、デフォルトでは非公開です。共有したい場合は、公開を選択できます。登録は必要ありません。詳しくは、プライバシーポリシーをご覧ください。

次は?

この最初のバージョンでは、あなたの見解を変えようとせずに理解することに重点を置いています。将来のソクラテス式モードでは、前提を問い直し、十分な情報源に裏付けられた反例を提示し、推論を強化する手助けができるかもしれません。

目標は、誰もが使える、明確に考えるためのより良いツールを作ることです。マップ上のどこに位置するにせよ、何が役立つと感じるか、何が間違っているように思えるか、何が欠けているかをぜひお聞かせください。GitHubでフィードバックを共有する。

出典

  1. 1.
  2. 2.
  3. 3.
  4. 4.
    What Jev judges and what code decides

    Doom or Bloom on GitHub · 2026

  5. 5.
  6. 6.
    How the map is placed and what its ranges mean

    Doom or Bloom on GitHub · 2026

  7. 7.
  8. 8.
  9. 9.
  10. 10.
    How simulated thought leaders are made

    Doom or Bloom on GitHub · 2026

  1. 11.
  2. 12.
    Engine design review, September 29, 2026

    Doom or Bloom research notes · 2026

  3. 13.
  4. 14.
    Evaluation protocol and its tolerances

    Doom or Bloom on GitHub · 2026

  5. 15.
  6. 16.
    Responsible AI Integration in Survey Research

    AAPOR Task Force on Responsible AI Integration in Survey Research · 2026

  7. 17.
    Why the map showed five columns, October 3, 2026

    Doom or Bloom research notes · 2026

  8. 18.
    Interview and modeling audit, September 27, 2026

    Doom or Bloom research notes · 2026

あなたはどの位置でしょうか?
いくつかの簡単な質問に答えて、自分のAIに対する世界観を探ってみましょう。
自分の世界観をマッピングする