Ein klareres Gespräch über die Zukunft mit KI
Was erwartest du von KI, warum erwartest du es und was könnte deine Meinung ändern?
Doom or Bloom hilft dir, das Spektrum der Sichtweisen auf KI zu erkunden und deine eigenen Gedanken anhand einiger offener Fragen abzubilden. Kein Fachwissen und kein Konto erforderlich. Alles ist kostenlos und Open Source.
Warum wurde das entwickelt?
Die potenziellen Vorteile und Risiken von KI verdienen eine sorgfältige, fundierte Diskussion. Wenn die Fähigkeiten zunehmen und Entscheidungen folgenreicher werden, brauchen wir leicht zugängliche Möglichkeiten, um über sehr unterschiedliche Sichtweisen hinweg klar nachzudenken.
Ich habe dies entwickelt, um die Stimmen in diesem Feld zu erkunden und Menschen dabei zu helfen, widersprüchliche Intuitionen zu entwirren. Es hat meine eigenen Ansichten bereits geschärft. Ziel ist es, deine Ansichten so getreu wie möglich und mit so wenig redaktioneller Lenkung wie möglich wiederzugeben.
Methodik
Alles, was dein Ergebnis beeinflusst, ist Open Source. Die nummerierten Anmerkungen verlinken die genauen Dateien und Studien.
So funktioniert das Interview
- EinstiegsfrageFür alle gleich
- Fragen zur KarteInsgesamt erwartete Auswirkungen, Ausmaß der Transformation und P(doom), jeweils höchstens einmal abgefragt
- FolgefragenRedaktionell erstellte Fragen zu noch ungeklärten Punkten, insgesamt bis zu 12
- Dein ErgebnisSobald deine Position auf der Karte bestimmt werden kann; du kannst weiter antworten
Nach jeder Antwort
Jev bewertet
- Ob sie verwertbar ist
- Welche redaktionell erstellte Beschreibung dazu passt
- Wie stark jede mögliche Frage zur Klärung beitragen würde
Der Code entscheidet
- Welche Frage als Nächstes kommt
- Wann die Ergebnisse bereit sind
- Deine Position auf der Karte, die Bereiche und P(doom)
Der Code wählt jede Folgefrage[1] aus einer festen Liste redaktionell erstellter Fragen aus,[2] und die meisten Menschen sehen nach 4–8 davon Ergebnisse. Jev von TypeSafe liest deine Antworten anhand kleiner, gezielter Bewertungen nach einem redaktionell erstellten Kriterienkatalog[3] und verfasst weder Fragen noch ein Urteil über dich.[4] Der Code kombiniert diese Bewertungen zu deiner Karte, ihren Bereichen und P(doom).[5] Die gebündelte Verarbeitung kleiner Bewertungen hält die Kosten niedrig genug, um das kostenlos anzubieten.
Was dein Ergebnis ist – und was nicht
- Die Karte
- Unsere Interpretation dessen, was du geschrieben hast – kein Urteil, kein Test und keine Prognose. Das gestrichelte Feld zeigt andere plausible Interpretationen, nicht die Wahrscheinlichkeit, dass du richtigliegst.[6]
- Hinter der Karte
- Acht Dimensionen der Weltsicht und sieben Qualitäten der Argumentation, etwa die Bereitschaft zur Aktualisierung. Fehlende Belege bleiben nicht eingeordnet; sie zählen niemals als niedrige Bewertung.[5]
- P(doom)
- Entweder die von dir eingegebene Zahl oder eine aus deinen Antworten abgeleitete Schätzung; es wird angegeben, um welche es sich handelt.[7]
- Redaktionelle Entscheidungen
- Die Antworten werden nicht auf Fakten geprüft. Die Fragen, das Bewertungsschema und sogar der Name beruhen auf redaktionellen Entscheidungen, und der Name kann dich gedanklich auf Risiken und Vorteile ausrichten. Gemischte Sichtweisen, Unsicherheit und in sich schlüssige Extrempositionen sind gleichermaßen gültig.[8]
- Meinungsführer
- Simulationen: Ein anderes Modell (GPT-5.6 Sol) beantwortet dieselben Fragen anhand der verlinkten öffentlichen Quellen jeder Person,[9] und unsere Engine liest diese Antworten, ohne zu wissen, von wem sie stammen.[10] Es sind weder die eigenen Antworten der Personen noch deren Zustimmung. Betrachte sie als Prototypen: In einem Test von Pew aus dem Jahr 2026 wichen die Antworten von KI-Stellvertretern im Durchschnitt um 12 Prozentpunkte von denen echter Menschen ab.[11]
Bisherige Evidenz
Zwei Einordnungen derselben Antworten
Eine Auswertung im Vergleich zur eigenen Einordnung der Person
Mittlere Distanz auf der 0–1-Doom–Bloom-Achse; die Balken reichen bis 0,3, und kürzer bedeutet näher. Basierend auf 219 Selbsteinordnungen und 60 umformulierten Interviews, 29. September 2026[12]
- Deine eigene Einordnung
- Die Auswertungen liegen näher an den eigenen Einordnungen der Personen als eine einzige Einschätzung für alle, ohne im Durchschnitt zu Hoffnung oder Sorge zu tendieren.[13] Die Auswerter stimmen untereinander deutlich stärker überein als mit den Personen, daher liegt der größte Teil der Abweichung zwischen der Art, wie Menschen schreiben, und der Art, wie sie sich selbst sehen. Wenn sich beides auf einer der Achsen um mehr als ein Viertel unterscheidet, wird in deinem Ergebnis danach gefragt.
- Erneutes Auswerten und Umformulieren
- Bei keinem erneuten Lesen und keiner umformulierten Version des Interviews verschob sich der Ausblick bei gleichbedeutenden Antworten um mehr als unseren Grenzwert von 0,10.[14] Kartenbereiche werden nie schmaler als ±0,05 dargestellt – das entspricht der Abweichung, die auftritt, wenn eine simulierte Person das Interview erneut durchläuft.
- Größere Modelle
- Jev stimmt innerhalb der statistischen Schwankungsbreite mit GPT-5.6 Sol überein, bei etwa 1/21 der Kosten.[12]
- „Fühlt sich das stimmig an?“
- 68 von 80 Personen sagten Ja (85 %).[13] Das ist als Obergrenze zu verstehen: Menschen neigen dazu, der Einschätzung einer KI über sie zuzustimmen. In einer NORC-Studie bestätigten unabhängige Codierende die Codierungen einer KI etwa 20% seltener als die Befragten selbst.[15]
- Abgeleitete P(doom)
- Grob. Beim Abgleich mit 113 von Personen eingegebenen Zahlen, wobei diese Zahlen verborgen waren, las es 96 davon aus und lag nur in 22 % der Fälle bei den Odds innerhalb des Faktors 2 – nicht besser, als für alle 12,5 % zu raten. Es ordnet Personen jedoch sinnvoll ein, und eine von dir eingegebene Prozentangabe wie „20 %“ hat immer Vorrang.[12]
- Noch ausstehend
- Wir haben noch keinen verblindeten Testsatz, der von unabhängigen Prüfenden gekennzeichnet wurde, obwohl unser Evaluierungsplan dies vorsieht.[14] Bis dahin vergleicht jede hier aufgeführte Prüfung die Auswertungen mit Selbsteinordnungen, erneuten Durchläufen oder anderen Modellen. Die Ergebnisse in verschiedenen Interviewsprachen wurden noch nicht verglichen.
Wer teilgenommen hat
Bis zum 3. Oktober 2026 hatten 963 Personen ein Ergebnis erreicht.[13] Sie entschieden sich für die Teilnahme, hauptsächlich über einen Hacker News-Thread (25.–26. September) und Beiträge auf X (27.–28. September), und die beiden Wellen lagen weit auseinander: ein Median der Einschätzungen von 0,32 gegenüber 0,68 auf der 0–1-Doom–Bloom-Achse (Vergleich ansehen). Unsere Zahlen beschreiben daher, wer teilgenommen hat, nicht die Öffentlichkeit, und wir veröffentlichen Zahlen nur für Gruppen von mindestens 10 Personen.
Warum die Fragen redaktionell erstellt sind
Eine KI könnte das Interview improvisieren. Festgelegte, redaktionell erstellte Fragen sorgen dafür, dass die Formulierungen neutral und identisch bleiben, sodass alle Teilnehmenden und alle simulierten Meinungsführer dieselben Fragen beantworten und ein Vergleich aussagekräftig ist. Die Leitlinien von AAPOR aus dem Jahr 2026 stufen KI-Interviewer, die Fragen generieren, deren Formulierung ändern oder den Ablauf beeinflussen, als hohes Risiko ein.[16] Hier ändern sich die Formulierungen nie, und Jev gestaltet den Ablauf ausschließlich durch Bewertungen, anhand derer der Code zwischen den Fragen auswählt.
Versionen und Änderungen
- Algorithmus
- 0.7.5
- Fragen
- 0.4.0-draft
- Bewertungsraster
- 0.1.0-draft
- Modell
- jev-1.13.0
Jedes gespeicherte Ergebnis enthält die Versionen, mit denen es erstellt wurde. Korrekturen, die keine neuen Beurteilungen erfordern, werden bei der Anzeige auch auf ältere Ergebnisse angewendet.
- · 0.7.5Ordnet Menschen zwischen den fünf Stufen der Karte ein statt nur direkt auf ihnen und wertet gespeicherte Ergebnisse erneut aus[17]
- · 0.7.4Interviews in 10 Sprachen; Jev liest Antworten so, wie sie geschrieben wurden, und erhält die Information, in welcher Sprache das Interview geführt wird
- · 0.7.2–0.7.3Behält eingegebene P(doom)-Antworten bei, selbst wenn sie so kurz wie „30 %“ sind, statt sie durch abgeleitete Werte zu ersetzen, und stellt eine weitere Frage, wenn eine Auswertung uneindeutig ist oder stark von deiner eigenen Einordnung abweicht[12]
- · 0.7.0–0.7.1Korrigiert die Anzeige von P(doom) (eingegebene 20 % waren als etwa 3 % erschienen), fragt direkt nach dem Ausmaß der Veränderung und P(doom), hält Ergebnisse nicht mehr zurück, um alle Argumentationsbereiche abzudecken, und wertet gespeicherte Ergebnisse erneut aus[18]
Forschungsnotizen auf GitHub dokumentieren jede Änderung zusammen mit den zugehörigen Belegen.
Beispiel mit Elon Musk
Hier sind einige beispielhafte JSON-Ergebnisse aus der simulierten Einschätzung von Elon Musk.
Eingabe für die Einschätzung
Depth 1+ folded · dotted keys have hover help
Die Antworten und der Kontext, die Jev für eine einzelne simulierte Einschätzung bereitgestellt werden.
Generierte Ergebnisse
Depth 1+ folded · dotted keys have hover help
Die Kombination der Beurteilungen, aus denen unsere App ihre Ergebnisse ableitet.
Deine Antworten bleiben deine
Deine Antworten und Ergebnisse sind standardmäßig privat. Du kannst sie veröffentlichen, wenn du sie teilen möchtest. Eine Registrierung ist nicht erforderlich. Weitere Einzelheiten findest du in der Datenschutzerklärung.
Wie geht es weiter?
Diese erste Version konzentriert sich darauf, deine Sichtweisen zu verstehen, ohne zu versuchen, sie zu verändern. Ein zukünftiger sokratischer Modus könnte Annahmen hinterfragen, gut belegte Gegenbeispiele anbieten und dir helfen, deine Argumentation zu stärken.
Das Ziel sind bessere Werkzeuge für klares Denken, die alle nutzen können. Unabhängig davon, wo du auf der Karte stehst, würde ich gerne erfahren, was dir nützlich erscheint, was falsch wirkt und was fehlt. Gib Feedback auf GitHub.
Quellen
- 1.
How the next question is chosen (lib/assessment/routing.ts)Doom or Bloom on GitHub · 2026
- 2.
The authored questions, content release 0.4.0-draftDoom or Bloom on GitHub · 2026
- 3.
The rubric Jev judges answers against, version 0.1.0-draftDoom or Bloom on GitHub · 2026
- 4.
What Jev judges and what code decidesDoom or Bloom on GitHub · 2026
- 5.
Where each part of a result comes from, with links to its codeDoom or Bloom on GitHub · 2026
- 6.
How the map is placed and what its ranges meanDoom or Bloom on GitHub · 2026
- 7.
How P(doom) is read: a typed number, or an estimate from your answersDoom or Bloom on GitHub · 2026
- 8.
Procedural neutrality and the framing choices we acceptDoom or Bloom on GitHub · 2026
- 9.
Example source briefs for simulated thought leaders, including Elon MuskDoom or Bloom on GitHub · 2026
- 10.
How simulated thought leaders are madeDoom or Bloom on GitHub · 2026
- 11.
Can AI Stand In for Human Survey-Takers? Not ReallyPew Research Center · 2026
- 12.
Engine design review, September 29, 2026Doom or Bloom research notes · 2026
- 13.
Participant aggregates as of 2026-10-03 (participants.json)Doom or Bloom on GitHub · 2026
- 14.
Evaluation protocol and its tolerancesDoom or Bloom on GitHub · 2026
- 15.
AI-Assisted Conversational Interviewing: Effects on Data Quality and Respondent ExperienceBarari et al., NORC at the University of Chicago · 2025
- 16.
Responsible AI Integration in Survey ResearchAAPOR Task Force on Responsible AI Integration in Survey Research · 2026
- 17.
Why the map showed five columns, October 3, 2026Doom or Bloom research notes · 2026
- 18.
Interview and modeling audit, September 27, 2026Doom or Bloom research notes · 2026