Una conversación más clara sobre los futuros de la IA
¿Qué esperas de la IA, por qué lo esperas y qué podría hacerte cambiar de opinión?
Doom or Bloom te ayuda a explorar la variedad de visiones sobre la IA y a mapear tus propias ideas mediante unas pocas preguntas abiertas. No necesitas conocimientos especializados ni una cuenta. Todo es gratis y de código abierto.
¿Por qué construir esto?
Las posibles ventajas y los riesgos de la IA merecen una conversación cuidadosa y fundamentada. A medida que avanzan las capacidades y las decisiones tienen más consecuencias, necesitamos formas accesibles de pensar con claridad entre visiones muy distintas.
Construí esto para explorar las voces del campo y ayudar a las personas a desenredar intuiciones contradictorias. Ya me ha ayudado a afinar mis propias ideas. El objetivo es representar las tuyas con fidelidad, con la menor intervención editorial posible.
Metodología
Todo lo que determina tu resultado es de código abierto. Las notas numeradas enlazan los archivos y estudios exactos.
Cómo funciona la entrevista
- Pregunta inicialLa misma para todos
- Preguntas del mapaImpacto general, escala del cambio y P(doom), cada uno preguntado como máximo una vez
- Preguntas de seguimientoPreguntas redactadas previamente sobre lo que aún no está claro, hasta 12 en total
- Tu resultadoEn cuanto se puede ubicar tu mapa; puedes seguir respondiendo
Después de cada respuesta
Jev evalúa
- Si se puede usar
- Qué descripción redactada previamente se ajusta a ella
- Cuánto aclararía cada pregunta candidata
El código decide
- Qué pregunta viene después
- Cuándo están listos los resultados
- Tu posición en el mapa, los rangos y P(doom)
El código elige cada pregunta de seguimiento[1] de una lista fija de preguntas redactadas previamente,[2] y la mayoría de las personas ve sus resultados después de responder entre 4 y 8. Jev de TypeSafe lee tus respuestas mediante evaluaciones pequeñas y específicas basadas en una rúbrica redactada previamente[3] y nunca escribe una pregunta ni un veredicto sobre ti.[4] El código combina esas evaluaciones para generar tu mapa, sus rangos y P(doom).[5] Agrupar evaluaciones pequeñas permite que su ejecución sea lo bastante económica como para ofrecerla gratis.
Qué es y qué no es tu resultado
- El mapa
- Nuestra interpretación de lo que escribiste, no un veredicto, una prueba ni un pronóstico. El recuadro discontinuo muestra otras interpretaciones plausibles, no la probabilidad de que tengas razón.[6]
- Detrás del mapa
- Ocho dimensiones de la visión de la IA y siete cualidades del razonamiento, como la disposición a actualizar. Si faltan pruebas, el elemento queda sin ubicar; nunca cuenta como una puntuación baja.[5]
- P(doom)
- Es el número que introdujiste o una estimación inferida de tus respuestas, y se indica cuál de los dos.[7]
- Decisiones editoriales
- Las respuestas no se verifican. Las preguntas, los criterios de evaluación e incluso el nombre implican decisiones editoriales, y el nombre puede predisponerte a pensar en el riesgo y el beneficio. Las posturas mixtas, la incertidumbre y los extremos coherentes son igualmente válidos.[8]
- Líderes de opinión
- Simulaciones: otro modelo (GPT-5.6 Sol) responde las mismas preguntas a partir de las fuentes públicas enlazadas de cada persona,[9] y nuestro motor lee esas respuestas sin saber de quién son.[10] No son respuestas ni respaldos de esas personas. Trátalas como prototipos: en una prueba de Pew de 2026, las respuestas de sustitutos de IA difirieron de las de personas reales en un promedio de 12 puntos porcentuales.[11]
Evidencia hasta ahora
Dos interpretaciones de las mismas respuestas
Una interpretación comparada con la propia ubicación de la persona
Distancia media en el eje Doom–Bloom de 0–1; las barras llegan hasta 0,3, y cuanto más cortas, más cercanas. A partir de 219 autoubicaciones y 60 entrevistas reformuladas, 29 de septiembre de 2026[12]
- Tu propia ubicación
- Las interpretaciones quedan más cerca de las propias ubicaciones de las personas que una misma estimación para todos, sin una inclinación promedio hacia la esperanza ni la inquietud.[13] Los evaluadores coinciden entre sí mucho más que con las personas, por lo que la mayor parte de la diferencia se debe a cómo escriben las personas y cómo se ven a sí mismas. Cuando ambas difieren en más de una cuarta parte de cualquiera de los ejes, tu resultado te pregunta al respecto.
- Nueva lectura y reformulación
- Ninguna repetición de la entrevista ni ninguna reformulación desplazó la perspectiva más allá de nuestro límite de 0,10 para respuestas que significan lo mismo.[14] Los rangos del mapa nunca se representan con una amplitud inferior a ±0,05, la variación observada cuando una persona simulada vuelve a realizar la entrevista.
- Modelos más grandes
- Jev coincide con GPT-5.6 Sol dentro del margen de variación, por aproximadamente 1/21 del costo.[12]
- «¿Te parece acertado?»
- 68 de 80 personas dijeron que sí (85 %).[13] Interprétalo como un límite superior: las personas tienden a estar de acuerdo con la interpretación que hace una IA de ellas. En un estudio de NORC, los codificadores independientes respaldaron las codificaciones de una IA aproximadamente un 20% menos de veces que los propios encuestados.[15]
- P(doom) inferida
- Aproximada. Al contrastarla con 113 cifras que las personas escribieron, manteniendo ocultas esas cifras, interpretó 96 de ellas y solo quedó dentro de un margen de 2× en términos de probabilidades relativas el 22 % de las veces, sin superar el resultado de estimar 12,5 % para todo el mundo. Sí ordena a las personas de manera razonable, y un porcentaje que escribas, como «20%», siempre tiene prioridad.[12]
- Aún no se ha hecho
- Aún no tenemos un conjunto de prueba ciego etiquetado por revisores independientes, como exige nuestro plan de evaluación.[14] Hasta entonces, todas las comprobaciones aquí comparan las interpretaciones con autoubicaciones, nuevas ejecuciones u otros modelos. Todavía no se han comparado los resultados entre los distintos idiomas de la entrevista.
Quiénes la han realizado
A fecha de 3 de octubre de 2026, 963 personas habían llegado a un resultado.[13] Decidieron participar, principalmente a través de un hilo de Hacker News (25–26 de septiembre) y publicaciones en X (27–28 de septiembre), y las dos oleadas quedaron muy separadas: una perspectiva mediana de 0,32 frente a 0,68 en el eje Doom–Bloom de 0–1 (ver la comparación). Por tanto, nuestras cifras describen a quienes participaron, no al público general, y solo publicamos cifras de grupos de al menos 10 personas.
Por qué las preguntas están redactadas de antemano
Una IA podría improvisar la entrevista. Las preguntas fijas y redactadas de antemano mantienen una formulación neutral e idéntica, de modo que cada participante y cada líder de opinión simulado responde las mismas preguntas y compararlos tiene sentido. Las directrices de 2026 de AAPOR califican como de alto riesgo a los entrevistadores de IA que generan preguntas, cambian su formulación o influyen en el desarrollo de la entrevista.[16] Aquí la formulación nunca cambia, y Jev solo moldea el desarrollo mediante valoraciones que el código utiliza para elegir entre las preguntas.
Versiones y cambios
- Algoritmo
- 0.7.5
- Preguntas
- 0.4.0-draft
- Rúbrica
- 0.1.0-draft
- Modelo
- jev-1.13.0
Cada resultado guardado conserva las versiones con las que se creó. Las correcciones que no requieren nuevos juicios también se aplican a los resultados anteriores cuando se muestran.
- · 0.7.5Ubica a las personas entre los cinco niveles del mapa en lugar de ubicarlas solo en ellos, y vuelve a interpretar los resultados guardados[17]
- · 0.7.4Entrevistas en 10 idiomas; Jev lee las respuestas tal como están escritas y se le indica el idioma de la entrevista
- · 0.7.2–0.7.3Conserva las respuestas escritas de P(doom), incluso si son tan breves como «30%», que antes se sustituían por valores inferidos, y hace una pregunta más cuando una interpretación está dividida o se aleja mucho de tu propia ubicación[12]
- · 0.7.0–0.7.1Corrige cómo se muestra P(doom) (un 20% escrito había aparecido como aproximadamente 3%), pregunta directamente por la escala del cambio y P(doom), deja de retener los resultados hasta cubrir el razonamiento y vuelve a interpretar los resultados guardados[18]
Las notas de investigación en GitHub registran cada cambio junto con la evidencia que lo sustenta.
Ejemplo con Elon Musk
Aquí tienes algunos resultados JSON de ejemplo de la evaluación simulada de Elon Musk.
Datos de entrada de la evaluación
Depth 1+ folded · dotted keys have hover help
Las respuestas y el contexto que se enviaron a Jev para una sola evaluación simulada.
Resultados generados
Depth 1+ folded · dotted keys have hover help
La combinación de juicios que nuestra aplicación usa para inferir sus resultados.
Tus respuestas son tuyas
Tus respuestas y resultados son privados de forma predeterminada. Puedes publicarlos si quieres compartirlos. No hace falta registrarse. Consulta la política de privacidad para más detalles.
¿Qué sigue?
Esta primera versión se centra en entender tus ideas sin intentar cambiarlas. Un futuro modo socrático podría cuestionar supuestos, ofrecer contraejemplos bien documentados y ayudarte a fortalecer tu razonamiento.
El objetivo son mejores herramientas para pensar con claridad que cualquiera pueda usar. Estés donde estés en el mapa, me encantaría saber qué te resulta útil, qué parece estar mal y qué falta. Comparte tus comentarios en GitHub.
Fuentes
- 1.
How the next question is chosen (lib/assessment/routing.ts)Doom or Bloom on GitHub · 2026
- 2.
The authored questions, content release 0.4.0-draftDoom or Bloom on GitHub · 2026
- 3.
The rubric Jev judges answers against, version 0.1.0-draftDoom or Bloom on GitHub · 2026
- 4.
What Jev judges and what code decidesDoom or Bloom on GitHub · 2026
- 5.
Where each part of a result comes from, with links to its codeDoom or Bloom on GitHub · 2026
- 6.
How the map is placed and what its ranges meanDoom or Bloom on GitHub · 2026
- 7.
How P(doom) is read: a typed number, or an estimate from your answersDoom or Bloom on GitHub · 2026
- 8.
Procedural neutrality and the framing choices we acceptDoom or Bloom on GitHub · 2026
- 9.
Example source briefs for simulated thought leaders, including Elon MuskDoom or Bloom on GitHub · 2026
- 10.
How simulated thought leaders are madeDoom or Bloom on GitHub · 2026
- 11.
Can AI Stand In for Human Survey-Takers? Not ReallyPew Research Center · 2026
- 12.
Engine design review, September 29, 2026Doom or Bloom research notes · 2026
- 13.
Participant aggregates as of 2026-10-03 (participants.json)Doom or Bloom on GitHub · 2026
- 14.
Evaluation protocol and its tolerancesDoom or Bloom on GitHub · 2026
- 15.
AI-Assisted Conversational Interviewing: Effects on Data Quality and Respondent ExperienceBarari et al., NORC at the University of Chicago · 2025
- 16.
Responsible AI Integration in Survey ResearchAAPOR Task Force on Responsible AI Integration in Survey Research · 2026
- 17.
Why the map showed five columns, October 3, 2026Doom or Bloom research notes · 2026
- 18.
Interview and modeling audit, September 27, 2026Doom or Bloom research notes · 2026