Question 1
Theia Vogel
x.com/voooooogelAI researcher who runs experiments on language model introspection and personas and maintains an open-source library for steering models.
Comment l’IA changera-t-elle le monde ?
Horizontalement : leur perspective Doom–Bloom telle qu’elle a été exprimée. Verticalement : ampleur de la transformation.
Doom–Bloom : 50 sur 100. Ampleur de la transformation : 49 sur 100. Plages d’interprétation : de 45 à 55 horizontalement, de 0 à 100 verticalement. Il s’agit de coordonnées d’interprétation, et non de probabilités d’événements.
≈11%
Déduit de leurs réponses simulées, et non d’un chiffre donné par ces personnes. Plage plausible : 3–34%.
Une hypothèse centrale
It still needs compute, money, access, and some comparative advantage against organizations operating inference at hyperscale.Réponse 1
Si cette hypothèse s’avérait différente, comment leur perspective changerait-elle ?
Une question non résolue
Whether such attacks transfer to prompt-only settings remains an empirical question, not a result we can casually assume.Réponse 1
Qu’est-ce qui les aiderait à distinguer les résultats plausibles ici ?
Plus de détails
Des dommages graves ou généralisés constituent une composante substantielle de l’avenir attendu.
53 / 100
Plage d’interprétation de 33 à 67 sur l’échelle qualitative.
Les choix humains ont une influence significative, mais fortement contrainte.
53 / 100
Plage d’interprétation de 46 à 79 sur l’échelle qualitative.
Ces interprétations conservent les conditions énoncées. Les bénéfices et les dommages peuvent tous deux être substantiels. Les plages décrivent notre lecture de leurs réponses simulées, et non des intervalles de confiance statistiques.
Visions du monde similaires
Leaders d’opinion dont les visions du monde simulées sont les plus proches de celle de Theia Vogel
Évaluation simulée
Sources
Articles, entretiens et écrits utilisés pour ancrer cet utilisateur simulé dans les faits.
Experiments test whether an open 32B model can detect interventions to internal state, finding prompt-sensitive success and limits to simple logit-lens explanations.

Author-hosted tweets document creative world simulation, steering work and a deliberately satirical statement of AI stance.

Identifies LLM persona research, open steering tools and prior DNA-synthesis screening work.

Demonstrates activation steering, contrasts it with prompting, and discusses jailbreaking, entangled self-awareness vectors and unresolved interpretation of what vectors change.

Où vous situez-vous ?
Cartographier ma vision du monde