บทสนทนาที่ชัดเจนยิ่งขึ้นเกี่ยวกับอนาคตของ AI
คุณคาดหวังอะไรจาก AI เหตุใดจึงคาดหวังเช่นนั้น และอะไรอาจทำให้คุณเปลี่ยนใจ?
Doom or Bloom ช่วยให้คุณสำรวจมุมมองที่หลากหลายเกี่ยวกับ AI และทำแผนที่ความคิดของคุณเองผ่านคำถามปลายเปิดไม่กี่ข้อ ไม่จำเป็นต้องมีความรู้เฉพาะทางหรือบัญชี ใช้งานได้ฟรีทั้งหมดและเป็นโอเพนซอร์ส
ทำไมจึงสร้างสิ่งนี้?
ผลดีและความเสี่ยงที่อาจเกิดขึ้นจาก AI สมควรได้รับการอภิปรายอย่างรอบคอบและตั้งอยู่บนข้อเท็จจริง เมื่อความสามารถก้าวหน้าและการตัดสินใจส่งผลสืบเนื่องมากขึ้น เราจำเป็นต้องมีวิธีที่เข้าถึงได้ในการคิดอย่างชัดเจนท่ามกลางมุมมองที่แตกต่างกันอย่างมาก
ฉันสร้างสิ่งนี้ขึ้นเพื่อสำรวจเสียงต่าง ๆ ในวงการและช่วยให้ผู้คนคลี่คลายสัญชาตญาณที่ขัดแย้งกัน สิ่งนี้ช่วยทำให้มุมมองของฉันเองชัดเจนขึ้นแล้ว เป้าหมายคือถ่ายทอดมุมมองของคุณอย่างซื่อตรง โดยชี้นำเชิงบรรณาธิการให้น้อยที่สุดเท่าที่จะเป็นไปได้
ระเบียบวิธี
ทุกสิ่งที่กำหนดผลลัพธ์ของคุณเป็นโอเพนซอร์ส หมายเหตุที่มีหมายเลขเชื่อมโยงไปยังไฟล์และงานวิจัยที่ใช้โดยตรง
การสัมภาษณ์ทำงานอย่างไร
- คำถามเปิดเหมือนกันสำหรับทุกคน
- คำถามสำหรับแผนที่ผลกระทบโดยรวม ระดับการเปลี่ยนแปลง และ P(doom) โดยถามแต่ละเรื่องไม่เกินหนึ่งครั้ง
- คำถามติดตามคำถามที่เขียนไว้ล่วงหน้าเกี่ยวกับสิ่งที่ยังไม่ชัดเจน รวมทั้งหมดไม่เกิน 12 ข้อ
- ผลลัพธ์ของคุณเมื่อสามารถระบุตำแหน่งบนแผนที่ของคุณได้แล้ว โดยคุณยังตอบคำถามต่อได้
หลังคำตอบทุกข้อ
Jev ตัดสิน
- คำตอบใช้ได้หรือไม่
- คำอธิบายใดที่เขียนไว้ล่วงหน้าตรงกับคำตอบ
- คำถามที่เป็นตัวเลือกแต่ละข้อจะช่วยให้ชัดเจนขึ้นมากเพียงใด
โค้ดตัดสินใจ
- คำถามข้อใดจะเป็นข้อต่อไป
- ผลลัพธ์พร้อมเมื่อใด
- ตำแหน่งบนแผนที่ ช่วงค่าต่างๆ และ P(doom) ของคุณ
โค้ดเลือกคำถามติดตามแต่ละข้อ[1] จากรายการคำถามที่เขียนไว้ล่วงหน้าแบบตายตัว[2] และคนส่วนใหญ่จะเห็นผลลัพธ์หลังตอบคำถามเหล่านี้ 4–8 ข้อ Jev ของ TypeSafe อ่านคำตอบของคุณผ่านการตัดสินย่อยที่มุ่งเน้น โดยเทียบกับเกณฑ์ที่เขียนไว้ล่วงหน้า[3] และจะไม่เขียนคำถามหรือคำตัดสินเกี่ยวกับตัวคุณเลย[4] โค้ดจะรวมการตัดสินเหล่านั้นเป็นแผนที่ของคุณ ช่วงค่าต่างๆ และ P(doom)[5] การประมวลผลการตัดสินย่อยเป็นชุดทำให้มีต้นทุนต่ำพอที่จะให้บริการได้ฟรี
ผลลัพธ์ของคุณคืออะไร และไม่ใช่อะไร
- แผนที่
- การตีความของเราจากสิ่งที่คุณเขียน ไม่ใช่คำตัดสิน แบบทดสอบ หรือการพยากรณ์ กรอบเส้นประแสดงการตีความอื่นๆ ที่เป็นไปได้ ไม่ใช่โอกาสที่คุณจะตีความถูกต้อง[6]
- เบื้องหลังแผนที่
- โลกทัศน์ 8 มิติและคุณภาพของการให้เหตุผล 7 ด้าน เช่น ความเต็มใจที่จะปรับตามข้อมูลใหม่ หลักฐานที่ขาดไปจะยังไม่ถูกระบุตำแหน่ง และจะไม่นับเป็นคะแนนต่ำโดยเด็ดขาด[5]
- P(doom)
- เป็นตัวเลขที่คุณกรอกหรือค่าประมาณที่อนุมานจากคำตอบของคุณ โดยมีการระบุว่าเป็นแบบใด[7]
- การตัดสินใจเชิงบรรณาธิการ
- คำตอบไม่ได้ผ่านการตรวจสอบข้อเท็จจริง คำถาม เกณฑ์การประเมิน และแม้แต่ชื่อ ล้วนเกี่ยวข้องกับการตัดสินใจเชิงบรรณาธิการ และชื่ออาจชี้นำให้คุณนึกถึงความเสี่ยงและผลดี มุมมองแบบผสม ความไม่แน่นอน และมุมมองสุดขั้วที่สอดคล้องกัน ล้วนใช้ได้[8]
- ผู้นำทางความคิด
- การจำลอง: โมเดลอีกตัวหนึ่ง (GPT-5.6 Sol) ตอบคำถามเดียวกันโดยอ้างอิงแหล่งข้อมูลสาธารณะที่เชื่อมโยงไว้ของแต่ละบุคคล[9] และระบบของเราอ่านคำตอบเหล่านั้นโดยไม่รู้ว่าเป็นของใคร[10] คำตอบเหล่านี้ไม่ใช่คำตอบหรือการรับรองจากบุคคลเหล่านั้นเอง ให้ถือว่าเป็นต้นแบบ โดยในการทดสอบของ Pew ในปี 2026 คำตอบจาก AI ที่เป็นตัวแทนต่างจากคำตอบของคนจริงโดยเฉลี่ย 12 จุดเปอร์เซ็นต์[11]
หลักฐานที่มีจนถึงขณะนี้
การตีความคำตอบชุดเดียวกันสองครั้ง
การอ่านค่าเทียบกับตำแหน่งที่บุคคลนั้นระบุด้วยตนเอง
ระยะห่างเฉลี่ยบนแกน Doom–Bloom ช่วง 0–1 แถบยาวไปถึง 0.3 และยิ่งสั้นยิ่งใกล้ จากการระบุตำแหน่งตนเอง 219 ครั้งและการสัมภาษณ์ที่ปรับถ้อยคำใหม่ 60 ครั้ง ณ 29 กันยายน 2569[12]
- ตำแหน่งที่คุณระบุด้วยตนเอง
- ค่าที่อ่านได้อยู่ใกล้ตำแหน่งที่ผู้คนระบุด้วยตนเองมากกว่าการใช้การคาดเดาเดียวกันสำหรับทุกคน โดยไม่มีแนวโน้มเฉลี่ยเอนเอียงไปทางความหวังหรือความกังวล[13] ผู้ประเมินเห็นพ้องกันเองมากกว่าเห็นพ้องกับผู้คนอย่างมาก ดังนั้นช่องว่างส่วนใหญ่จึงอยู่ระหว่างวิธีที่ผู้คนเขียนกับวิธีที่พวกเขามองตนเอง หากทั้งสองต่างกันเกินหนึ่งในสี่ของแกนใดแกนหนึ่ง ผลลัพธ์ของคุณจะถามเกี่ยวกับความแตกต่างนั้น
- การอ่านซ้ำและการปรับถ้อยคำ
- การอ่านซ้ำหรือการปรับถ้อยคำในการสัมภาษณ์ไม่เคยทำให้มุมมองเปลี่ยนไปเกินขีดจำกัด 0.10 ของเรา สำหรับคำตอบที่มีความหมายเดียวกัน[14] ช่วงบนแผนที่จะไม่ถูกวาดให้แคบกว่า ±0.05 ซึ่งเป็นความแปรผันที่พบเมื่อบุคคลจำลองทำการสัมภาษณ์ซ้ำ
- โมเดลที่ใหญ่กว่า
- Jev ให้ผลตรงกับ GPT-5.6 Sol ภายในขอบเขตความคลาดเคลื่อน โดยมีค่าใช้จ่ายประมาณ 1/21[12]
- “สิ่งนี้ตรงกับที่คุณรู้สึกหรือไม่?”
- ผู้คน 68 จาก 80 คนตอบว่าใช่ (85%)[13] ให้ตีความค่านี้เป็นเพดาน เพราะผู้คนมีแนวโน้มเห็นด้วยกับการอ่านตัวตนของตนโดย AI ในการศึกษาของ NORC ผู้ให้รหัสอิสระสนับสนุนการให้รหัสของ AI น้อยกว่าผู้ตอบแบบสอบถามประมาณ 20%[15]
- P(doom) ที่อนุมานได้
- เป็นเพียงค่าคร่าวๆ เมื่อทดสอบกับตัวเลข 113 ตัวที่ผู้คนพิมพ์ โดยซ่อนตัวเลขเหล่านั้นไว้ ระบบอ่านค่าได้ 96 ตัว และมีอัตราต่อรองคลาดเคลื่อนไม่เกิน 2× เพียง 22% ของเวลา ซึ่งไม่ได้ดีกว่าการเดา 12.5% ให้ทุกคน แต่ระบบจัดลำดับผู้คนได้อย่างสมเหตุสมผล และเปอร์เซ็นต์ที่คุณพิมพ์ เช่น “20%” จะมีผลเหนือกว่าเสมอ[12]
- สิ่งที่ยังไม่ได้ทำ
- เรายังไม่มีชุดทดสอบแบบปกปิดที่ติดป้ายกำกับโดยผู้ประเมินอิสระตามที่แผนการประเมินของเรากำหนดไว้[14] จนกว่าจะมีชุดทดสอบดังกล่าว การตรวจสอบทุกอย่างที่นี่จะเปรียบเทียบค่าที่อ่านได้กับตำแหน่งที่ระบุด้วยตนเอง การประมวลผลซ้ำ หรือโมเดลอื่นๆ ยังไม่มีการเปรียบเทียบผลลัพธ์ระหว่างภาษาที่ใช้ในการสัมภาษณ์
ใครได้ทำแบบสัมภาษณ์นี้แล้ว
ณ 3 ตุลาคม 2569 มีผู้ได้รับผลลัพธ์แล้ว 963 คน[13] คนเหล่านี้เลือกทำแบบประเมิน โดยส่วนใหญ่มาจากกระทู้ใน Hacker News (25 – 26 กันยายน) และโพสต์บน X (27 – 28 กันยายน) และผู้เข้าร่วมทั้งสองระลอกมีผลลัพธ์ห่างกันมาก โดยมีค่ามัธยฐานของมุมมองที่ 0.32 เทียบกับ 0.68 บนแกน Doom–Bloom ช่วง 0–1 (ดูการเปรียบเทียบ) ดังนั้นตัวเลขของเราจึงอธิบายผู้ที่เข้ามาทำแบบประเมิน ไม่ใช่ประชาชนทั่วไป และเราเผยแพร่ตัวเลขเฉพาะกลุ่มที่มีอย่างน้อย 10 คน
เหตุผลที่คำถามเขียนขึ้นโดยเฉพาะ
AI อาจด้นสดการสัมภาษณ์ได้ คำถามที่กำหนดและเรียบเรียงไว้ล่วงหน้าช่วยให้ถ้อยคำเป็นกลางและเหมือนกันทุกครั้ง เพื่อให้ผู้เข้าร่วมทุกคนและผู้นำทางความคิดจำลองทุกคนตอบคำถามเดียวกัน และทำให้การเปรียบเทียบมีความหมาย แนวทางปี 2026 ของ AAPOR จัดให้ผู้สัมภาษณ์ที่เป็น AI ซึ่งสร้างคำถาม เปลี่ยนถ้อยคำ หรือมีอิทธิพลต่อกระบวนการสัมภาษณ์ มีความเสี่ยงสูง[16] ที่นี่ถ้อยคำจะไม่เปลี่ยนแปลง และ Jev กำหนดทิศทางของกระบวนการผ่านการตัดสินที่โค้ดใช้เลือกจากคำถามต่างๆ เท่านั้น
เวอร์ชันและการเปลี่ยนแปลง
- อัลกอริทึม
- 0.7.5
- คำถาม
- 0.4.0-draft
- เกณฑ์การประเมิน
- 0.1.0-draft
- โมเดล
- jev-1.13.0
ผลลัพธ์ที่บันทึกไว้แต่ละรายการจะเก็บข้อมูลเวอร์ชันที่ใช้สร้างผลลัพธ์นั้น การแก้ไขที่ไม่ต้องอาศัยการตัดสินใหม่จะมีผลกับผลลัพธ์เก่าด้วยเมื่อมีการแสดงผล
- · 0.7.5ระบุตำแหน่งผู้คนไว้ระหว่างห้าระดับของแผนที่ แทนที่จะระบุเฉพาะบนระดับเหล่านั้น และอ่านผลลัพธ์ที่บันทึกไว้อีกครั้ง[17]
- · 0.7.4การสัมภาษณ์ใน 10 ภาษา โดย Jev อ่านคำตอบตามที่เขียนไว้และได้รับแจ้งภาษาที่ใช้ในการสัมภาษณ์
- · 0.7.2–0.7.3เก็บคำตอบ P(doom) ที่พิมพ์ไว้ซึ่งสั้นเพียง “30%” โดยก่อนหน้านี้คำตอบเหล่านี้ถูกแทนที่ด้วยค่าที่อนุมาน และถามเพิ่มอีกหนึ่งคำถามเมื่อการตีความมีความเห็นแตกต่างกันหรือห่างจากตำแหน่งที่คุณระบุเองมาก[12]
- · 0.7.0–0.7.1แก้ไขวิธีแสดง P(doom) (คำตอบ 20% ที่พิมพ์ไว้เคยแสดงเป็นประมาณ 3%) ถามโดยตรงเกี่ยวกับระดับการเปลี่ยนแปลงและ P(doom) เลิกชะลอการแสดงผลลัพธ์เพื่อให้ครอบคลุมการให้เหตุผล และอ่านผลลัพธ์ที่บันทึกไว้อีกครั้ง[18]
บันทึกการวิจัยบน GitHub บันทึกการเปลี่ยนแปลงแต่ละครั้งพร้อมหลักฐานประกอบ
ตัวอย่างที่ใช้ Elon Musk
ต่อไปนี้คือตัวอย่างผลลัพธ์ JSON บางส่วนจากแบบประเมินจำลองของ Elon Musk
ข้อมูลนำเข้าของแบบประเมิน
Depth 1+ folded · dotted keys have hover help
คำตอบและบริบทที่ส่งให้ Jev สำหรับแบบประเมินจำลองหนึ่งรายการ
ผลลัพธ์ที่สร้างขึ้น
Depth 1+ folded · dotted keys have hover help
ชุดการวินิจฉัยที่แอปของเราใช้อนุมานผลลัพธ์
คำตอบของคุณยังคงเป็นของคุณ
คำตอบและผลลัพธ์ของคุณเป็นส่วนตัวโดยค่าเริ่มต้น คุณเลือกเผยแพร่ได้หากต้องการแบ่งปัน ไม่จำเป็นต้องลงทะเบียน อ่านรายละเอียดเพิ่มเติมได้ในนโยบายความเป็นส่วนตัว
ขั้นต่อไปคืออะไร?
เวอร์ชันแรกนี้มุ่งเน้นการทำความเข้าใจมุมมองของคุณโดยไม่พยายามเปลี่ยนแปลงมุมมองเหล่านั้น โหมดโสเครติสในอนาคตอาจท้าทายข้อสันนิษฐาน เสนอตัวอย่างโต้แย้งที่มีแหล่งข้อมูลรองรับอย่างดี และช่วยเสริมความแข็งแกร่งให้การให้เหตุผลของคุณ
เป้าหมายคือเครื่องมือที่ดียิ่งขึ้นสำหรับการคิดอย่างชัดเจนซึ่งทุกคนใช้ได้ ไม่ว่าคุณจะอยู่ตรงไหนบนแผนที่ ฉันอยากทราบว่าส่วนใดมีประโยชน์ ส่วนใดดูไม่ถูกต้อง และยังขาดอะไรอยู่ แบ่งปันความคิดเห็นบน GitHub
แหล่งข้อมูล
- 1.
How the next question is chosen (lib/assessment/routing.ts)Doom or Bloom on GitHub · 2026
- 2.
The authored questions, content release 0.4.0-draftDoom or Bloom on GitHub · 2026
- 3.
The rubric Jev judges answers against, version 0.1.0-draftDoom or Bloom on GitHub · 2026
- 4.
What Jev judges and what code decidesDoom or Bloom on GitHub · 2026
- 5.
Where each part of a result comes from, with links to its codeDoom or Bloom on GitHub · 2026
- 6.
How the map is placed and what its ranges meanDoom or Bloom on GitHub · 2026
- 7.
How P(doom) is read: a typed number, or an estimate from your answersDoom or Bloom on GitHub · 2026
- 8.
Procedural neutrality and the framing choices we acceptDoom or Bloom on GitHub · 2026
- 9.
Example source briefs for simulated thought leaders, including Elon MuskDoom or Bloom on GitHub · 2026
- 10.
How simulated thought leaders are madeDoom or Bloom on GitHub · 2026
- 11.
Can AI Stand In for Human Survey-Takers? Not ReallyPew Research Center · 2026
- 12.
Engine design review, September 29, 2026Doom or Bloom research notes · 2026
- 13.
Participant aggregates as of 2026-10-03 (participants.json)Doom or Bloom on GitHub · 2026
- 14.
Evaluation protocol and its tolerancesDoom or Bloom on GitHub · 2026
- 15.
AI-Assisted Conversational Interviewing: Effects on Data Quality and Respondent ExperienceBarari et al., NORC at the University of Chicago · 2025
- 16.
Responsible AI Integration in Survey ResearchAAPOR Task Force on Responsible AI Integration in Survey Research · 2026
- 17.
Why the map showed five columns, October 3, 2026Doom or Bloom research notes · 2026
- 18.
Interview and modeling audit, September 27, 2026Doom or Bloom research notes · 2026