บทสนทนาที่ชัดเจนยิ่งขึ้นเกี่ยวกับอนาคตของ AI

คุณคาดหวังอะไรจาก AI เหตุใดจึงคาดหวังเช่นนั้น และอะไรอาจทำให้คุณเปลี่ยนใจ?

Doom or Bloom ช่วยให้คุณสำรวจมุมมองที่หลากหลายเกี่ยวกับ AI และทำแผนที่ความคิดของคุณเองผ่านคำถามปลายเปิดไม่กี่ข้อ ไม่จำเป็นต้องมีความรู้เฉพาะทางหรือบัญชี ใช้งานได้ฟรีทั้งหมดและเป็นโอเพนซอร์ส

ทำไมจึงสร้างสิ่งนี้?

ผลดีและความเสี่ยงที่อาจเกิดขึ้นจาก AI สมควรได้รับการอภิปรายอย่างรอบคอบและตั้งอยู่บนข้อเท็จจริง เมื่อความสามารถก้าวหน้าและการตัดสินใจส่งผลสืบเนื่องมากขึ้น เราจำเป็นต้องมีวิธีที่เข้าถึงได้ในการคิดอย่างชัดเจนท่ามกลางมุมมองที่แตกต่างกันอย่างมาก

ฉันสร้างสิ่งนี้ขึ้นเพื่อสำรวจเสียงต่าง ๆ ในวงการและช่วยให้ผู้คนคลี่คลายสัญชาตญาณที่ขัดแย้งกัน สิ่งนี้ช่วยทำให้มุมมองของฉันเองชัดเจนขึ้นแล้ว เป้าหมายคือถ่ายทอดมุมมองของคุณอย่างซื่อตรง โดยชี้นำเชิงบรรณาธิการให้น้อยที่สุดเท่าที่จะเป็นไปได้

ระเบียบวิธี

ทุกสิ่งที่กำหนดผลลัพธ์ของคุณเป็นโอเพนซอร์ส หมายเหตุที่มีหมายเลขเชื่อมโยงไปยังไฟล์และงานวิจัยที่ใช้โดยตรง

การสัมภาษณ์ทำงานอย่างไร

  1. คำถามเปิดเหมือนกันสำหรับทุกคน
  2. คำถามสำหรับแผนที่ผลกระทบโดยรวม ระดับการเปลี่ยนแปลง และ P(doom) โดยถามแต่ละเรื่องไม่เกินหนึ่งครั้ง
  3. คำถามติดตามคำถามที่เขียนไว้ล่วงหน้าเกี่ยวกับสิ่งที่ยังไม่ชัดเจน รวมทั้งหมดไม่เกิน 12 ข้อ
  4. ผลลัพธ์ของคุณเมื่อสามารถระบุตำแหน่งบนแผนที่ของคุณได้แล้ว โดยคุณยังตอบคำถามต่อได้

หลังคำตอบทุกข้อ

Jev ตัดสิน

  • คำตอบใช้ได้หรือไม่
  • คำอธิบายใดที่เขียนไว้ล่วงหน้าตรงกับคำตอบ
  • คำถามที่เป็นตัวเลือกแต่ละข้อจะช่วยให้ชัดเจนขึ้นมากเพียงใด

โค้ดตัดสินใจ

  • คำถามข้อใดจะเป็นข้อต่อไป
  • ผลลัพธ์พร้อมเมื่อใด
  • ตำแหน่งบนแผนที่ ช่วงค่าต่างๆ และ P(doom) ของคุณ

โค้ดเลือกคำถามติดตามแต่ละข้อ⁠[1] จากรายการคำถามที่เขียนไว้ล่วงหน้าแบบตายตัว⁠[2] และคนส่วนใหญ่จะเห็นผลลัพธ์หลังตอบคำถามเหล่านี้ 4–8 ข้อ Jev ของ TypeSafe อ่านคำตอบของคุณผ่านการตัดสินย่อยที่มุ่งเน้น โดยเทียบกับเกณฑ์ที่เขียนไว้ล่วงหน้า⁠[3] และจะไม่เขียนคำถามหรือคำตัดสินเกี่ยวกับตัวคุณเลย⁠[4] โค้ดจะรวมการตัดสินเหล่านั้นเป็นแผนที่ของคุณ ช่วงค่าต่างๆ และ P(doom)⁠[5] การประมวลผลการตัดสินย่อยเป็นชุดทำให้มีต้นทุนต่ำพอที่จะให้บริการได้ฟรี

ผลลัพธ์ของคุณคืออะไร และไม่ใช่อะไร

แผนที่
การตีความของเราจากสิ่งที่คุณเขียน ไม่ใช่คำตัดสิน แบบทดสอบ หรือการพยากรณ์ กรอบเส้นประแสดงการตีความอื่นๆ ที่เป็นไปได้ ไม่ใช่โอกาสที่คุณจะตีความถูกต้อง⁠[6]
เบื้องหลังแผนที่
โลกทัศน์ 8 มิติและคุณภาพของการให้เหตุผล 7 ด้าน เช่น ความเต็มใจที่จะปรับตามข้อมูลใหม่ หลักฐานที่ขาดไปจะยังไม่ถูกระบุตำแหน่ง และจะไม่นับเป็นคะแนนต่ำโดยเด็ดขาด⁠[5]
P(doom)
เป็นตัวเลขที่คุณกรอกหรือค่าประมาณที่อนุมานจากคำตอบของคุณ โดยมีการระบุว่าเป็นแบบใด⁠[7]
การตัดสินใจเชิงบรรณาธิการ
คำตอบไม่ได้ผ่านการตรวจสอบข้อเท็จจริง คำถาม เกณฑ์การประเมิน และแม้แต่ชื่อ ล้วนเกี่ยวข้องกับการตัดสินใจเชิงบรรณาธิการ และชื่ออาจชี้นำให้คุณนึกถึงความเสี่ยงและผลดี มุมมองแบบผสม ความไม่แน่นอน และมุมมองสุดขั้วที่สอดคล้องกัน ล้วนใช้ได้⁠[8]
ผู้นำทางความคิด
การจำลอง: โมเดลอีกตัวหนึ่ง (GPT-5.6 Sol) ตอบคำถามเดียวกันโดยอ้างอิงแหล่งข้อมูลสาธารณะที่เชื่อมโยงไว้ของแต่ละบุคคล⁠[9] และระบบของเราอ่านคำตอบเหล่านั้นโดยไม่รู้ว่าเป็นของใคร⁠[10] คำตอบเหล่านี้ไม่ใช่คำตอบหรือการรับรองจากบุคคลเหล่านั้นเอง ให้ถือว่าเป็นต้นแบบ โดยในการทดสอบของ Pew ในปี 2026 คำตอบจาก AI ที่เป็นตัวแทนต่างจากคำตอบของคนจริงโดยเฉลี่ย 12 จุดเปอร์เซ็นต์⁠[11]

หลักฐานที่มีจนถึงขณะนี้

ตำแหน่งจากการตีความมุมมองต่างกันมากเพียงใด

การตีความคำตอบชุดเดียวกันสองครั้ง

Jev อ่านคำตอบชุดเดิมสองครั้ง
0.007
Jev หลังปรับถ้อยคำโดยคงความหมายเดิม
0.019
Jev เทียบกับ GPT-5.6 Sol
0.060

การอ่านค่าเทียบกับตำแหน่งที่บุคคลนั้นระบุด้วยตนเอง

Jev
0.141
GPT-5.6 Sol
0.135
การคาดเดาแบบเดียวกันสำหรับทุกคน
0.233

ระยะห่างเฉลี่ยบนแกน Doom–Bloom ช่วง 0–1 แถบยาวไปถึง 0.3 และยิ่งสั้นยิ่งใกล้ จากการระบุตำแหน่งตนเอง 219 ครั้งและการสัมภาษณ์ที่ปรับถ้อยคำใหม่ 60 ครั้ง ณ 29 กันยายน 2569⁠[12]

ตำแหน่งที่คุณระบุด้วยตนเอง
ค่าที่อ่านได้อยู่ใกล้ตำแหน่งที่ผู้คนระบุด้วยตนเองมากกว่าการใช้การคาดเดาเดียวกันสำหรับทุกคน โดยไม่มีแนวโน้มเฉลี่ยเอนเอียงไปทางความหวังหรือความกังวล⁠[13] ผู้ประเมินเห็นพ้องกันเองมากกว่าเห็นพ้องกับผู้คนอย่างมาก ดังนั้นช่องว่างส่วนใหญ่จึงอยู่ระหว่างวิธีที่ผู้คนเขียนกับวิธีที่พวกเขามองตนเอง หากทั้งสองต่างกันเกินหนึ่งในสี่ของแกนใดแกนหนึ่ง ผลลัพธ์ของคุณจะถามเกี่ยวกับความแตกต่างนั้น
การอ่านซ้ำและการปรับถ้อยคำ
การอ่านซ้ำหรือการปรับถ้อยคำในการสัมภาษณ์ไม่เคยทำให้มุมมองเปลี่ยนไปเกินขีดจำกัด 0.10 ของเรา สำหรับคำตอบที่มีความหมายเดียวกัน⁠[14] ช่วงบนแผนที่จะไม่ถูกวาดให้แคบกว่า ±0.05 ซึ่งเป็นความแปรผันที่พบเมื่อบุคคลจำลองทำการสัมภาษณ์ซ้ำ
โมเดลที่ใหญ่กว่า
Jev ให้ผลตรงกับ GPT-5.6 Sol ภายในขอบเขตความคลาดเคลื่อน โดยมีค่าใช้จ่ายประมาณ 1/21⁠[12]
“สิ่งนี้ตรงกับที่คุณรู้สึกหรือไม่?”
ผู้คน 68 จาก 80 คนตอบว่าใช่ (85%)⁠[13] ให้ตีความค่านี้เป็นเพดาน เพราะผู้คนมีแนวโน้มเห็นด้วยกับการอ่านตัวตนของตนโดย AI ในการศึกษาของ NORC ผู้ให้รหัสอิสระสนับสนุนการให้รหัสของ AI น้อยกว่าผู้ตอบแบบสอบถามประมาณ 20%⁠[15]
P(doom) ที่อนุมานได้
เป็นเพียงค่าคร่าวๆ เมื่อทดสอบกับตัวเลข 113 ตัวที่ผู้คนพิมพ์ โดยซ่อนตัวเลขเหล่านั้นไว้ ระบบอ่านค่าได้ 96 ตัว และมีอัตราต่อรองคลาดเคลื่อนไม่เกิน 2× เพียง 22% ของเวลา ซึ่งไม่ได้ดีกว่าการเดา 12.5% ให้ทุกคน แต่ระบบจัดลำดับผู้คนได้อย่างสมเหตุสมผล และเปอร์เซ็นต์ที่คุณพิมพ์ เช่น “20%” จะมีผลเหนือกว่าเสมอ⁠[12]
สิ่งที่ยังไม่ได้ทำ
เรายังไม่มีชุดทดสอบแบบปกปิดที่ติดป้ายกำกับโดยผู้ประเมินอิสระตามที่แผนการประเมินของเรากำหนดไว้⁠[14] จนกว่าจะมีชุดทดสอบดังกล่าว การตรวจสอบทุกอย่างที่นี่จะเปรียบเทียบค่าที่อ่านได้กับตำแหน่งที่ระบุด้วยตนเอง การประมวลผลซ้ำ หรือโมเดลอื่นๆ ยังไม่มีการเปรียบเทียบผลลัพธ์ระหว่างภาษาที่ใช้ในการสัมภาษณ์

ใครได้ทำแบบสัมภาษณ์นี้แล้ว

ณ 3 ตุลาคม 2569 มีผู้ได้รับผลลัพธ์แล้ว 963 คน⁠[13] คนเหล่านี้เลือกทำแบบประเมิน โดยส่วนใหญ่มาจากกระทู้ใน Hacker News (25 – 26 กันยายน) และโพสต์บน X (27 – 28 กันยายน) และผู้เข้าร่วมทั้งสองระลอกมีผลลัพธ์ห่างกันมาก โดยมีค่ามัธยฐานของมุมมองที่ 0.32 เทียบกับ 0.68 บนแกน Doom–Bloom ช่วง 0–1 (ดูการเปรียบเทียบ) ดังนั้นตัวเลขของเราจึงอธิบายผู้ที่เข้ามาทำแบบประเมิน ไม่ใช่ประชาชนทั่วไป และเราเผยแพร่ตัวเลขเฉพาะกลุ่มที่มีอย่างน้อย 10 คน

เหตุผลที่คำถามเขียนขึ้นโดยเฉพาะ

AI อาจด้นสดการสัมภาษณ์ได้ คำถามที่กำหนดและเรียบเรียงไว้ล่วงหน้าช่วยให้ถ้อยคำเป็นกลางและเหมือนกันทุกครั้ง เพื่อให้ผู้เข้าร่วมทุกคนและผู้นำทางความคิดจำลองทุกคนตอบคำถามเดียวกัน และทำให้การเปรียบเทียบมีความหมาย แนวทางปี 2026 ของ AAPOR จัดให้ผู้สัมภาษณ์ที่เป็น AI ซึ่งสร้างคำถาม เปลี่ยนถ้อยคำ หรือมีอิทธิพลต่อกระบวนการสัมภาษณ์ มีความเสี่ยงสูง⁠[16] ที่นี่ถ้อยคำจะไม่เปลี่ยนแปลง และ Jev กำหนดทิศทางของกระบวนการผ่านการตัดสินที่โค้ดใช้เลือกจากคำถามต่างๆ เท่านั้น

เวอร์ชันและการเปลี่ยนแปลง

อัลกอริทึม
0.7.5
คำถาม
0.4.0-draft
เกณฑ์การประเมิน
0.1.0-draft
โมเดล
jev-1.13.0

ผลลัพธ์ที่บันทึกไว้แต่ละรายการจะเก็บข้อมูลเวอร์ชันที่ใช้สร้างผลลัพธ์นั้น การแก้ไขที่ไม่ต้องอาศัยการตัดสินใหม่จะมีผลกับผลลัพธ์เก่าด้วยเมื่อมีการแสดงผล

  1. · 0.7.5ระบุตำแหน่งผู้คนไว้ระหว่างห้าระดับของแผนที่ แทนที่จะระบุเฉพาะบนระดับเหล่านั้น และอ่านผลลัพธ์ที่บันทึกไว้อีกครั้ง⁠[17]
  2. · 0.7.4การสัมภาษณ์ใน 10 ภาษา โดย Jev อ่านคำตอบตามที่เขียนไว้และได้รับแจ้งภาษาที่ใช้ในการสัมภาษณ์
  3. · 0.7.2–0.7.3เก็บคำตอบ P(doom) ที่พิมพ์ไว้ซึ่งสั้นเพียง “30%” โดยก่อนหน้านี้คำตอบเหล่านี้ถูกแทนที่ด้วยค่าที่อนุมาน และถามเพิ่มอีกหนึ่งคำถามเมื่อการตีความมีความเห็นแตกต่างกันหรือห่างจากตำแหน่งที่คุณระบุเองมาก⁠[12]
  4. · 0.7.0–0.7.1แก้ไขวิธีแสดง P(doom) (คำตอบ 20% ที่พิมพ์ไว้เคยแสดงเป็นประมาณ 3%) ถามโดยตรงเกี่ยวกับระดับการเปลี่ยนแปลงและ P(doom) เลิกชะลอการแสดงผลลัพธ์เพื่อให้ครอบคลุมการให้เหตุผล และอ่านผลลัพธ์ที่บันทึกไว้อีกครั้ง⁠[18]

บันทึกการวิจัยบน GitHub บันทึกการเปลี่ยนแปลงแต่ละครั้งพร้อมหลักฐานประกอบ

ตัวอย่างที่ใช้ Elon Musk

ต่อไปนี้คือตัวอย่างผลลัพธ์ JSON บางส่วนจากแบบประเมินจำลองของ Elon Musk

ข้อมูลนำเข้าของแบบประเมิน

Depth 1+ folded · dotted keys have hover help

}

คำตอบและบริบทที่ส่งให้ Jev สำหรับแบบประเมินจำลองหนึ่งรายการ

ผลลัพธ์ที่สร้างขึ้น

Depth 1+ folded · dotted keys have hover help

"evidenceRevision": 5,
"sources": [],
true,
"capped": false,
"insufficient": false,
"reason": "Your answers place your outlook and the scale of change you expect, which is what the map needs. More answers can sharpen it."
}

ชุดการวินิจฉัยที่แอปของเราใช้อนุมานผลลัพธ์

คำตอบของคุณยังคงเป็นของคุณ

คำตอบและผลลัพธ์ของคุณเป็นส่วนตัวโดยค่าเริ่มต้น คุณเลือกเผยแพร่ได้หากต้องการแบ่งปัน ไม่จำเป็นต้องลงทะเบียน อ่านรายละเอียดเพิ่มเติมได้ในนโยบายความเป็นส่วนตัว

ขั้นต่อไปคืออะไร?

เวอร์ชันแรกนี้มุ่งเน้นการทำความเข้าใจมุมมองของคุณโดยไม่พยายามเปลี่ยนแปลงมุมมองเหล่านั้น โหมดโสเครติสในอนาคตอาจท้าทายข้อสันนิษฐาน เสนอตัวอย่างโต้แย้งที่มีแหล่งข้อมูลรองรับอย่างดี และช่วยเสริมความแข็งแกร่งให้การให้เหตุผลของคุณ

เป้าหมายคือเครื่องมือที่ดียิ่งขึ้นสำหรับการคิดอย่างชัดเจนซึ่งทุกคนใช้ได้ ไม่ว่าคุณจะอยู่ตรงไหนบนแผนที่ ฉันอยากทราบว่าส่วนใดมีประโยชน์ ส่วนใดดูไม่ถูกต้อง และยังขาดอะไรอยู่ แบ่งปันความคิดเห็นบน GitHub

แหล่งข้อมูล

  1. 1.
  2. 2.
  3. 3.
  4. 4.
    What Jev judges and what code decides

    Doom or Bloom on GitHub · 2026

  5. 5.
  6. 6.
    How the map is placed and what its ranges mean

    Doom or Bloom on GitHub · 2026

  7. 7.
  8. 8.
  9. 9.
  10. 10.
    How simulated thought leaders are made

    Doom or Bloom on GitHub · 2026

  1. 11.
  2. 12.
    Engine design review, September 29, 2026

    Doom or Bloom research notes · 2026

  3. 13.
  4. 14.
    Evaluation protocol and its tolerances

    Doom or Bloom on GitHub · 2026

  5. 15.
  6. 16.
    Responsible AI Integration in Survey Research

    AAPOR Task Force on Responsible AI Integration in Survey Research · 2026

  7. 17.
    Why the map showed five columns, October 3, 2026

    Doom or Bloom research notes · 2026

  8. 18.
    Interview and modeling audit, September 27, 2026

    Doom or Bloom research notes · 2026

จุดยืนของคุณอยู่ตรงไหน?
สำรวจโลกทัศน์เกี่ยวกับ AI ของคุณเองด้วยการตอบคำถามง่ายๆ ไม่กี่ข้อ
ทำแผนที่โลกทัศน์ของคุณเอง