ZhiJing เป็นกรอบงานครบวงจรของ CAS ICT สำหรับวัด ฝึก และนำความสามารถในการเข้าใจบริบททางสังคมของ AI ไปใช้งานจริง [1] SoMBench แยกทักษะ “เข้าใจคน” ออกเป็น 3 มิติหลัก 17 มิติย่อย 71 งานทดสอบ และตัวอย่างที่ผู้เชี่ยวชาญตรวจสอบแล้ว 3,481 รายการ [1] CAS ICT รายงานว่า Zing 27B ได้ค่าเฉลี่ย 79.80% ใน 5 เกณฑ์ทดสอบ เทียบกับ 78....
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Terraรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is the Chinese Academy of Sciences Institute of Computing Technology’s ZhiJing social intelligence system, released on July 24, 2026, a. Article summary: ZhiJing is CAS ICT’s integrated “social mind” framework: it combines measurement, model training, and deployment time grounding so LLMs can infer mental states, relationships, norms, and context rather than merely produc. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
โมเดลภาษาอาจเขียนตอบได้ลื่นไหล แต่การแยกว่า “สิ่งที่ผู้พูดเชื่อ” ต่างจากความจริงอย่างไร การจับเจตนาที่ไม่ได้พูดตรง ๆ หรือการรู้ว่าบทบาทและบรรทัดฐานทางสังคมเปลี่ยนคำตอบที่เหมาะสมอย่างไร ยังเป็นโจทย์ยาก
นี่คือปัญหาที่ ZhiJing (知境) จากสถาบันเทคโนโลยีการคำนวณ สถาบันบัณฑิตวิทยาศาสตร์จีน (CAS ICT) ต้องการแก้ โดยวางระบบเป็นห่วงโซ่ตั้งแต่การวัดผล การฝึกโมเดล ไปจนถึงการกำกับเมื่อใช้งานจริง ภายใต้แนวคิด “social mind” หรือความสามารถของ AI ในการให้เหตุผลเกี่ยวกับสภาวะทางความคิด ความสัมพันธ์ กฎเกณฑ์ และบริบทของผู้คน ไม่ใช่เพียงสร้างคำตอบที่ฟังดูถูกต้อง 1
CAS ICT นำเสนอระบบต่อสาธารณะเมื่อวันที่ 24 กรกฎาคม 2026 ขณะที่รายงานเทคนิคบน arXiv ระบุวันที่ส่งบทความเป็น 26 กรกฎาคม ซึ่งเป็นคนละเหตุการณ์ จึงไม่จำเป็นต้องขัดแย้งกัน 1
ZhiJing ประกอบด้วย 3 ส่วนที่เชื่อมกัน
SoMBench แบ่งความสามารถด้านสังคมออกเป็น 3 มิติหลัก 17 มิติย่อย และ 71 รูปแบบงาน โดยครอบคลุมการให้เหตุผลเรื่องความเชื่อ อารมณ์ ปฏิสัมพันธ์ทางสังคม ความสัมพันธ์ และการรับรู้กฎเกณฑ์ของสังคม ชุดประเมินใช้สถานการณ์ร่วม 284 สถานการณ์ และตัวอย่างที่ผู้เชี่ยวชาญตรวจสอบแล้ว 3,481 รายการ พร้อมควบคุมรูปแบบคำถาม มุมมองการเล่าเรื่อง และความยาวของบริบท 1
จุดสำคัญคือมันออกแบบมาเพื่อจับความผิดพลาดที่การทดสอบถาม-ตอบทั่วไปอาจมองไม่เห็น ตัวอย่างเช่น
ในการประเมินโมเดลภาษาขนาดใหญ่ 20 รุ่น รายงานระบุว่าโมเดลที่ทำได้ดีที่สุดมีความถูกต้องรวมเพียง 72.08% และไม่มีมิติย่อยใดใน 17 มิติที่แตะเกณฑ์ใกล้เต็ม 90% สะท้อนว่างานด้านการเข้าใจบริบทมนุษย์ยังมีช่องว่างอยู่มาก 1
แนวคิดของวงจรข้อมูลแบบ FLARE คือเริ่มจากการวินิจฉัย: ผลที่โมเดลทำพลาดใน SoMBench จะชี้จุดอ่อนรายมิติ แล้วจึงนำไปสร้างและคัดกรองตัวอย่างสำหรับฝึก ก่อนประเมินซ้ำ กระบวนการนี้รวมถึงการดึงกรณีพลาด การตรวจระดับความยากและความตอบได้ การตรวจว่ามีทางลัดให้โมเดลเดาคำตอบหรือไม่ การซ่อมตัวอย่าง และการคัดเลือกข้อมูล 1
การฝึกแบ่งเป็น 2 ระยะ
ในส่วน Mixed-Reward GRPO ทีมงานผสมสัญญาณรางวัลสำหรับการให้เหตุผลเชิงสังคมเข้ากับ On-Policy Distillation (OPD) ซึ่งมีเป้าหมายให้โมเดลยังรักษาความสามารถทั่วไปจากโมเดลฐานไว้ได้ระหว่างการฝึกเฉพาะทาง หรือช่วยลดปัญหา catastrophic forgetting ที่โมเดลเก่งเรื่องใหม่ขึ้นแต่ลืมสิ่งเดิม ขณะที่ GRPO ผลักดันผลลัพธ์ในงานสังคมที่ต้องการ 1
CAS ICT รายงานว่า Zing-27B ซึ่งเป็นโมเดลหลายรูปแบบข้อมูล (multimodal) ทำคะแนนเฉลี่ยเหนือ GPT-5.5 ในการทดสอบความรู้ความเข้าใจทางสังคมระดับนานาชาติ 5 ชุด 1
ตัวเลขที่ทีมรายงานมีดังนี้
| รายการ | Zing-27B | GPT-5.5 | ส่วนต่าง |
|---|---|---|---|
| ค่าเฉลี่ยรวม 5 เกณฑ์ทดสอบ | 79.80% | 78.44% | +1.36 จุดเปอร์เซ็นต์ |
| HiToM | — | — | +4.08 จุดเปอร์เซ็นต์ |
| EmoBench | — | — | +5.62 จุดเปอร์เซ็นต์ |
มีข้อควรระวังสำคัญ: รายงานต้นทางยืนยันคำกล่าวว่า Zing-27B นำในค่าเฉลี่ยของทั้ง 5 เกณฑ์ทดสอบ แต่ข้อความส่วนที่เผยแพร่ในแหล่งปฐมภูมิที่มีอยู่ไม่ได้แสดงตัวเลขทั้ง 4 ค่าแยกให้ตรวจสอบโดยตรง ดังนั้นควรมองตัวเลขเหล่านี้เป็น ผลการประเมินที่ผู้พัฒนารายงาน ไม่ใช่ผลการทดสอบยืนยันโดยหน่วยงานอิสระ 1
ZhiJing ไม่ได้พิสูจน์ว่า AI “เข้าใจคน” ได้อย่างน่าเชื่อถือในโลกจริงแล้ว แต่เสนอแนวทางที่ชัดเจนกว่าเดิม: เปลี่ยนทักษะที่เคยเรียกรวม ๆ ว่า AI มี “EQ” ให้กลายเป็นสิ่งที่วัดหาจุดบกพร่อง ฝึกแก้เป็นรายด้าน และมีเครื่องมือช่วยกำกับตอนนำไปใช้ได้
สำหรับผู้ใช้ ความต่างนี้สำคัญอย่างยิ่งในงานที่คำตอบถูกต้องเชิงข้อเท็จจริงอาจยังไม่พอ เช่น ผู้ช่วยสนทนา การศึกษา งานบริการ หรือเอเจนต์ AI ที่ต้องตัดสินใจท่ามกลางความสัมพันธ์ อารมณ์ และกติกาที่ไม่ได้เขียนบอกไว้ตรง ๆ แต่คะแนน benchmark เพียงอย่างเดียวก็ยังไม่อาจรับรองความเข้าใจมนุษย์ในสถานการณ์จริงได้ 1
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
ZhiJing เป็นกรอบงานครบวงจรของ CAS ICT สำหรับวัด ฝึก และนำความสามารถในการเข้าใจบริบททางสังคมของ AI ไปใช้งานจริง [1]
ZhiJing เป็นกรอบงานครบวงจรของ CAS ICT สำหรับวัด ฝึก และนำความสามารถในการเข้าใจบริบททางสังคมของ AI ไปใช้งานจริง [1] SoMBench แยกทักษะ “เข้าใจคน” ออกเป็น 3 มิติหลัก 17 มิติย่อย 71 งานทดสอบ และตัวอย่างที่ผู้เชี่ยวชาญตรวจสอบแล้ว 3,481 รายการ [1]
CAS ICT รายงานว่า Zing 27B ได้ค่าเฉลี่ย 79.80% ใน 5 เกณฑ์ทดสอบ เทียบกับ 78.44% ของ GPT 5.5 แต่ผลดังกล่าวยังเป็นการรายงานโดยผู้พัฒนาเอง [1]