ZhiJing menggabungkan pengukuran, latihan dan sokongan ketika penggunaan untuk membantu model bahasa mentafsir keadaan mental, hubungan, norma dan konteks. SoMBench merangkumi 3 dimensi utama, 17 subdimensi, 71 tugasan dan 3,481 contoh yang disahkan pakar bagi mengesan kelemahan penaakulan sosial AI.
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is the Chinese Academy of Sciences Institute of Computing Technology’s ZhiJing social intelligence system, released on July 24, 2026, a. Article summary: ZhiJing is CAS ICT’s integrated “social mind” framework: it combines measurement, model training, and deployment time grounding so LLMs can infer mental states, relationships, norms, and context rather than merely produc. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ZhiJing ialah rangka kerja “minda sosial” bersepadu daripada Institut Teknologi Pengkomputeran, Akademi Sains China (CAS ICT). Matlamatnya bukan sekadar menjadikan model bahasa besar (LLM) pandai menghasilkan jawapan yang lancar, tetapi membolehkannya membuat inferens tentang kepercayaan, niat tersirat, emosi, hubungan dan norma sosial sebelum bertindak balas. Ia menggabungkan tiga bahagian: pengukuran keupayaan, latihan model dan sokongan semasa model digunakan. 1
CAS ICT mempersembahkan sistem itu pada 24 Julai 2026, manakala laporan teknikal asasnya dihantar ke arXiv pada 26 Julai. Kedua-duanya merujuk kepada peristiwa berbeza dan tidak semestinya bercanggah. 1
8
Penanda aras biasa lazimnya mengukur sama ada AI boleh menjawab soalan dengan betul. SoMBench cuba menguji mengapa AI tersilap dalam situasi manusia yang lebih rumit.
Sebagai contoh, model boleh gagal apabila perlu membezakan antara realiti dengan apa yang dipercayai oleh seseorang; mengesan niat yang tidak disebut secara terus; mengemas kini kepercayaan selepas maklumat baharu muncul; atau mengambil kira kedudukan, hubungan dan norma dalam sesuatu situasi. Bidangnya merangkumi representasi minda, interaksi sosial dan penghayatan norma. 1
8
Ini penting kerana komunikasi manusia banyak bergantung pada perkara yang tidak dinyatakan secara jelas—perubahan emosi, isyarat halus, andaian bersama dan batas tingkah laku mengikut hubungan. Sistem boleh kelihatan fasih, tetapi masih tersalah tafsir konteks tersebut.
Pendekatan FLARE digambarkan sebagai kitaran data berasaskan diagnosis. Kegagalan yang dikenal pasti melalui SoMBench digunakan untuk menentukan keupayaan sosial yang lemah, kemudian membimbing penghasilan contoh latihan bersasar, penapisan data, latihan dan penilaian semula. Laporan itu menyenaraikan langkah seperti mengekstrak kes gagal, diagnosis mengikut dimensi, semakan kesukaran dan kebolehjawaban, ujian jalan pintas, pembaikan serta pemilihan data. 1
Latihan pula dijalankan dalam dua peringkat:
Zing turut menggunakan On-Policy Distillation (OPD) bersama Mixed-Reward GRPO. Secara ringkas, OPD bertujuan mengekalkan keupayaan umum model asas semasa ia dilatih secara khusus untuk penaakulan sosial—usaha untuk mengurangkan masalah catastrophic forgetting, iaitu apabila model kehilangan sebahagian kemahiran lama selepas latihan baharu. GRPO pula memberi dorongan ganjaran terhadap prestasi dalam tugasan sosial yang disasarkan. 1
CAS ICT menyatakan model multimodal Zing-27B mengatasi GPT-5.5 pada skor purata lima penanda aras antarabangsa berkaitan kognisi sosial. 1
8
Menurut angka yang dilaporkan pasukan tersebut, Zing-27B mencatat skor komposit 79.80%, berbanding 78.44% bagi GPT-5.5—kelebihan 1.36 mata peratusan. Ia juga dilaporkan mendahului sebanyak 4.08 mata peratusan pada HiToM, penanda aras penaakulan kepercayaan aras tinggi, dan 5.62 mata peratusan pada EmoBench. 5
Namun, angka terperinci itu perlu dibaca dengan berhati-hati: petikan laporan utama yang tersedia mengesahkan dakwaan kepimpinan purata merentas lima penanda aras, tetapi tidak memaparkan secara bebas semua empat nilai tersebut. Oleh itu, ia wajar dianggap sebagai hasil penilaian yang dilaporkan oleh pembangun, bukannya pengesahan bebas pihak ketiga. 1
Dapatan paling penting mungkin ialah skala cabaran itu sendiri. Dalam penilaian SoMBench terhadap 20 LLM, model terbaik hanya memperoleh 72.08% ketepatan keseluruhan. Tiada satu pun daripada 17 subdimensi mencapai ambang hampir maksimum 90% yang ditetapkan dalam laporan. 1
Jadi, ZhiJing menunjukkan satu pendekatan yang lebih tersusun untuk melatih AI membaca konteks manusia—ukur kelemahan, hasilkan latihan yang tepat dan sokong model ketika digunakan. Tetapi keputusan penanda aras belum membuktikan bahawa model boleh dipercayai untuk benar-benar memahami manusia dalam semua keadaan dunia sebenar. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZhiJing menggabungkan pengukuran, latihan dan sokongan ketika penggunaan untuk membantu model bahasa mentafsir keadaan mental, hubungan, norma dan konteks.
ZhiJing menggabungkan pengukuran, latihan dan sokongan ketika penggunaan untuk membantu model bahasa mentafsir keadaan mental, hubungan, norma dan konteks. SoMBench merangkumi 3 dimensi utama, 17 subdimensi, 71 tugasan dan 3,481 contoh yang disahkan pakar bagi mengesan kelemahan penaakulan sosial AI.
CAS ICT melaporkan Zing 27B memperoleh purata 79.80% merentas lima penanda aras, berbanding 78.44% untuk GPT 5.5; keputusan ini ialah penilaian yang dilaporkan oleh pembangun.