ZhiJing è un framework integrato di CAS ICT per misurare, addestrare e applicare capacità di ragionamento sociale nei modelli linguistici. SoMBench copre 3 dimensioni, 17 sottodimensioni, 71 compiti e 3.481 esempi verificati da esperti.
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is the Chinese Academy of Sciences Institute of Computing Technology’s ZhiJing social intelligence system, released on July 24, 2026, a. Article summary: ZhiJing is CAS ICT’s integrated “social mind” framework: it combines measurement, model training, and deployment time grounding so LLMs can infer mental states, relationships, norms, and context rather than merely produc. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ZhiJing è il sistema di “mente sociale” sviluppato dall’Institute of Computing Technology dell’Accademia Cinese delle Scienze (CAS ICT). L’obiettivo non è solo far produrre a un modello risposte fluenti, ma aiutarlo a ricostruire ciò che le persone sanno, credono, intendono o provano, tenendo conto di relazioni, ruoli e norme implicite.
Il sistema è stato presentato pubblicamente il 24 luglio 2026; il rapporto tecnico su arXiv risulta invece presentato il 26 luglio. Le due date riguardano quindi comunicazioni diverse. 1
Un normale test di domande e risposte può premiare una risposta formalmente corretta anche se il modello non ha capito la situazione. SoMBench cerca invece errori come:
Le tre macroaree del benchmark sono rappresentazione mentale, interazione sociale e interiorizzazione delle norme. 8
Il metodo dichiarato dal team segue una logica di ciclo continuo dei dati, descritta come FLARE: gli insuccessi rilevati dal benchmark indicano quali capacità sociali sono deboli; tali diagnosi guidano poi generazione, filtro, correzione, selezione e nuovo test degli esempi di addestramento. Il processo comprende anche l’estrazione dei casi problematici, diagnosi per dimensione, verifiche di difficoltà e risolvibilità e controlli contro scorciatoie superficiali. 1
L’addestramento è organizzato in due fasi:
Il sistema usa inoltre On-Policy Distillation (OPD) insieme a Mixed-Reward GRPO. In termini semplici, l’OPD serve a conservare capacità utili del modello di base durante il post-addestramento specializzato, riducendo il rischio di catastrophic forgetting; il segnale GRPO spinge invece il modello verso prestazioni migliori nei compiti sociali mirati. 1
CAS ICT afferma che il modello multimodale Zing-27B ha superato GPT-5.5 nella media di cinque benchmark internazionali di cognizione sociale. 1
Secondo i dati riportati dal team, Zing-27B ha ottenuto un punteggio composito del 79,80%, rispetto al 78,44% di GPT-5.5: un vantaggio di 1,36 punti percentuali. I margini indicati sono di +4,08 punti su HiToM, test di ragionamento sulle credenze di ordine elevato, e di +5,62 punti su EmoBench. 5
Questi numeri restano risultati comunicati dagli autori, non una replica indipendente. E il messaggio di SoMBench è anche prudente: nella valutazione di 20 modelli linguistici, il migliore ha raggiunto soltanto il 72,08% di accuratezza complessiva e nessuna delle 17 sottodimensioni ha toccato la soglia del 90%. 1
In altre parole, ZhiJing propone un modo più strutturato per valutare e migliorare la sensibilità dell’IA al contesto umano. Non dimostra però che un modello “capisca le persone” in modo affidabile nelle situazioni reali: mostra piuttosto quanto il divario sia ancora ampio e rende quel divario più misurabile.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZhiJing è un framework integrato di CAS ICT per misurare, addestrare e applicare capacità di ragionamento sociale nei modelli linguistici.
ZhiJing è un framework integrato di CAS ICT per misurare, addestrare e applicare capacità di ragionamento sociale nei modelli linguistici. SoMBench copre 3 dimensioni, 17 sottodimensioni, 71 compiti e 3.481 esempi verificati da esperti.
Secondo i risultati riportati dal team, Zing 27B ha ottenuto il 79,80% medio su cinque benchmark, contro il 78,44% di GPT 5.5.