ZhiJing är ett samlat ramverk för att mäta, träna och använda social intelligens i stora språkmodeller. SoMBench omfattar 3 huvuddimensioner, 17 deldimensioner, 71 uppgiftstyper och 3 481 expertvaliderade exempel.
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is the Chinese Academy of Sciences Institute of Computing Technology’s ZhiJing social intelligence system, released on July 24, 2026, a. Article summary: ZhiJing is CAS ICT’s integrated “social mind” framework: it combines measurement, model training, and deployment time grounding so LLMs can infer mental states, relationships, norms, and context rather than merely produc. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Stora språkmodeller kan skriva övertygande, men har ofta svårt att avgöra vad en person tror, menar mellan raderna eller förväntas göra i en viss social roll. ZhiJing är Kinesiska vetenskapsakademins Institute of Computing Technologys (CAS ICT) försök att göra just den typen av social förståelse till en tydligare ingenjörsuppgift.
Systemet presenterades offentligt den 24 juli 2026. Den tekniska rapporten lades samtidigt upp på arXiv den 26 juli, vilket är två olika datum snarare än nödvändigtvis motstridiga uppgifter. 1
ZhiJing består av tre huvudkomponenter:
Tanken är alltså inte bara att få en AI att låta empatisk, utan att pröva om den kan dra rätt slutsats när verkligheten skiljer sig från en persons uppfattning, när en avsikt är underförstådd eller när en relation och en social norm ändrar vad som är rimligt att säga eller göra.
SoMBench är ett psykologiskt förankrat riktmärke med 3 huvuddimensioner, 17 deldimensioner och 71 uppgiftsparadigm. Det bygger på 284 gemensamma scenarier och 3 481 expertvaliderade exempel. Frågeform, berättarperspektiv och kontextlängd kontrolleras för att resultaten ska bli mer jämförbara. 1
Testet är utformat för att avslöja fel som lätt försvinner i vanliga kunskaps- och frågesvarstest: att blanda ihop en människas tro med vad som faktiskt är sant, missa en implicit avsikt, inte uppdatera ett antagande när ny information tillkommer eller bortse från relationer, roller och sociala regler. 1
När 20 representativa språkmodeller testades fanns tydlig förbättringspotential. Den starkaste modellen nådde bara 72,08 procents total träffsäkerhet, och ingen av de 17 deldimensionerna nådde rapportens gräns på 90 procent för en nivå nära taket. 1
Zing använder en diagnosstyrd data-loop, beskriven som en FLARE-liknande metod. Misslyckanden i SoMBench används för att identifiera svaga sociala förmågor, skapa och granska mer riktade träningsdata, träna modellen och sedan testa den igen. Processen omfattar bland annat analys av dåliga exempel, diagnoser per dimension, kontroller av svårighetsgrad och besvarbarhet samt test för genvägar där modellen kan ha gissat rätt via ytliga mönster. 1
Träningen sker i två steg:
En central komponent är On-Policy Distillation (OPD), som ska hjälpa modellen att behålla användbara allmänna förmågor från basmodellen under den specialiserade efterträningen. Det är ett sätt att motverka så kallad katastrofal glömska: risken att en modell blir bättre på en smal uppgift men försämras på sådant den redan kunde. OPD kombineras med Mixed-Reward GRPO, där belöningssignalen ska driva modellen mot bättre resultat på de sociala resonemangsuppgifterna. 1
CAS ICT uppger att den multimodala modellen Zing-27B överträffade GPT-5.5 i medelresultat över fem internationella riktmärken för social kognition. 1
Enligt de publicerade resultaten var snittet 79,80 procent för Zing-27B, jämfört med 78,44 procent för GPT-5.5 – en skillnad på 1,36 procentenheter. De största angivna fördelarna var 4,08 procentenheter i HiToM, ett test av avancerat resonemang om andras föreställningar, och 5,62 procentenheter i EmoBench, som mäter emotionell förståelse. 5
Det finns dock en viktig reservation: den tillgängliga primära rapporten bekräftar påståendet om ledning över fem test, men visar inte själv samtliga dessa exakta siffror i det tillgängliga utdraget. Resultaten bör därför läsas som forskargruppens egna utvärderingar, inte som en oberoende replikation. 1
ZhiJing är därmed ett intressant steg mot AI som bättre kan hantera social kontext. Men höga benchmarkresultat är inte samma sak som att en modell pålitligt ”förstår människor” i öppna, verkliga situationer – något SoMBenchs egna resultat också understryker. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZhiJing är ett samlat ramverk för att mäta, träna och använda social intelligens i stora språkmodeller.
ZhiJing är ett samlat ramverk för att mäta, träna och använda social intelligens i stora språkmodeller. SoMBench omfattar 3 huvuddimensioner, 17 deldimensioner, 71 uppgiftstyper och 3 481 expertvaliderade exempel.
CAS ICT uppger att Zing 27B nådde 79,80 procent i snitt över fem test, mot 78,44 procent för GPT 5.5.