SoMBench opdeler social forståelse i 3 hoveddimensioner, 17 underdimensioner og 71 opgavetyper baseret på 3.481 ekspertvaliderede eksempler. Zing trænes ud fra diagnosticerede fejl med dataiteration, distillation og reinforcement learning, mens OPD skal begrænse tabet af modellens generelle færdigheder.
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is the Chinese Academy of Sciences Institute of Computing Technology’s ZhiJing social intelligence system, released on July 24, 2026, a. Article summary: ZhiJing is CAS ICT’s integrated “social mind” framework: it combines measurement, model training, and deployment time grounding so LLMs can infer mental states, relationships, norms, and context rather than merely produc. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Kinas Videnskabsakademis Institut for Computerteknologi (CAS ICT) præsenterede ZhiJing den 24. juli 2026 som et samlet system for det, forskerne kalder AI’s sociale sind. Målet er ikke blot, at en sprogmodel skal give velformulerede svar, men at den bedre kan udlede, hvad mennesker tror, føler og mener – også når det ikke bliver sagt direkte.
ZhiJing består af tre led: måling af modellens sociale kompetencer, træning af dem og støtte, når modellen bruges i praksis. Den tekniske rapport blev indsendt 26. juli, altså efter den offentlige præsentation; de to datoer dækker forskellige begivenheder. 1
Kernen i evalueringsdelen er SoMBench, en psykologifunderet benchmark. Den omfatter 3 hoveddimensioner, 17 underdimensioner og 71 opgaveparadigmer fordelt på 284 fælles scenarier og 3.481 ekspertvaliderede eksempler. Testen kontrollerer blandt andet spørgsmålsform, fortælleperspektiv og længden af konteksten. 1
Benchmarken skal finde fejl, som almindelige spørgsmål-og-svar-tests let overser. Det kan eksempelvis være, når en model:
CAS ICT beskriver de tre overordnede områder som mentale repræsentationer, social interaktion og internalisering af normer. 8
Zing er træningskomponenten i systemet. Ideen er at gøre social ræsonnering til en mere stabil, indlært modelkompetence frem for en adfærd, der kun opstår, hvis brugeren formulerer den helt rigtige prompt. Den kombinerer superviseret finjustering, on-policy distillation (OPD) og rubric-baseret reinforcement learning. 1
Den såkaldte FLARE-lignende dataflywheel fungerer som en iterativ proces: Fejl i benchmarken peger på svage sociale kompetencer, og de fund bruges til at skabe, filtrere og udvælge mere målrettede træningseksempler. Derefter testes modellen igen. Processen omfatter blandt andet udtræk af dårlige cases, diagnose pr. dimension, kontrol af sværhedsgrad og besvarlighed, test for genveje i data samt reparation og udvælgelse. 1
Træningen foregår i to trin:
I den anden del kombinerer Mixed-Reward GRPO belønning for socialt ræsonnement med OPD. OPD’s rolle er at bevare nyttige generelle egenskaber fra grundmodellen under den specialiserede eftertræning og dermed mindske risikoen for catastrophic forgetting – at modellen bliver bedre til én ting, men markant dårligere til tidligere færdigheder. 1
ZhiJing omfatter også Actio, en ramme til brugstidspunktet. Den kan tilføre procedurevejledning, sporing af tillagte mentale tilstande, genbrugelig erfaring og kontrolleret hentning af viden om sociale normer. 1
Tanken er dermed ikke, at modellen alene skal have al social forståelse indbygget i parametrene. Den skal også kunne få struktureret støtte, når den møder en konkret, socialt tvetydig situation.
CAS ICT oplyser, at den multimodale Zing-27B overgik GPT-5.5 i gennemsnit på fem internationale benchmarks for social kognition. 1
Ifølge de offentliggjorte resultater opnåede Zing-27B en samlet score på 79,80 %, mod 78,44 % for GPT-5.5 – en forskel på 1,36 procentpoint. De angivne forspring var 4,08 procentpoint på HiToM og 5,62 procentpoint på EmoBench. 5
Tallene er dog forskernes egne rapporterede evalueringer, ikke en uafhængig replikation. Den tilgængelige tekniske rapport bekræfter påstanden om føringen over fem benchmarks, men viser ikke i sit tilgængelige uddrag alle de nævnte enkeltresultater. 1
SoMBench peger samtidig på, hvor vanskeligt området fortsat er. I evalueringen af 20 repræsentative sprogmodeller opnåede den bedst præsterende model kun 72,08 % samlet korrekthed, og ingen af de 17 underdimensioner nåede rapportens tærskel på 90 % for et niveau tæt på loftet. 1
ZhiJing er derfor ikke dokumentation for, at AI pålideligt “forstår mennesker” i virkelige situationer. Det er snarere et forsøg på at gøre et hidtil diffust problem – sociale signaler, tavse forventninger og skiftende følelser – målbart, trænbart og mere synligt, når modellerne fejler.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SoMBench opdeler social forståelse i 3 hoveddimensioner, 17 underdimensioner og 71 opgavetyper baseret på 3.481 ekspertvaliderede eksempler.
SoMBench opdeler social forståelse i 3 hoveddimensioner, 17 underdimensioner og 71 opgavetyper baseret på 3.481 ekspertvaliderede eksempler. Zing trænes ud fra diagnosticerede fejl med dataiteration, distillation og reinforcement learning, mens OPD skal begrænse tabet af modellens generelle færdigheder.
CAS ICT oplyser, at den multimodale Zing 27B opnåede 79,80 % mod GPT 5.5’s 78,44 % på et gennemsnit af fem sociale benchmarks.