SoMBench prüft soziale KI Fähigkeiten in 3 Hauptdimensionen, 17 Unterdimensionen und 71 Aufgabenformaten – anhand von 3.481 fachlich validierten Beispielen. Zing soll Schwächen bei Überzeugungen, unausgesprochenen Absichten, Emotionen, Beziehungen und sozialen Normen durch diagnosegestütztes Training verringern.
Veröffentlicht vonBearbeitet mit GPT-5.6 TerraBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is the Chinese Academy of Sciences Institute of Computing Technology’s ZhiJing social intelligence system, released on July 24, 2026, a. Article summary: ZhiJing is CAS ICT’s integrated “social mind” framework: it combines measurement, model training, and deployment time grounding so LLMs can infer mental states, relationships, norms, and context rather than merely produc. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ZhiJing (auch „Zhijing“) ist ein System für soziale Intelligenz bei großen Sprachmodellen, entwickelt am Institut für Computertechnik der Chinesischen Akademie der Wissenschaften (CAS ICT). Sein Anspruch: KI soll nicht nur sprachlich überzeugende Antworten erzeugen, sondern besser erfassen, was Personen wissen oder glauben, welche Absicht sie andeuten, welche Beziehung sie zueinander haben und welche sozialen Regeln gelten.
Das System besteht aus drei Teilen: dem Diagnose-Benchmark SoMBench, dem darauf ausgerichteten Modell- und Trainingsansatz Zing sowie der Einsatzumgebung Actio. CAS ICT stellte ZhiJing am 24. Juli 2026 öffentlich vor; der zugehörige technische Bericht wurde am 26. Juli bei arXiv eingereicht. Das sind unterschiedliche Veröffentlichungsschritte, kein zwingender Widerspruch. 1
8
Herkömmliche Frage-Antwort-Tests erfassen nur begrenzt, ob ein Modell eine soziale Lage wirklich korrekt einordnet. SoMBench soll genau diese Lücke sichtbar machen. Der psychologisch fundierte Benchmark umfasst:
Dabei werden Frageformat, Erzählperspektive und Kontextlänge kontrolliert. Getestet wird etwa, ob eine KI die Überzeugung einer Person von der tatsächlichen Lage unterscheiden kann, ob sie implizite Absichten erkennt, Überzeugungen nach neuen Informationen aktualisiert oder Beziehungen, Rollen und Normen richtig berücksichtigt. 1
8
Das ist relevant, weil eine flüssige Antwort nicht automatisch bedeutet, dass ein Modell die Perspektive der beteiligten Personen verstanden hat. In der Auswertung von 20 repräsentativen Sprachmodellen kam das beste getestete Modell insgesamt nur auf 72,08 % Genauigkeit; keine der 17 Unterdimensionen erreichte die im Bericht genannte Schwelle von 90 %. 1
Zing ist die Trainingskomponente von ZhiJing. Sie soll soziale Schlussfolgerungen von einem Verhalten, das nur mit passenden Prompts gelegentlich gelingt, zu einer stabileren, in den Modellparametern verankerten Fähigkeit machen. 1
Dafür beschreibt das Team einen FLARE-ähnlichen Datenkreislauf: Fehler in SoMBench werden zunächst nach Fähigkeiten und Fehlermustern diagnostiziert. Daraus entstehen gezielt neue Trainingsbeispiele, die auf Schwierigkeit, Beantwortbarkeit und mögliche Abkürzungen im Antwortverhalten geprüft, gegebenenfalls überarbeitet und anschließend ausgewählt werden. Nach dem Training folgt erneut die Evaluation. 1
Das Training ist zweistufig angelegt:
Eine Rolle spielt dabei On-Policy Distillation (OPD): Sie soll nützliche allgemeine Fähigkeiten des Basismodells während der Spezialisierung erhalten und damit katastrophales Vergessen mindern. Beim sogenannten Mixed-Reward GRPO wird dieses Ziel mit einem Belohnungssignal für soziales Schlussfolgern kombiniert. 1
Mit Actio ergänzt ZhiJing die Trainingsseite um eine Einsatzschicht für KI-Agenten. Sie kann prozedurale Hilfen, die Zuordnung mentaler Zustände zu Beteiligten, wiederverwendbare Erfahrungen sowie einen kontrollierten Abruf sozialen oder normativen Wissens bereitstellen. Die Idee dahinter: Auch ein trainiertes Modell benötigt in konkreten Situationen nachvollziehbare Stützen, statt soziale Regeln nur aus dem laufenden Dialog erraten zu müssen. 1
Nach Angaben von CAS ICT übertraf das multimodale Modell Zing-27B den Mittelwert von GPT-5.5 über fünf internationale Benchmarks zur sozialen Kognition. Die veröffentlichte Vergleichstabelle nennt 79,80 % für Zing-27B und 78,44 % für GPT-5.5 – ein Vorsprung von 1,36 Prozentpunkten. Besonders groß seien die Abstände bei HiToM mit +4,08 Prozentpunkten und bei EmoBench mit +5,62 Prozentpunkten. 5
8
Diese Werte sind jedoch als vom Entwicklungsteam berichtete Evaluation einzuordnen. Der wissenschaftliche Kurztext bestätigt den Führungsanspruch über fünf Benchmarks, legt die genannten vier Einzelwerte im verfügbaren Auszug aber nicht selbst offen. Eine unabhängige Replikation der Ergebnisse ist damit nicht belegt. 1
Unterm Strich ist ZhiJing weniger ein Beweis dafür, dass KI Menschen bereits zuverlässig „versteht“, als ein konkreter Versuch, diese schwer messbare Fähigkeit technisch aufzuschlüsseln: erst Fehler bei Perspektivwechsel, Emotionen und Normen präzise finden, dann sie gezielt trainieren und den Einsatz zur Laufzeit absichern.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
SoMBench prüft soziale KI Fähigkeiten in 3 Hauptdimensionen, 17 Unterdimensionen und 71 Aufgabenformaten – anhand von 3.481 fachlich validierten Beispielen.
SoMBench prüft soziale KI Fähigkeiten in 3 Hauptdimensionen, 17 Unterdimensionen und 71 Aufgabenformaten – anhand von 3.481 fachlich validierten Beispielen. Zing soll Schwächen bei Überzeugungen, unausgesprochenen Absichten, Emotionen, Beziehungen und sozialen Normen durch diagnosegestütztes Training verringern.
Zing 27B erreichte laut den veröffentlichten Ergebnissen im Mittel von fünf Benchmarks 79,80 % gegenüber 78,44 % für GPT 5.5.