ZhiJing to pełny system rozwijania społecznej inteligencji modeli językowych: od diagnozy błędów, przez trening, po wsparcie modelu podczas działania. SoMBench obejmuje 3 główne wymiary, 17 podwymiarów, 71 typów zadań i 3481 przykładów zweryfikowanych przez ekspertów.
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is the Chinese Academy of Sciences Institute of Computing Technology’s ZhiJing social intelligence system, released on July 24, 2026, a. Article summary: ZhiJing is CAS ICT’s integrated “social mind” framework: it combines measurement, model training, and deployment time grounding so LLMs can infer mental states, relationships, norms, and context rather than merely produc. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Duże modele językowe potrafią pisać płynnie i rozwiązywać wiele zadań, ale wciąż często zawodzą tam, gdzie trzeba odczytać czyjeś przekonanie, intencję, zmianę emocji albo niepisaną zasadę społeczną. Zespół z Instytutu Technologii Obliczeniowych Chińskiej Akademii Nauk (CAS ICT) proponuje odpowiedź na ten problem: ZhiJing, zintegrowany system „społecznego umysłu” dla AI.
System publicznie przedstawiono 24 lipca 2026 r. Techniczny raport naukowy zgłoszono 26 lipca; są to różne daty dotyczące prezentacji i publikacji raportu, a nie sprzeczne informacje. 1
ZhiJing nie jest wyłącznie jednym modelem. To łańcuch: pomiar → uczenie → działanie.
W praktyce chodzi o to, aby model nie ograniczał się do poprawnej językowo odpowiedzi, lecz brał pod uwagę to, kto co wie, czego może nie wiedzieć, jakie relacje łączą osoby i jakie normy obowiązują w danym kontekście.
SoMBench jest benchmarkiem opartym na dorobku psychologii. Obejmuje 3 główne wymiary, 17 podwymiarów i 71 paradygmatów zadań. Zbiór wykorzystuje 284 wspólne scenariusze oraz 3481 przypadków zweryfikowanych przez ekspertów; kontroluje też formę pytania, perspektywę narracji i długość kontekstu. 1
Test ma wychwytywać problemy, które mogą umykać standardowym benchmarkom QA. Należą do nich m.in.:
To ważne rozróżnienie: poprawna odpowiedź może czasem wynikać z powierzchownego wzorca, a nie z rzeczywistego prześledzenia perspektywy uczestników sytuacji. SoMBench ma pomagać rozpoznać właśnie taki typ błędu. 1
Autorzy opisują mechanizm FLARE jako pętlę iteracji danych sterowaną diagnozą. Błędy odnotowane w benchmarku wskazują słabe kompetencje społeczne, a te z kolei kierują tworzeniem, filtrowaniem, wyborem i ponowną oceną przykładów treningowych. Proces obejmuje m.in. wydobywanie trudnych przypadków, diagnozę dla poszczególnych wymiarów, sprawdzanie trudności i rozwiązywalności zadań, testowanie skrótów poznawczych oraz naprawę i selekcję danych. 1
Trening przebiega etapami:
W metodzie Mixed-Reward GRPO sygnał nagrody za rozumowanie społeczne łączony jest z On-Policy Distillation (OPD). Rola OPD polega na zachowaniu użytecznych, ogólnych zdolności modelu bazowego podczas wyspecjalizowanego dostrajania — czyli na ograniczaniu tzw. katastrofalnego zapominania. GRPO ma jednocześnie wzmacniać wyniki w docelowych zadaniach społecznych. 1
CAS ICT podał, że multimodalny model Zing-27B przewyższył GPT-5.5 pod względem średniego wyniku w pięciu międzynarodowych benchmarkach społecznego poznania. 1
Według opublikowanych przez zespół danych Zing-27B uzyskał 79,80%, a GPT-5.5 78,44% — przewaga wyniosła więc 1,36 punktu procentowego. Wskazano także przewagę Zing-27B o 4,08 pkt proc. w HiToM i o 5,62 pkt proc. w EmoBench. 5
Te liczby należy jednak traktować jako wyniki raportowane przez autorów, a nie niezależną replikację. Dostępny fragment raportu naukowego potwierdza ogólne twierdzenie o prowadzeniu w średniej z pięciu benchmarków, lecz nie pokazuje samodzielnie wszystkich czterech przytoczonych wartości liczbowych. 1
Sam SoMBench pokazuje, że do niezawodnego zachowania AI w złożonych sytuacjach społecznych droga pozostaje długa. W ocenie 20 reprezentatywnych modeli najlepszy wynik wyniósł tylko 72,08% poprawnych odpowiedzi, a żaden z 17 podwymiarów nie osiągnął progu 90%, który raport traktuje jako poziom bliski sufitowi. 1
ZhiJing jest więc przede wszystkim próbą potraktowania społecznej inteligencji jako konkretnego problemu inżynieryjnego: dającego się mierzyć, diagnozować, trenować i wspierać podczas wdrożenia. To nie oznacza jeszcze, że model rzeczywiście „rozumie ludzi” tak jak człowiek — ale daje bardziej precyzyjne narzędzia do sprawdzania, kiedy tylko sprawia takie wrażenie, a kiedy faktycznie potrafi przeanalizować społeczny kontekst.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZhiJing to pełny system rozwijania społecznej inteligencji modeli językowych: od diagnozy błędów, przez trening, po wsparcie modelu podczas działania.
ZhiJing to pełny system rozwijania społecznej inteligencji modeli językowych: od diagnozy błędów, przez trening, po wsparcie modelu podczas działania. SoMBench obejmuje 3 główne wymiary, 17 podwymiarów, 71 typów zadań i 3481 przykładów zweryfikowanych przez ekspertów.
Według wyników raportowanych przez autorów Zing 27B uzyskał średnio 79,80% w pięciu testach społecznego poznania, wobec 78,44% dla GPT 5.5.