즈징은 사회지능을 측정하는 SoMBench, 이를 모델 내부 능력으로 학습시키는 Zing, 실제 배포 환경에서 지원하는 Actio를 묶은 통합 프레임워크다. SoMBench는 284개 공통 시나리오와 전문가 검증 사례 3,481개로 믿음 추론, 사회적 상호작용, 규범 이해의 취약점을 진단한다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is the Chinese Academy of Sciences Institute of Computing Technology’s ZhiJing social intelligence system, released on July 24, 2026, a. Article summary: ZhiJing is CAS ICT’s integrated “social mind” framework: it combines measurement, model training, and deployment time grounding so LLMs can infer mental states, relationships, norms, and context rather than merely produc. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
대화형 AI는 문장을 매끄럽게 만들 수 있어도, 상대가 무엇을 알고 있다고 믿는지, 말하지 않은 의도가 무엇인지, 관계와 상황에 따라 어떤 행동이 적절한지를 자주 놓친다. 중국과학원(CAS) 컴퓨팅기술연구소(ICT)의 **즈징(ZhiJing·知境)**은 이 문제를 ‘사회적 마음(social mind)’이라는 독립적인 공학 과제로 다루려는 기술 체계다.
연구소는 2026년 7월 24일 시스템을 공개했고, 관련 기술 보고서는 7월 26일 arXiv에 제출됐다. 공개일과 논문 제출일이 달라 보이지만, 서로 다른 절차의 날짜다. 1
8
즈징의 핵심은 평가 → 내재화 학습 → 배포 단계 지원을 하나의 흐름으로 잇는 데 있다.
즉, 단순히 ‘공감 능력이 있는 것처럼 답하는 AI’를 만들겠다는 주장보다, 사회적 맥락 이해의 결함을 측정하고 보완한 뒤 실제 작업 환경에서도 활용할 수 있게 하려는 접근이다.
SoMBench는 포괄적인 사회지능을 검증 가능한 세부 능력으로 분해한다. 3개 대분류, 17개 세부 분류, 71개 과제 유형으로 구성되며, 284개 공통 시나리오와 전문가 검증 사례 3,481개를 포함한다. 질문 형식, 서술 관점, 문맥 길이도 통제한다. 1
평가의 세 대분류는 마음 상태 표상, 사회적 상호작용, 규범의 내재화다. 8 이 틀은 다음과 같은 실패를 가려내는 데 초점이 있다.
일반적인 질의응답 점수만으로는 모델이 정답을 진짜 추론해서 맞힌 것인지, 표면적 문장 패턴을 이용해 맞힌 것인지 구별하기 어렵다. SoMBench는 이런 ‘지름길’ 문제까지 찾아내는 진단 도구를 지향한다.
연구진이 설명한 FLARE식 데이터 플라이휠의 출발점은 오답 진단이다. 벤치마크에서 드러난 약한 능력을 찾고, 그에 맞는 사례를 생성·필터링·보정·선별한 뒤 학습과 재평가를 반복한다. 보고서에는 실패 사례 추출, 차원별 진단, 난이도와 답변 가능성 확인, 지름길 탐지, 보정 및 데이터 선택 과정이 포함된다. 1
학습은 두 단계로 설계됐다.
여기에는 **온폴리시 증류(OPD)**와 Mixed-Reward GRPO가 들어간다. OPD는 특정 사회추론 능력을 추가 학습하는 과정에서 기존 범용 능력이 크게 손상되는, 이른바 ‘파국적 망각’을 줄이는 것이 목적이다. GRPO는 목표 사회추론 과제에 대한 보상 신호로 성능을 끌어올리는 역할을 한다. 1
연구진의 의도는 프롬프트를 정교하게 써야만 잠시 나타나는 사회적 추론을, 모델 파라미터에 더 안정적으로 자리 잡은 능력으로 전환하는 데 있다. 1
7
연구소는 멀티모달 Zing-27B가 국제 사회인지 벤치마크 5종의 평균 점수에서 GPT-5.5를 넘어섰다고 밝혔다. 1
8
공개된 수치에 따르면 Zing-27B의 종합 평균은 79.80%, GPT-5.5는 **78.44%**로, 차이는 1.36%포인트다. 개별 벤치마크에서는 고차 믿음 추론을 다루는 HiToM에서 4.08%포인트, 감정 이해를 다루는 EmoBench에서 5.62%포인트 앞섰다고 보고됐다. 5
다만 이 숫자는 연구진 측이 제시한 평가 결과다. 이용 가능한 1차 기술 보고서 발췌는 5개 벤치마크 평균 우위 주장을 뒷받침하지만, 위의 개별 수치를 독립적으로 검증할 수 있는 상세 결과를 모두 제공하지는 않는다. 따라서 외부 기관의 재현 검증 결과로 받아들이기보다는 저자 보고 성적으로 해석하는 편이 적절하다. 1
가장 중요한 단서는 SoMBench 자체 평가 결과다. 연구진이 대표 LLM 20개를 평가했을 때 최고 모델의 전체 정확도는 **72.08%**였고, 17개 세부 분류 가운데 보고서가 사실상 상한선으로 본 **90%**에 도달한 항목은 없었다. 1
이는 사회적 맥락, 암묵적 의도, 감정 변화, 비언어적·비명시적 신호를 다루는 능력이 아직 충분히 해결되지 않았다는 뜻이다. 즈징의 성과는 AI가 사람을 안정적으로 ‘이해한다’는 증거라기보다, 막연한 사회지능을 측정 가능한 항목으로 나누고, 약점을 겨냥해 학습시키려는 하나의 공학적 경로를 제시했다는 데 의미가 있다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
즈징은 사회지능을 측정하는 SoMBench, 이를 모델 내부 능력으로 학습시키는 Zing, 실제 배포 환경에서 지원하는 Actio를 묶은 통합 프레임워크다.
즈징은 사회지능을 측정하는 SoMBench, 이를 모델 내부 능력으로 학습시키는 Zing, 실제 배포 환경에서 지원하는 Actio를 묶은 통합 프레임워크다. SoMBench는 284개 공통 시나리오와 전문가 검증 사례 3,481개로 믿음 추론, 사회적 상호작용, 규범 이해의 취약점을 진단한다.
연구진 보고에 따르면 멀티모달 Zing 27B는 사회인지 벤치마크 5종 평균에서 GPT 5.5를 앞섰지만, 이는 연구진이 제시한 자체 평가 결과로 독립 재현과는 구분해서 봐야 한다.