「知境」由 SoMBench、Zing 與 Actio 組成,分別處理社會智能的評測、內化訓練及部署支援。 SoMBench 涵蓋 3 項一級維度、17 項二級維度、71 種任務,並以 3,481 個經專家驗證的案例找出模型「不懂人」的具體盲點。
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is the Chinese Academy of Sciences Institute of Computing Technology’s ZhiJing social intelligence system, released on July 24, 2026, a. Article summary: ZhiJing is CAS ICT’s integrated “social mind” framework: it combines measurement, model training, and deployment time grounding so LLMs can infer mental states, relationships, norms, and context rather than merely produc. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
大語言模型可以寫得流暢,卻不一定能分清「某人以為的事」和「實際發生的事」,更可能漏讀沒說出口的意圖、情緒轉折,或關係與身分所帶來的分寸。中國科學院計算技術研究所團隊推出的「知境」(Zhijing)社會心智大模型技術體系,正是針對這類社會情境理解問題提出的一套整合方法:先量測能力缺口,再針對性訓練,最後在實際部署時提供支援。1
研究所於 2026 年 7 月 24 日展示相關成果;技術報告則在 7 月 26 日提交。兩者是公開展示與論文提交的不同時間點,並不衝突。1
8
整套架構可分為三個環節:
其目標不是只讓模型在單一問答題答對,而是讓模型在複雜社會脈絡中,能較妥善地推斷他人的信念、意圖與情緒,並納入人際關係、角色與社會規範。1
SoMBench 以心理學為基礎,將抽象的「懂不懂人」拆為 3 項一級維度、17 項二級維度與 71 種任務範式。它涵蓋心智表徵、社會互動與規範內化等面向,使用 284 個共用情境及 3,481 個經專家驗證的案例;題型、敘事視角與上下文長度也受到控制,以降低模型只是靠題目表面線索猜中的可能。1
8
這類測試要捕捉的,不是一般知識問答常見的對錯,而是例如:
團隊對 20 個代表性大模型的測試顯示,當時最佳模型的整體準確率僅 72.08%,17 項二級維度中沒有任何一項達到報告設定的 90% 近乎滿分門檻。這表示模型在社會推理上仍有明顯改善空間。1
Zing 是「知境」的模型訓練部分。核心思路是:不要只用大量泛用資料訓練,而是用 SoMBench 的失敗案例定位薄弱能力,再回頭生成、篩選與修補對應訓練資料,形成以診斷為中心的資料飛輪。研究團隊將這一類流程稱為 FLARE 式的能力驅動資料迭代,包含錯誤案例擷取、分維度診斷、難度與可回答性檢查、捷徑探測、修復與資料選擇等步驟。1
訓練大致分兩階段:
其中,**On-Policy Distillation(OPD,在策略蒸餾)**的功能,是在模型接受專門後訓練時,盡量保留原本的通用能力,避免「災難性遺忘」;而 Mixed-Reward GRPO 則把社會推理的獎勵訊號與 OPD 結合,以推動模型在目標社會任務上進步。1
「知境」的第三部分 Actio,定位為部署階段的支援框架。它可提供程序化引導、帶來源標記的心智狀態追蹤、可重用經驗,以及對社會或規範知識的受控檢索。換言之,模型即使已經受過訓練,在面對具體任務時仍可取得較可檢查的輔助,而非完全仰賴一次性生成。1
中科院計算技術研究所表示,多模態 Zing-27B 在五項國際社會認知評測的平均成績超越 GPT-5.5。8
依團隊公布數據,Zing-27B 的五項基準綜合平均為 79.80%,GPT-5.5 為 78.44%,前者高出 1.36 個百分點;在高階心智理論基準 HiToM 與情緒基準 EmoBench,分別領先 4.08 與 5.62 個百分點。5
不過,這些細部數字目前應視為研究團隊所公布的評測結果。可取得的主要論文摘要確認其「五項基準平均領先」的主張,但未完整列出上述所有比較數值;因此,這不等同於第三方獨立重現的結論。1
還不能這樣解讀。這項工作的重要性在於,它把原本模糊的「情商」或社會理解,拆成可測量、可定位、可訓練與可在運行時支援的能力鏈。但 SoMBench 的結果也提醒我們:即使是最強模型,對信念、意圖、情緒和社會規範的掌握仍不穩定。
因此,「知境」較合理的定位,是為 AI 的社會情境理解建立一套工程化路徑,而非證明模型已能可靠地理解人類。能否在真實、開放且高風險的互動場景中保持穩定,仍需要更多實際驗證。1
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
「知境」由 SoMBench、Zing 與 Actio 組成,分別處理社會智能的評測、內化訓練及部署支援。
「知境」由 SoMBench、Zing 與 Actio 組成,分別處理社會智能的評測、內化訓練及部署支援。 SoMBench 涵蓋 3 項一級維度、17 項二級維度、71 種任務,並以 3,481 個經專家驗證的案例找出模型「不懂人」的具體盲點。
團隊公布 Zing 27B 在五項社會認知基準的平均分數為 79.80%,高於 GPT 5.5 的 78.44%;這些屬作者公布的評測結果,尚非獨立重現。