“知境”是一套面向大模型社会智能的完整技术体系,覆盖评测、能力内化训练和部署时支持,而不只是单一模型。 SoMBench 用 3 个一级维度、17 个二级维度、71 项任务和 3481 个专家验证实例,诊断模型在信念、情绪、关系与社会规范理解上的短板。[1] 团队报告称,多模态 Zing 27B 在五项国际社会心智评测中取得 79.80% 综合均值,高于 GPT 5.5 的 78.44%;相关结果仍属于团队报告的评测结论。[5]
发布者使用 GPT-5.6 Terra 编辑图片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is the Chinese Academy of Sciences Institute of Computing Technology’s ZhiJing social intelligence system, released on July 24, 2026, a. Article summary: ZhiJing is CAS ICT’s integrated “social mind” framework: it combines measurement, model training, and deployment time grounding so LLMs can infer mental states, relationships, norms, and context rather than merely produc. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
大模型能把话说得很流畅,并不等于它真正分得清“谁知道什么”“这句话暗示了什么”,或能随着情境变化理解人的情绪和关系。中国科学院计算技术研究所团队推出的 “知境”社会心智大模型技术体系,瞄准的正是这类社会语境理解问题。
这套体系并非只推出一个模型,而是把能力建设串成一条链路:用 SoMBench 做诊断,用 Zing 进行针对性训练,并以 Actio 为智能体在实际部署中提供支持。技术报告于 2026 年 7 月 26 日提交;相关发布报道将体系的正式发布日期列为 7 月 24 日,两者对应不同的公开节点。1
5
SoMBench 是一个以心理学为基础的社会心智诊断基准。它从心智表征、社会互动、规范内化三个一级维度出发,进一步细分为 17 个二级维度、71 项任务范式;基准使用 284 个共享场景和 3481 个经专家验证的实例,并控制题型、叙事视角与上下文长度,尽量避免模型仅凭题面套路得分。1
8
它关注的并非一般知识问答,而是模型在社会情境中常见的失误,例如:
这一设计的关键价值在于“定位错因”。如果模型答错,系统希望进一步判断:是推理过程出了断点,还是模型依赖表面词汇、题型结构等捷径猜中了答案。这样,评测不只是给出分数,也能为后续训练指出具体薄弱环节。5
现有模型距离这一目标仍有明显差距。报告对 20 个代表性大模型的测试显示,表现最好的模型总体准确率也只有 72.08%;17 个二级维度中,没有一个达到报告设定的 90% 近乎“能力封顶”的水平。1
Zing 是“知境”中的能力内化组件,目标是让社会推理不再主要依赖临时提示词,而更稳定地沉淀在模型参数中。1
其核心方法可概括为三步:
完整体系中的 Actio 则面向运行时:它可组织程序性指导、带归属的心智状态跟踪、可复用经验,以及对社会或规范知识的受控检索,帮助智能体在具体场景中调用相关支持。1
团队称,其多模态 Zing-27B 在五项国际社会心智评测上的平均成绩超过 GPT-5.5。1
8
据发布报道披露的具体数值,Zing-27B 的五项评测综合均值为 79.80%,GPT-5.5 为 78.44%,前者领先 1.36 个百分点;其中,Zing-27B 在高阶心智推理基准 HiToM 上领先 4.08 个百分点,在情绪理解基准 EmoBench 上领先 5.62 个百分点。5
需要注意的是:技术报告摘要能够确认其“五项评测综合领先”的主张,但所提供的论文摘要未逐项展示上述四个具体数值。因此,79.80%、78.44% 以及两项单项优势,应理解为团队及相关发布报道所披露的评测结果,而非独立第三方复现结论。1
5
“知境”的意义不在于证明 AI 已具备人类式理解,而在于尝试把过去较模糊的“情商”问题,拆解成可测量、可定位、可训练、可部署支持的工程对象。
SoMBench 的 72.08% 最高准确率也提醒我们:即使模型在若干基准上有所提升,面对真实交流中的含蓄表达、关系变化、规范冲突与情绪转折,可靠性仍有很大提升空间。1
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
“知境”是一套面向大模型社会智能的完整技术体系,覆盖评测、能力内化训练和部署时支持,而不只是单一模型。
“知境”是一套面向大模型社会智能的完整技术体系,覆盖评测、能力内化训练和部署时支持,而不只是单一模型。 SoMBench 用 3 个一级维度、17 个二级维度、71 项任务和 3481 个专家验证实例,诊断模型在信念、情绪、关系与社会规范理解上的短板。[1]
团队报告称,多模态 Zing 27B 在五项国际社会心智评测中取得 79.80% 综合均值,高于 GPT 5.5 的 78.44%;相关结果仍属于团队报告的评测结论。[5]