是时候讨论一下 AI 的 “第三极”—— 社会智能了。
当前人工智能已形成两大成熟版图:以 GPT-5.5、DeepSeek 为代表的符号空间智能,擅长语言理解、逻辑推理与代码生成;以及以具身机器人为代表的物理空间智能,擅长感知、行动与环境控制。符号空间智能拼的是 "智商",物理空间智能拼的是 "行动力",两条赛道已跑出明确的技术路径。
2026 年 WAIC 上,2024 年图灵奖得主、强化学习之父理查德・萨顿宣告,AI 正从 "人类数据时代" 迈入 "经验时代"—— 智能体不能只会消化人类留下的二手数据,必须通过与真实世界的持续交互生成属于自己的经验。
可问题来了:萨顿所说的 “经验”,到底从何而来?它真的只靠个体与物理世界的碰撞就能生成吗?
最近,知境团队提出了一种看法。他们认为,经验不是真空发生的,它发生在社会关系里,发生在 "我知道你知道我知道" 的递归信念中,发生在读懂一个眼神、推断一次未说出口的意图之中。
换句话说,真正完整的经验智能,离不开社会心智。理解信念、推断意图、感知情绪、权衡规范的能力 —— 社会智能 —— 正是 AGI 长期缺失的第三极。
知境团队来自中国科学院计算技术研究所智能算法安全全国重点实验室。他们的目标是为现有大模型补上 “理解人心” 的能力,让 AI 在面对复杂社会情境时更有情商、更可信、更值得托付。他们真正想探索的是:社会心智能不能像语言理解、代码生成一样,被定义为一种可以持续测量、训练和改进的工程能力?
为实现这一目标,他们近期发布了知境社会心智大模型技术体系。该体系涵盖评测基准 SoMBench、多参数版本社会心智模型 Zing 和智能体部署框架 Actio。

SoMBench 建立了能力坐标系,把 "懂不懂人" 分解为可定位的认知缺口;Zing 依据诊断结果组织自适应训练,让社会推理从依赖提示词的临时行为,转化为模型参数中的稳定能力;Actio 则通过技能、心智状态、经验和社会知识的动态组织,为部署提供可选择、可检查的支持。这是一条贯通 "评测 — 内化 — 行动" 的完整技术链路。
三者共同指向一条技术路径:社会智能不再只是模型表现出来的一种模糊 "情商",而开始成为具有评测工具、训练方法和运行时接口的工程对象。这正是让大模型从 “能说会道” 走向 “值得托付” 的关键一步。
在 5 项国际权威社会心智评测基准上,多模态模型 Zing-27B 综合均值超越 GPT-5.5;文本模型 Zing-32B 与 DeepSeek-V4-Pro 水平相当;轻量级模型 Zing-8B/14B 则以极小参数量,在高阶信念推理基准 HiToM 上超越参数量为其数十倍的基线模型。
SoMBench:社会心智 “体检系统”
SoMBench 围绕心智表征、社会交互和规范内化三大能力构建,覆盖 17 个二级维度、71 项细粒度任务,包含 3,481 道经 15 名专家评审、87% 严格保留的实例。通过多题型交叉验证、选项扰动、捷径检测等手段,SoMBench 不仅给出分数,还精准定位模型的错误模式,为后续训练指明方向。
在 20 个顶级模型的测试中,最强模型正确率仅 72.08%,17 个次级维度无一达到 90% 天花板。这意味着即便是最先进的大模型,在系统性的社会心智评测中仍有近三成的能力缺口。SoMBench作为最新的社会心智评测基准,当前主流模型仍有较大提升空间,也为下一步迭代指明了重点方向。

知境・SoMBench 评测维度指标分类体系图
Zing:训练目标随能力一起进化
Zing 没有采用 "固定题库、固定损失函数" 的传统训练方式,而是构建了一套会 "自我进化" 的训练系统。当模型在诊断集上暴露短板时,FLARE 数据飞轮定位到具体认知维度,针对性合成全新的训练样本 —— 语义、场景、推理路径都与原题不同,但瞄准同一种能力缺陷。FLARE 的诊断集与评测集严格隔离,评测集在开发全流程中完全冻结,不参与任何数据合成或训练。
训练分两阶段推进:第一阶段建立通用社会心智基础,采用 Mixed-Reward GRPO 强化学习框架,动态组合过程奖励与可验证奖励;第二阶段针对情绪理解、意图推断、社会规范、视角采择等专项能力进行强化。OPD 在线蒸馏则在强化学习过程中引入教师模型的 token 级分布约束,防止模型在探索更优路径时偏离已验证的有效推理模式。
FLARE 解决 "学什么",两阶段训练安排 "什么时候学",OPD 负责 "向谁学、不忘什么"——Zing 构建的是一套随模型能力状态持续自适应的进化系统。

知境·Zing 训练流程概览图
Actio:让部署按需调用
Actio 以 Harness 为统一编排核心,根据任务心智变量和推理需求,选择性激活四类支撑模块:PRISM 提供 76 项分层心理与社交技能;Starling Memory 显式记录 "谁、何时、相信什么";SAGE 沉淀跨任务可复用推理经验;Gated RAG 按需检索社会文化知识。

知境・Actio 系统总览图
Zing-27B 多模态模型综合均值超越 GPT-5.5
在 5 项国际权威社会心智评测基准上,多模态模型 Zing-27B 综合均值达到 79.80,超越 GPT-5.5 的 78.44。

知境・Zing 在 5 项社会心智能力评测中的性能对比表
其中,HiToM 评测的是 "我知道你知道我知道" 的递归信念追踪能力,阶数越高难度指数级增长。Zing-27B 以 82.00 超越 GPT-5.5 的 77.92,成为首个在该基准上超越 GPT-5.5 的百亿参数规模公开模型。
Zing-32B 文本模型比肩 DeepSeek-V4-Pro
文本模型 Zing-32B 在 5 项基准综合均值上达到 76.14,与 DeepSeek-V4-Pro 的 75.90 水平相当。
在 EmoBench 情感推理基准上,Zing-32B 以 77.25 大幅领先 DeepSeek-V4-Pro 的 71.88,差距达 5.37 个百分点。这表明知境的专项社会心智训练在情感理解维度上形成了显著优势。
Zing-8B/14B 以小博大,高阶心智超越数十倍参数规模大模型
在高阶信念推理基准 HiToM 上,Zing-8B 与 Zing-14B 以极小参数量实现了对数十倍规模基线模型的超越。

递归阶数越高,难度呈指数级增长。Zing-8B 在三阶信念推理上达到 67.50%(基线 45.83%),四阶达到 65.83%(基线 43.75%),分别提升 21.67 和 22.08 个百分点。
这证明了社会智能的提升来自训练方法的结构化,而非参数的单纯放大。
知境的社会心智能力,未来可探索三个真实世界的延伸方向。
赋能一:让机器人从 "能动手" 到 "能动心" 。当前机器人能端茶倒水,但读不懂意图。知境 8B/14B 小模型可嵌入端侧,让机器人推断 "主人皱眉是茶太烫还是心情不好"。家庭看护、协作陪伴等场景,未来可期。
赋能二:让复杂决策从 "拍脑袋" 到 "先彩排" 。复杂决策的代价往往不是算错数,而是算漏了人心。知境能力未来可应用于商业决策、团队协作等推演 —— 不是预测未来,是帮决策者在行动前,提前看见不同选择可能引发的连锁影响。就像彩排,先推演一遍,再上场。
赋能三:让多智能体从 "各说各话" 到 "同频共振"。 人类、机器人、AI Agent 协作时,最大风险是 "你以为我懂了,我以为你懂了"。知境框架未来可提供统一心智状态协议,让不同智能体在同一社会认知坐标系下协作 —— 不是简单的信息同步,是 "我知道你知道我知道" 的递归共识。
参考链接:《知境:让AI理解心智,融入社会》
文章来自于"机器之心",作者 "机器之心"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0