7.6
深览指数
科技量子位··AI 生成

AI最尴尬的短板,中国科学院出手了

中国科学院计算技术研究所‘知境’团队发布了一套从评测、训练到部署的完整技术体系,旨在将AI的‘社会心智’(即理解他人意图、情绪与社会规范的能力)从模糊的‘情商’转化为可测量、可训练的工程能力。其核心包括:用于精确定位模型认知缺陷的评测基准SoMBench、能自适应生成训练数据并动态调整奖励目标的训练系统Zing,以及用于在真实场景中按需激活社会心智能力的部署架构Actio。Zing-27B模型在多项社会心智基准上超越了GPT-5.5,证明了结构化训练方法而非参数堆砌的有效性。适合关心AI能力边界、人机协作、以及AI安全与可信度的研究者与从业者阅读。原文 ↗

核心观点
  • AI在语言和工具智能上取得突破,但在社会心智(理解他人意图、情绪、社会规范)上严重滞后,这已成为其从‘任务执行’走向‘社会协作’的关键瓶颈。
  • 社会心智可以被定义为一套可测量、可训练、可部署的工程能力,中科院‘知境’团队的技术体系(SoMBench + Zing + Actio)为此提供了完整的工程解决方案。
  1. 01‘知境’团队发布的SoMBench将社会心智拆解为3大一级维度、17个二级维度、71项细粒度任务,包含3481道经专家评审的实例,可精准定位模型的错误模式。
  2. 0220个顶级大模型在SoMBench上测试,最强模型正确率仅为72.08%,无一达到90%的天花板,表明社会心智是当前AI的普遍短板。
  3. 03Zing的训练系统包含FLARE数据飞轮(根据评测短板自动生成新训练样本)、两阶段训练(先通用后专精)和OPD在线蒸馏(防止遗忘),目标随模型能力自适应调整。
  4. 04Zing-27B(多模态)在五项国际社会心智评测中综合均值达79.80,超越GPT-5.5的78.44,尤其在HiToM(递归信念追踪)和EmoBench(情绪理解)上优势明显。
  5. 05Zing-8B在HiToM上达到78.08,在四阶信念推理上比同尺寸基座模型提升22.08个百分点,证明了训练方法的结构化设计优于参数堆砌。
  6. 06Actio部署架构通过‘按需调用’的方式,根据任务需求选择性激活心理技能(PRISM)、心智状态记忆(Starling Memory)、推理经验(SAGE)和社会知识(Gated RAG),避免信息过载。
反方 / 局限
  • 训练收益能否跨任务、跨文化迁移,以及Actio在长期真实交互中能否保持稳定与合宜,仍需要更广泛的验证。
  • 文章主要展示的是在已有基准上的评测结果,对于‘知境’技术在真实、开放、动态的社会交互场景中的表现,缺乏具体案例或用户反馈的支撑。
  • 文章对其技术路线的创新性描述较多,但未提及与学术界其他社会心智建模方法(如DeepMind的Theory of Mind网络)的详细对比,难以判断其‘结构化设计’的独特优势。
11 分钟 · 3 卡片 · 9 资料
读原文 →

前置背景

平行视角

未来推演