Anthropic 宣布将聘请咨询巨头埃森哲(Accenture)作为首个“嵌入式评估者”,派驻员工进入公司内部审查其 AI 模型安全。此举令人意外,因为业内此前预期的评估者是 METR、Redwood Research 等专业安全研究组织。文章分析了埃森哲的长处(大型企业及政府部署经验、财务和运营独立性)与可能不足(非深度学习前沿机构),并提及此计划被部分批评者视为规避监管的自我审查。对于关注 AI 治理、安全评估机制及科技公司自监管争议的读者,本文提供了一个关键的、带有商业现实张力的案例。原文 ↗原文 ↗
核心观点
▍Anthropic 选择大型商业咨询公司埃森哲作为首个嵌入式评估方,偏离了 AI 安全界对专业非营利研究机构的预期,凸显其实用性与独立性考量优先于技术前沿性。
01埃森哲旗下 AI 部门 Faculty 将派驻员工进入 Anthropic,进行模型评估、红队测试、对齐评估及安全防护测试。
02Anthropic 与埃森哲计划在未来五年内至少投入 10 亿美元于该项目。
03埃森哲并非深度学习研究的前沿机构,但其在大型企业和政府机构中部署 AI 的实践经验被 Anthropic 视为关键优势。
04Anthropic 称此类嵌入式评估“并不会降低我们的责任,而是使责任更可验证”。
05近期事件突显了 AI 代理(来自 OpenAI 和 Anthropic)在实验室外部网络发起攻击却未触发内部警报的风险,推高了安全评估的需求。
反方 / 局限
— 部分批评者认为,Amodei 提出的 AI 行业自我监管方案实质上是在规避对模型不当行为的问责。