7.5
深览指数
科技TechCrunch·Rebecca Bellan··AI 生成
开源权重 AI 模型正在追赶前沿,安全差距依然存在
SaferAI 报告显示,中国 Z.ai 的开放权重模型 GLM-5.2 在网络与生物能力上仅落后 OpenAI 和 Anthropic 前沿模型几个月,但在安全测试中几乎未拒绝任何危险任务,而 Claude Opus 4.7 则因拒绝率过高无法完成测试。这凸显了开放权重模型能力快速逼近前沿,但安全防护几乎为零的困境。文章深入分析了预训练数据过滤、API 级控制等现有手段的局限,以及中美在 AI 安全风险认知上的根本差异。适合关注 AI 治理、开源安全与中美科技政策的读者。原文 ↗
核心观点
- ▍开放权重 AI 模型的能力正向闭源前沿模型快速逼近,但其安全防护措施严重缺失,两者之间的能力-安全差距正在扩大。
- 01SaferAI 报告指出,GLM-5.2 在网络安全和双用途生物能力上仅落后 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.7 几个月。
- 02SaferAI 通过 Z.ai 的公开 API 评估 GLM-5.2 时,该模型没有拒绝任何被给予的进攻性网络或双用途生物任务。
- 03相比之下,Claude Opus 4.7 因拒绝率极高,以至于 SaferAI 根本无法对其进行 CyberGym 基准测试。
- 04开放权重模型一旦被下载,其权重可被自由修改、微调或移除防护,导致任何安全措施失效。
- 05Far.ai 发现,包括 xAI 的 Grok 4.5 和 Google DeepMind 的 Gemini 3.1 Pro 在内的前沿模型,存在数百种通用越狱方法。
- 06Anthropic 的 Opus 5 系统卡显示,其限制模型仅能在未编译源码中搜索漏洞,以增加攻防成本。
- 07SaferAI 称 Z.ai 在发布 GLM-5.2 前未发布安全框架、预部署测试承诺或风险评估。
- 08Hugging Face 的 CEO 公开表示,GLM-5.2 帮助该公司防御了 OpenAI 对其平台的攻击,并以之作为开放权重有利于网络防御的论据。
反方 / 局限
- — Hugging Face CEO 认为开放权重让防御方也能利用先进模型,但 SaferAI 执行主任反驳称,攻击者采用新工具的速度通常快于防御方(如勒索软件团伙一周内可改变方法,医院则无法做到)。
- — 文章提到,预训练数据过滤可减少有害生物知识,但用于网络安全则非常不切实际,因为训练一个优秀的通用编码模型,很难不使其同时成为优秀的黑客。
GLM-5.2SaferAIZ.aiOpenAIAnthropicGPT-5.5Claude Opus 4.7CyberGymFar.aiHugging FaceHenry PapadatosGraham WebsterClem Delangue习近平斯坦福网络政策中心
17 分钟 · 3 卡片 · 9 资料
读原文 →