7.5
深览指数
科技TechCrunch·Lorenzo Franceschi-Bicchierai··AI 生成

AI 护栏如何阻碍进攻性网络安全研究人员的工作

AI 巨头为模型设置的安全护栏,初衷是防止恶意黑客利用,但正严重阻碍进攻性网络安全研究人员的正当工作。多位一线研究员指出,护栏在阻止防御者确认漏洞、分析可利用性方面制造了巨大障碍,反而迫使研究人员转向无限制的开源或中国模型。文章通过多位从业者的具体案例,揭示了AI安全护栏与真实攻防实践之间的根本矛盾:用于防御的工具本质上也是攻击工具,二者不可分割,当前的管控方式正在削弱防御方的能力。原文 ↗

核心观点
  • AI 安全护栏在阻止恶意黑客的同时,也严重阻碍了合法的网络安全研究人员进行漏洞发现和防御工作,且这种管控方式正在将研究人员推向无限制的国外开源模型。
  1. 01美国政府在2026年6月对 Anthropic 的 Mythos 和 Fable 模型实施出口管制,部分原因是担心其护栏被绕过用于恶意网络攻击。
  2. 02知名安全研究员 Mark Dowd 批评大型AI公司对“什么是安全的”进行武断决策,这令他感到不适。
  3. 03NCC Group 首席科学家 Chris Anley 指出,要求AI模型尝试利用漏洞是确认其真实性的关键步骤,但护栏会直接拒绝回答,从而损害防御者。
  4. 04Chris Anley 将AI工具比喻为“锤子”,既是建房工具,也是不可还原的武器,攻防属性无法剥离。
  5. 05Crowdfense 公司 CTO Paolo Stagno 表示,AI公司“本质上把客户当成需要保姆照顾的孩子”,其团队仅在逆向工程中使用前沿模型,而漏洞发现和利用开发则使用本地运行的开源模型以避免数据泄露。
  6. 06安全研究员 Giuseppe Cali 表示自己不使用AI进行进攻性工作,而是用于逆向工程和构建辅助工具,因此护栏不影响他,但他仍希望亲自掌控漏洞发现过程。
  7. 07RemoteThreat 公司 CEO Chris Thompson 称护栏不一致且每天变化,研究人员花费大量时间与模型“谈判”,而非处理核心安全问题,并因此被推向中国的开源模型如 GLM。
反方 / 局限
  • 少数研究人员(如Giuseppe Cali)认为护栏并未阻碍其工作,因为他们本就不依赖AI进行进攻性操作,仅将其作为辅助工具。
  • 文章未深入讨论AI护栏对阻止恶意黑客的实际效果,其有效性假设可能被过度简化。
16 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

平行视角

延伸追问