7.8
深览指数
科技Bestblogs·AI Engineer··AI 生成
让 AI 智能体执行 Bash 后,我们如何构建安全护栏|PostHog 的 Sarah Sanders
PostHog 上下文工程师 Sarah Sanders 分享了他们为 AI 智能体(Wizard)构建安全护栏的实践经验。核心观点是:提示词不是安全机制,必须依赖确定性的扫描规则(如 YARA)和默认拒绝的控制策略来构建纵深防御。文章详细介绍了从上下文供应链风险到具体防线设计的思考,适合正在构建或评估 AI 智能体安全架构的技术负责人和开发者阅读。原文 ↗
核心观点
- ▍具备代码库访问和 Bash 执行能力的 AI 智能体,其安全防线不能依赖提示词引导,必须依靠确定性的、机械化的执行门禁(如 YARA 规则)实现纵深防御,LLM 仅用于辅助识别误报。
- ▍智能体的「上下文供应链」——文档、提示词、示例代码、外部贡献——是最大且最易被忽视的攻击面,其中任何一环被投毒,都可能影响在开发者机器上运行的智能体。
- 01PostHog 的 Wizard 智能体能主动读取项目代码、选择并安装 SDK、创建仪表盘,其能力已从单纯的 CLI 引导演变为一个具有破坏潜力的代理程序。
- 02PostHog 采用的防线包括:默认拒绝所有 Bash 命令、仅允许使用经过审核的软件包、隔离环境文件和密钥、沙箱隔离运行时。
- 03Warlock 扫描器在构建技能和实际使用时两个阶段执行检查,使用 YARA 规则进行确定性匹配,一旦命中威胁模式即先行阻断,再询问 LLM 判定是否为误报。
- 04攻击常在系统内各组件组合时发生,例如将「安装 npm 包」命令与「从外部 URL 拉取脚本」功能结合,单看每个组件可能无害。
反方 / 局限
- — 尽管采用多层防御,作者承认规则设计存在挑战:看似无害的组件组合仍可能形成漏洞,而开发者通常一次只审查一个变更,难以发现组合风险。
3 分钟 · 4 卡片 · 8 资料
读原文 →