7.8
深览指数
科技虎嗅·HavenlonLabs··AI 生成

AI时代,那些藏在安全背后的数学理论

文章指出,当AI从内容生成器变为能执行转账、控制设备等真实操作的执行系统时,不能再用“正确率”这一单一指标衡量安全。作者用七个中学数学视角(风险期望、零事故概率、罕见事故代价、独立审批、置信度与全链路可靠性、最终边界设计)拆解了AI执行安全的常见认知误区,核心结论是:安全系统应假设错误迟早会发生,并设计简单、独立、可靠的最终边界来限制错误造成的破坏,而非仅追求提高正确率。适合对AI落地的风险控制、系统安全设计有兴趣的读者。原文 ↗

核心观点
  • AI执行系统的安全不能仅靠“正确率”衡量,因为正确率将所有错误等额计数,忽略了不同错误后果的天壤之别;安全的核心是“限制错误的代价”而非“减少错误的数量”。
  • 真正的安全系统应假设错误迟早会发生,并设计一道简单、独立、保守的最终边界,在所有判断和弹性失效后,仍能守住“绝对不能做的事”这条底线。
  1. 01利用“风险=概率×损失”公式,一个概率仅为万分之一、但每次损失一亿元的事故,期望风险仍高达一万元,且这种极端损失无法被平均值消化,可能直接导致企业倒闭。
  2. 02通过“一次都不出事的概率=(1-p)^n”公式,即使系统存在十万分之一的风险,运行一万次后仍有约90%的概率观测不到任何事故,证明“长期稳定运行”不等于“风险为零”。
  3. 03在串联系统中,即使每个环节都99%可靠,五个环节串联后整体可靠度降至约95.1%,十个环节则跌至约90%。环节越多,整体不确定性越大,系统反而更脆弱。
  4. 04多数决策的有效性依赖信息独立性。若三个审批者阅读同一份有误的摘要,则“三人同意”只是同一个错误被确认了三次,而非三次独立判断,无法有效降低风险。
  5. 05AI的“90%置信度”仅代表模型对自身判断的评分,不等于现实中的“90%安全”。真实执行还依赖输入、数据、审批、策略、设备等多个环节,整条链路的可靠性远低于模型置信度。
反方 / 局限
  • 文章的主要论点(安全应优先于效率)隐含了“安全设计”会带来额外的成本(如更复杂的流程、更严格的审批、更保守的边界),但作者并未深入讨论当安全成本过高、影响到了系统正常效率或业务敏捷性时,应如何权衡与取舍。
  • 文中提到的“最后一道边界”设计原则(简单、独立、保守),在理论上是清晰的,但在实际复杂的AI系统中,定义“绝对不能做的事”的边界本身可能极其困难,且“简单”的规则可能无法覆盖所有需要限制的边界场景,作者未讨论这一实践的挑战。
10 分钟 · 4 卡片 · 6 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问