7.8
深览指数
科技腾讯新闻·数字生命卡兹克··AI 生成

AI说不出的随机数,成了鉴别套壳大模型最好的照妖镜

一篇论文发现,通过让AI模型反复生成1到100的随机数,可以统计出每个模型独特的概率分布,称为“行为指纹”。这种方法能低成本、高准确率地识别API中转站是否偷换模型,因为真正的随机数生成对AI来说几乎不可能。文章揭示了AI的“伪随机”源于其训练数据中的文化偏好,并提出了一种对抗性验证的轻量级协议,比传统的模型指纹识别方法更实用。适合关注AI安全、模型评估、API中转站可靠性的读者阅读。原文 ↗

核心观点
  • 每个AI模型在生成随机数、颜色等任务时,会表现出独一无二的、可测量的概率分布,即“行为指纹”,可用于低成本验证API端点是否被偷换模型。
  1. 01研究者托马什·布鲁克纳对165个AI模型,反复问“给我一个1到100的随机数”,每个模型30次,统计发现GPT-4o偏爱42、37和57,Claude Sonnet 5疯狂输出47,Llama 3.3多数是53,而Qwen3-Max全部回答42,无一例外。
  2. 02除了数字,研究还测了随机颜色、随机动物、随机城市、抛硬币等10类任务,共向OpenRouter发出32万6千条请求,结论一致:模型无法生成真正随机的结果。
  3. 03165个模型在随机数任务上的熵中位数仅为1.0 bit,远低于完全均匀分布应有的6.64 bit,说明回答高度集中、可预测。
  4. 04仅用8个探测单元(约120条请求),验证准确率误差率仅10.6%;用全部40个单元,误差率降至7.3%。
  5. 05一个名为Palmyra X5的端点,在OpenRouter上以自研旗舰身份售卖,但其行为指纹与通义千问开源模型Qwen3-235B几乎一致,相似度得分0.141,与同一模型在不同供应商部署的正常波动(0.140)无异。
  6. 06此前CISPA研究团队在2025年3月审计17家中转API,利用能力测试和模型指纹技术LLMmap,已发现多个疑似偷换模型的端点,但该方法较复杂。
反方 / 局限
  • 作者承认,模型仅在特定语义任务上表现出独特指纹,且不同部署环境导致的指纹波动(正常值约0.140)可能影响判断,需要建立阈值和校准。
  • 对于极少数真正能模拟随机分布的模型,或经过对抗性训练来掩盖指纹的模型,该方法可能失效。
11 分钟 · 4 卡片 · 8 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问