科技虎嗅·宋思杭··AI 生成
智谱“拿走”了什么?
本文围绕智谱ZCode被曝默认上传用户完整Git仓库至云端的事件展开,核心论点是指出这并非简单的产品配置失误,而是模型厂商利用用户不知情的数据(特别是代码)进行训练的严重问题。作者认为,数据控制权转移比数据是否被用于训练更关键,并指出智谱选择使用用户交互数据(而非公开数据)进行训练,实质上是以用户隐私换取高价值数据,风险与收益不对等。文章适合关注AI行业数据治理、企业数据安全及AI产品伦理的读者阅读。原文 ↗原文 ↗
核心观点
- ▍智谱ZCode默认上传完整Git仓库事件,本质是模型厂商以用户隐私换取高价值训练数据,风险由用户承担而收益归厂商,而非简单的产品功能配置失误。
- ▍数据控制权一旦发生转移(上传至云端),即使厂商声称删除,用户也无法验证其是否被用于日志、缓存、备份或后续模型训练流程。
- 012024年9月18日,有开发者发现智谱ZCode在默认开启“代码库索引”功能时,会将用户工作区及完整Git历史打包上传至云端。
- 02Git历史中可能包含未发布功能、被删除的文件、本地分支、提交者信息,以及开发者误传后删除的密钥,对软件公司而言相当于暴露研发过程、产品路线和内部资产。
- 03智谱后续致歉,称上传数据用于生成Repo Wiki,并在页面生成后立即销毁。
- 04文章指出,大模型训练数据来源分为两类:公开数据/合成数据,以及真实用户交互数据。智谱选择后者,即利用用户提交的问题、模型生成的代码及开发者修改结果作为训练样本。
反方 / 局限
- — 文章承认,目前尚无公开证据证明上传的代码已被用于智谱的模型训练,但作者认为这并不能解除智谱的责任,需要其进一步披露数据流向并提供第三方审计。
前置背景
平行视角
未来推演
延伸追问