7.2
深览指数
科技虎嗅·Luis屠龙术··AI 生成
让几万个AI替人类试错,一门“预演未来”的生意正在崛起
文章介绍了硅谷兴起的一项前沿技术——用户模拟(User Simulation),即用成千上万个AI智能体模拟人类群体决策行为,构建一个可“预测未来”的沙盘。作者作为从业者,详细阐述了该技术的五层架构、代表性公司(Simile与Aaru)的融资与技术路径、以及电商等垂直领域的商业落地案例。文章的核心贡献在于清晰区分了“用户模拟”与“简单AI扮演”的差异,并指出其价值在于为A/B测试等真实决策提供“预飞检查”,而非替代真实用户。适合对AI前沿应用、商业预判或技术产品经理阅读。原文 ↗
核心观点
- ▍基于AI Agent的用户模拟技术,正在从概念验证走向商业落地,其核心价值不是替代真实用户验证,而是作为“预飞检查”,在投入大量资源前剪除明显失败的方案,提升决策效率。
- 01用户模拟技术被划分为五个层级:数据与场景模拟、交互模拟、用户旅程与环境模拟、个体深度模拟、群体智能与预测市场,分别解决不同层次的问题。
- 02Simile(斯坦福HCI实验室孵化)通过两小时深度访谈+结构化问卷模拟个体,将准确率提升10%-15%,并缓解了“说做不一”问题。
- 03Aaru(与安永合作)声称能在一天内复现需要数月的调研结果,相关性高达0.9,但其预测能力在数据稀缺的局部场景(如萨克拉门托市长选举)中可能受限。
- 04UserApproved AI聚焦电商/DTC品牌,通过接入GA4、Shopify等真实数据,让AI智能体在虚拟环境中完成购物行为,每日输出“今天做三件事,收入可涨5万美元”的决策建议。
- 05大模型直接充当模拟用户时,容易出现“应声虫”效应,即过度放大微小细节并给出夸张结论,无法直接用于A/B测试打分。
反方 / 局限
- — 用户模拟无法取代A/B测试,其价值在于“预飞检查”。并且,即使使用同一用户模拟agent,重复测试的结果可能不一致,因为人类行为本身存在方差,需要复杂的校准指标。
- — 预训练模型自带互联网偏见、少数群体代表性不足、算法谄媚导致的“回声壁”效应,是用户模拟技术难以根除的固有问题,单纯靠更强的基模无法解决。
用户模拟UserApproved AISimileAaruReynold斯坦福大学HCI实验室安永(EY)Google AssistantGmailA/B测试SmallvilleGUM(General User Models)
11 分钟 · 4 卡片 · 11 资料
读原文 →