7.1
深览指数
产品人人都是产品经理·晚风··AI 生成

为什么 AI 产品需要体验评测

当大模型能力差距逐渐收窄,用户体验正成为 AI 产品商业化的关键变量。本文从用户研究者视角出发,系统论证了为何当下需要体系化开展 AI 体验评测,技术评测为何无法替代体验评测,以及互联网那套成熟框架为何不能直接照搬。作者认为,模型能力不再是决定产品商业成功的唯一因素,体验评测能帮助看懂用户、找到机会点。文章适合关注 AI 产品落地、用户体验设计的研究者和从业者阅读。原文 ↗

核心观点
  • ▍AI 产品体验评测需要在当下被体系化地开展,技术评测无法替代它,互联网的体验框架也不能直接照搬。
  • ▍模型能力差距收窄、用户规模激增且结构分化、商业化进入变现阶段,三个变化叠加使得体验评测的时机成熟。
  1. 01斯坦福 HAI 2026 报告显示,头部模型在竞技场得分差异在 25 分以内,而三年前 OpenAI 领先 Google 205 分。
  2. 02OpenAI 与哈佛等机构研究论文表明,多数用户用 AI 处理日常问答和写作,很少涉及复杂推理任务。
  3. 03QuestMobile 数据显示,2026 年 6 月国内 AI 原生 App 月活接近 5 亿,同比增长 85.4%,其中 60 后用户增加 1660 万,三线及以下城市用户增加 9126 万。
  4. 04腾讯研究院 T-ask 调研显示国内 AI 用户付费比例约 9.8%,《中国新闻周刊》报告显示超七成人每年 AI 花费不超过 200 元。
  5. 05毕马威调研显示,88% 的企业在投资 Agentic AI 系统建设,但仅 24% 能在多个用例中实现投资回报。
  6. 06AI 产品与互联网产品存在三大根本差异:交互范式从图形界面变为自然语言、影响体验的因素更多(模型能力、用户自身因素)、体验水平随时间和模型迭代变化更大。
  7. 07AI 产品存在幻觉、上下文遗忘、谄媚、不认错、输出不稳定等互联网产品没有的典型体验问题。
反方 / 局限
  • — 作者承认模型能力仍然是基石,仍有产品靠能力断层保持领先,体验评测并不能完全替代技术路径的突破。
  • — 文章主要基于用户研究者的视角论证,但并未深入探讨在资源有限的情况下,开展体系化体验评测的成本与 ROI 是否对中小团队成立。
  • — 文中引用的用户付费比例等数据暗示商业变现困难,但作者并未进一步分析体验评测改善与付费转化之间的具体因果链路。
10 分钟 · 3 卡片 · 5 资料
读原文 →

概念锚点

前置背景

延伸追问