8.0
深览指数
商业人人都是产品经理·楊yang··AI 生成

同一个豆包,两家机构差了1.46亿:AI应用半年考暴露的真问题

AI应用月活指标因统计口径差异(嵌入式入口/网页端)可产生1.46亿的差值,暴露出用移动互联网时代的度量衡衡量AI产品已全面失效。文章从三个失效现场展开:月活失真、声量与留存背离、增长数字混用不同口径,并指出双寡头格局(字节、阿里占七成月活)放大了指标偏差。作者以自身做内容识别产品时踩过的坑(离线评测高分但上线掉十几个点,根因是评价标准与用户体感不一致)类比,说明月活、声量、token调用量都是代理指标,与真实用户价值之间隔着一条沟。适合AI产品经理、投资人、数据分析师阅读,帮助校正对行业数据的判断。原文 ↗

核心观点
  • 月活、声量、token调用量等代理指标在AI产品身上已全面失效,行业至今没有长出属于自己的度量衡,只能一边跑一边试,这导致融资、立项、绩效等重大决策可能基于失真的数据。
  • 字节和阿里双寡头格局下,七成以上月活集中在超级App生态里,月活衡量的不再是产品好坏,而是入口流量大小,进一步放大了指标失效的后果。
  1. 01同一款豆包,2025年6月新京报AI研究院与Xsignal联合榜单显示月活5.28亿,QuestMobile同月AI原生App榜显示3.82亿,相差1.46亿,接近DeepSeek一整个产品的月活。
  2. 02元宝2025年春节除夕DAU冲至4054万,到2月23日剩768.5万,跌81%,一个月回到活动前水平,声量可以买到但留存买不到。
  3. 03行业在短短半年内换了三把尺子:DAU→TPD(每日token消耗量)→DAA(日活跃智能体),每一把都被下一把否定。
  4. 04Gartner在2025年3月研究报告建议AI负责人弱化token指标,理由是token反映成本而非产出,100万token没完成任务不如1万token把事办了。
  5. 05李彦宏2025年5月提出DAA指标,衡量每天有多少智能体在真实场景里完成至少一次任务闭环。
  6. 06火山引擎2025年6月披露豆包日均token调用量180万亿,但Gartner认为这仍是成本导向指标。
  7. 07作者亲身经历的内容识别项目:离线评测准确率九十几,上线掉十几个点,根因是评价标准与用户体感不一致——评测集拿规则对规则,用户不按规则活。
反方 / 局限
  • 文章承认“元宝月活从2月高点的1.14亿跌到6月的7900万,下滑近四成”这组数据本身是混用口径算出来的(1.14亿是腾讯口径,7900万来自Xsignal),说明行业分析报道自己也会犯同样的错误。
  • 作者给出的三个“立刻能用”的动作(问三句话、分两栏写代理指标与真实价值、配反向验证)本质上是工具性建议,回避了“在没有标准器的情况下,如何给AI产品定性和定价”这个更深层的行业难题。
9 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问