7.4
深览指数
科技人人都是产品经理·赛博禅心··AI 生成

从 Token-Maxxing,到 Token-Minimizing

文章核心判断:AI 行业正从“猛烧 Token、拼谁用得多”的探索阶段,转向“精算 Token、压低每份合格交付总成本”的务实阶段。作者提出“Token-Maxxing”(词元天尊/全民养虾)和“Token-Minimizing”两个概念,对比了 Meta 早期按用量排名、鼓励用 Agent 并行探索的做法,与当下 DeepSeek、GLM、百灵等推出廉价 Flash 模型后的成本核算逻辑。文章结合外滩大会百灵团队案例,指出真正有效的 Token-Minimizing 不是单纯省钱,而是要降低包括人力复核在内的“端到端总成本”,甚至要奖励模型“不知道就拒答”以减少错误。适合产品经理、AI 应用开发者、技术决策者阅读。原文 ↗

核心观点
  • AI 行业正在从 Token-Maxxing(拼消耗、猛烧 Token)阶段,进入 Token-Minimizing(精算每份智力的产出)阶段。
  1. 01Meta 内部曾按 Token 用量给员工排名,授予“Token Legend”(词元天尊)称号;国内也称此现象为“全民养虾”。
  2. 02早期用 Agent 探索是合理的——浪费一些计算,好过错失可能;但随后出现“空烧”,如把额度用于解答哥德巴赫猜想或转卖公司 Token 资源。
  3. 03厂商纷纷推出 Flash 级口粮模型,标准:智力在 Opus 4.6 以上、价格是头部模型 1/10 以内、速度 100 token/s 以上,例如 DeepSeek V4.1-Flash 价格为 Opus 4.8 的 1/10,GLM-5.3-Flash 为 Opus 4.8 的 1/40。
  4. 04百灵团队阿福负责人指出,用户规模上来后推理成本极高,且 C 端用户等 5 秒就会流失;当小模型跨过业务水位线,选型标准从“谁最聪明”变为“在足够聪明下更快、更便宜、更稳定”。
  5. 05百灵推出金融增强模型 Ling-3.0-flash-Fin(124B 总参数、5.1B 激活参数),演示中能读取财报和 5000 余公式的 Excel,完成更新预测值、处理跨表依赖等任务。
  6. 06蚂蚁集团联合中金发布 FinFIRST 评测基准,由 50 余名金融专家设计,从结果、过程、证据三层面评估模型,并提高了对拒答的奖励——不知道时宁愿告诉用户不知道。
反方 / 局限
  • Token-Minimizing 若只理解为“省 Token”则过于狭窄;真正的总成本包括“人力+Token”,为省 Token 耗费大量人力(如反复复核)是得不偿失的。
  • 当前 Benchmark 机制在严肃场景下存在缺陷——它鼓励模型“尽量答”,即使不确定也猜一个,导致金融场景中出现几十种互相冲突的口径,增加人工判断负担。
  • 文章暗示,旗舰模型(如 Fable)的溢价中很大一部分是“时间优势”,六个月后的 Flash 模型可能就能赶上,这意味着高价旗舰的不可替代性可能快速下降。
11 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

未来推演

延伸追问