8.3
深览指数
产品人人都是产品经理·小普··AI 生成

Jev 刷屏时,我用五个问题判断它值不值得接

作者将刷屏的 AI 模型 Jev 接入真实产品审核流程,30 场面试复盘无一自动通过,20 小时内将其从审核流程撤下。文章详细复盘了踩坑过程:照搬官方阈值、一道题塞三个条件等错误,最终只保留判重场景。核心结论是 Jev 不是通用大模型,而是一个「只做判断题的专用零件」,放对位置能省事,放错只会添麻烦。适合正考虑接入新模型、或想从评测跟风转向实战决策的产品与技术人员阅读。原文 ↗

核心观点
  • ▍Jev 不是一个更强的生成式 AI,它是一个只做判断题的专用零件,适合嵌在流程里做又快又稳的判断,但放在需要开放理解或模糊判断的场景只会添麻烦。
  • ▍下次再有技术刷屏,不应被宣传数字说服,而应依次追问:它替代的是谁?宣传数字在你的场景里还剩多少?它说的「好」是哪一层的好?接进来复杂度转移给了谁?算总账值不值?
  1. 01作者将 Jev 接入真实面试复盘审核流程,设置 0.9 自动放行线(照搬官方案例),30 场真实数据跑下来,0 场自动通过,全部转人工。
  2. 02作者最初将「公司名是真实的、轮次合理、题目是面试官问的」三个条件塞进一道题,导致公司名脏数据(如「红熊AI_」)将多场正常面试拉到 0.30-0.45;改成只问「题目是不是面试官真实问的」后,分数集中在 0.40-0.55。
  3. 03Jev 的 193.6 倍快、444.6 倍便宜来自 TypeSafe 自建工作流评测,对比对象含需先推理的前沿模型;第三方 791 条标注数据测试中,延迟优势约为 2-3.6 倍。
  4. 04官方图表「零幻觉」下方小字注明「This number is not empirical」——该 0% 保证的是输出格式不跑出选项,而非业务判断正确。
  5. 05作者的实际账单:两万五千多次判重,Jev 花费约 3 元;若用 DeepSeek 粗算约 6-12 元。省下的就是几块钱。
  6. 06Jev 面试场景中耗时中位数约 256ms,DeepSeek 约 461ms;海龟汤场景中 Jev 15 题一次请求约 733ms,DeepSeek 一题一题调约 16s。
  7. 07海龟汤测试中,15 道经典汤题的英文答案全部正确;中文答案也正确,但概率不及英文集中——例如「服务员骗了他吗」英文 0.95,中文 0.62-0.77。
  8. 08Jev 的判断:判重继续跑 Jev(同义题多次给到 0.93 左右),审核换成了规则 + DeepSeek + 人工一键确认。
反方 / 局限
  • — 作者承认自己「连『合格』都没定义清楚」就照搬了阈值;他接 Jev 的本意是「少看几篇」,结果「一篇没少」,复杂度从模型端转移到了写题、调阈值和结果加工上。
  • — 官方承认 Jev 对日期、计数等不擅长(但作者的自测中两道简单题均答对);中文虽能处理但不及英文好。硅星人测试中,50 道中文客服题 Jev 正确率仅 30%,且 15 次重复中有 3 道题答案在对错间跳跃。
42 分钟 · 5 卡片 · 11 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问