科技虎嗅·叶小钗··AI 生成
AI 圈又在造神?这次我想给Jev 泼点冷水
文章认为Jev本质上是一个面向程序调用的语义判断器,通过预设答案范围、RLCD训练等技术实现了低成本、高速度,其切入的场景(意图分类、槽位抽取等)确实有价值。但作者从AI工程实践角度指出:Jev并非真正的「系统一」(快系统),而是将大模型的文本生成替换为选择,快慢系统的核心在于逻辑链完整性而非模型速度;且实际效果可能不佳(成本优势有限,准确率下降约5个百分点)。对于深耕AI落地的工程团队,Jev值得关注但不宜过度追捧,其能力边界清晰,很快会被同类模型跟进。原文 ↗原文 ↗
核心观点
- ▍Jev是一个面向程序调用的语义判断器,核心价值是用更低成本替代通用大模型做意图分类、槽位抽取等小判断,但它并非真正的「系统一」,也不代表大模型是「系统二」。
- ▍Jev的能力边界清晰:只能处理预设答案范围内的选择题,准确率比通用大模型低约5个百分点,对判断错代价高的业务场景并不划算。
- 01Jev通过预设答案范围(type: choice/noul)和并行采样器实现速度优势,输出是概率分布而非生成文本,一次请求内的多个问题可同时计算。
- 02Jev采用RLCD(面向校准决策的强化学习)训练,目标使模型输出概率(如「90%是退款」)与真实统计概率一致,从而提供可置信的置信度。
- 03根据引用数据,Jev费用约为对照模型的六分之一,但准确率低约5个百分点;社群反馈显示「意图分析太简单」「推荐回复有点2」。
- 04在Jev出现前,业界通常采用小模型微调处理标准化/归一化任务(意图分类、槽位抽取、脏数据纠正),但数据整理、标注、训练、维护成本同样不低。
- 05作者认为,在AI工程中所谓「快系统」负责理解复杂人话,而「慢系统」需将具体检查逻辑明确写出来(如医疗案例中引入专家系统做规则校验),速度本身不决定快慢,逻辑链完整性才是关键。
反方 / 局限
- — Jev官方及部分自媒体将其类比为「系统一」(直觉快系统),但作者指出这是概念误用:大模型即便多步推理也不等于系统二,因为其推理过程并未遵循明写的业务规则。
- — Jev的便宜是以准确率下降为代价换来的,对于判断错误成本高的场景(如医疗、金融等),省下的token费用可能远不足以覆盖错误损失。
- — 作者预测这类能力很快会被通用大模型以类似功能(如GPT的function calling、专有小型后缀模型)覆盖,Jev的先发优势期可能很短。
12 分钟 · 4 卡片 · 12 资料
读原文 →前置背景
技术原理
未来推演
延伸追问