7.7
深览指数
科技腾讯新闻··AI 生成

ChatGPT早期研究者做了一个“不会说话”的AI,Jev真是新范式吗?

Jev是一个“只会判断、不会生成文本”的AI模型,由前OpenAI研究员Diogo Almeida创立。它旨在解决Agent内部的中间推理步骤浪费大量Token生成无用文字的问题,宣称速度比前沿大模型快193倍、便宜444倍。文章冷静分析了Jev的潜力(结构化输出、校准概率)与炒作(评测有偏差、零幻觉被误读、本质是一个带LLM语义理解能力的分类器),并指出社区观点分化严重。本文适合对AI Agent架构、成本效率有深入兴趣的读者,可快速看清Jev的实际价值和噱头边界。原文 ↗

核心观点
  • Jev的核心价值在于提示了一个常被忽视的工程事实:Agent内部的绝大多数模型调用(路由、分类、状态判断)不需要生成式文本,只需要结构化选择或概率,专门为此优化的Decision Model在成本和延迟上可大幅优于通用LLM。
  1. 01Jev在TypeSafe官方设计的四类工作流评测中,以约0.0004美元/次和0.4秒延迟,获得了接近前沿模型(68%-74%)的平均得分(67.8%),速度最高比对照模型快193.6倍、便宜444.6倍。
  2. 02Jev定义了三种输出格式:Choice(预设选项中选择)、Score(等级/连续评分)、Noul(yes/no带概率),软件可直接拿来作为控制流if语句使用。
  3. 03TypeSafe宣称Jev采用新的parallel sampler,可一次查询同时回答多个相互独立的问题,如同时判断发票类型、异常风险、审批级别。
  4. 04公司提出RLCD训练范式,专注于让模型输出的置信度概率本身可信(calibration),如当模型对一批任务给出90%置信度,实际应有约90%判断正确。
  5. 05创始人Diogo Almeida是InstructGPT论文的主要作者和RLHF流程的早期建立者,创业公司TypeSafe AI刚完成DCVC领投的4000万美元种子轮融资,估值约2亿美元。
反方 / 局限
  • TypeSafe公布的性能对比数据(193倍快、444倍便宜)是在其设计的、最适合Jev的四类任务上得出的最大差距,且测试由公司自己完成,可能存在偏差;部分参考答案还来自强模型生成,并非人工标注的ground truth。
  • Jev的“Zero Hallucinations”仅指类型错误的格式约束(输出不会超出预定义选项),并不消除事实和判断层面的错误,用户可能误解。
  • Jev的对手不仅是GPT/Claude等昂贵前沿模型,还包括Flash小模型+Constrained Decoding、传统分类器和Embedding分类器,后者在选择型任务上成本可能更低,目前缺乏直接公平的对比测试。
12 分钟 · 5 卡片 · 13 资料
读原文 →

前置背景

技术原理

平行视角

未来推演

延伸追问