8.4
深览指数
科技Bestblogs·腾讯云开发者··AI 生成
JEV:一个不会写代码的模型,为什么拿下 4000 万美元?
本文深入解析了 TypeSafe AI 的 JEV 模型,其核心创新是将「判断」从 LLM 的「生成」中解耦,构建了一个低延迟、概率可校准的 System 1 模型。作者认为,这是 AI 架构从「一个模型包揽一切」转向「职能拆分」的必然产物。文章不仅解释了 JEV 如何通过非自回归并行采样和 RLCD 训练解决自回归模型的延迟与概率不可信问题,还提出了基于置信度阈值的分层 AI 系统架构。适合对 AI Agent 系统设计、模型推理优化和 LLM 落地实践有深入理解需求的读者。原文 ↗
核心观点
- ▍AI 系统架构正从「一个模型包揽一切」转向「按职能拆分」,将高频、时延敏感的判断任务拆分给专精的小模型(System 1),实现快慢思考解耦,这是降低算力成本、提升系统可靠性的关键演进方向。
- ▍JEV 模型的核心价值不在于「快」,而在于「概率校准」。通过 RLCD 训练,使模型输出的置信度与实际正确率吻合,让 0.9 的置信度可以真正作为 90% 的把握来使用,解决了 LLM 普遍存在的过度自信问题。
- 01自回归 LLM 处理分类、路由等控制流任务时存在三痛点:逐 Token 生成导致线性延迟;格式不稳定,需要大量 Prompt 工程和重试来保证输出符合预期;输出的置信度不可信,无法直接作为业务逻辑的 if-else 门限。
- 02JEV 模型在单张 A100 上可实现 100 微秒级别的延迟,且原生支持输出类型枚举及其对应概率,无需后处理解析。
- 03JEV 采用非自回归并行采样架构,在一次前向传播中直接预测每个候选类型的 logits,避免了自回归模型的序列化生成过程,从根本上解决了延迟与格式问题。
- 04RLCD 训练方法通过对比模型自身在不同噪声条件下的输出,找出「确定」与「不确定」的样本对,并学习将高置信度分配给通常正确、低置信度分配给可能错误的样本,从而实现概率校准。
- 05作者提出基于置信度闸门的分层架构:任何请求都先经过 System 1(如基于 ModernBERT 的决策器)做快速分类/路由,当置信度低于某个阈值(如 0.7)时,才升级到 System 2(如 GPT-4o、Claude)进行复杂推理。
- 06JEV 模型在 TypeSafe AI 的内部评估中,覆盖了约 80% 的路由和分类请求,相比只用 System 2,总体成本降低约 90%,延迟降低约 100 倍。
- 07作者提供了基于 ModernBERT(约 400M 参数)复现 JEV 类决策器的工程思路,包括数据收集、模型选择、RLCD 微调步骤,并指出该方案可直接作为上下文分类器使用。
反方 / 局限
- — 作者承认,JEV 无法用于需要非线性语义理解和复杂推理的场景。其本质仍是「分类器」,无法替代 VLM 进行图像描述,也无法替代长链推理模型进行数学证明。它的任务是判断,不是生成。
- — 作者暗示,JEV 在 4000 万美元融资后,其产品化的成功取决于能否说服现有 LLM 应用开发团队改变「一个模型解决所有问题」的惯性思维,主动拆分系统并引入阈值管理工程。
JEVTypeSafe AIRLCD (Reinforcement Learning from Contrastive Distances)System 1 / System 2 (快慢思考)ModernBERT非自回归 (Non-autoregressive)概率校准 (Probability Calibration)
3 分钟 · 4 卡片 · 12 资料
读原文 →