产品人人都是产品经理·叶小钗··AI 生成
Jev 是什么?与大模型有何区别,又能在 Agent 中做什么?
文章介绍了专为 Agent 场景设计的决策模型 Jev,它放弃文本生成,专注于并行输出候选类别的概率与评分,以极低成本和亚秒级延迟替代大模型处理分类、路由、条件判断等边界明确的任务。作者详细拆解了 Jev 的三种输出模式(Choice、Score、Noul),并给出在 Agent 流程中从任务分发、风险审核到结果检查等 6 个插入点的设计示例。适合正在优化 Agent 成本与效率的开发者阅读。原文 ↗原文 ↗
核心观点
- ▍Jev 是一种 System one 决策模型,通过为预定义的候选类别并行打分而非自回归生成文本,专门处理 Agent 中的分类、评分和条件判断,能以极低成本和亚秒级响应替代大模型执行这类边界明确的任务。
- 01Jev 使用 RLCD(面向校准决策的强化学习)方法训练,不仅追求判断准确,还确保模型给出概率的校准度——即模型报 95% 的概率时,实际有接近 95% 的案例符合该判断。
- 02TypeSafe 公布的基准测试显示,在四类工作流中 Jev 评测分数 67.8%,接近 Terra 的 67.9%,但每个案例平均耗时 0.4 秒(Terra 10.1 秒),平均费用 $0.0004(Terra $0.0304)。
- 03Jev 1.13 的定价为 0.042 美元/百万输入 token,输出免费;端到端响应时间为 70-500 毫秒;支持每次请求最多 64K tokens,但共享 state 加最长问题不能超过 32K tokens。
- 04Jev 的三种输出模式:Choice(从固定选项中选择一或多类)、Score(按线性标准打加权分)、Noul(返回条件成立的概率 0-1),且支持单次调用并行判断多个问题。
- 05文章给出 Jev 在 Agent 中的 6 个应用位置:任务分发判断、检索资料相关性评分、工具执行前风险判断、工具返回后决策(继续/重试/补充)、交付前质量检查、以及批量离线评估 Agent 表现。
反方 / 局限
- — 官方尚未公开 Jev 的参数量,并且警告输入中无关内容越多判断准确率可能越低,要求开发者先筛选信息,只保留当前判断需要的上下文。
- — Jev 的评测分数 67.8% 指向的是与 GPT-6 Astra 和 Claude Fable 5.1 高推理设置输出的平均值的吻合度,并非真实业务准确率,不能直接等同于可接受的业务表现。
18 分钟 · 5 卡片 · 12 资料
读原文 →概念锚点
前置背景
平行视角
未来推演
延伸追问