7.7
深览指数
产品虎嗅·硅星人··AI 生成
实测Jev:没那么强,但足够给有些乏味的AI圈带来新刺激
本文实测了TypeSafe推出的新模型Jev,它是一款不生成文本、专用于快速判断的"System One Model"。测试结果显示,在50道电商客服选择题中,Jev的准确率(约64%-65.2%)在同等价位模型中并非最优,但速度极快(平均0.73-0.75秒/题)且成本极低(50题约0.002美元)。文章分析了其设计理念——为软件服务而非为人类聊天而生——背后的明星团队(核心成员来自OpenAI InstructGPT团队)以及给当前略显乏味的AI圈带来的思维刺激。适合关注AI产品方向、模型架构创新与工程落地的深度读者阅读。原文 ↗
核心观点
- ▍Jev的价值不在于它比现有大模型更聪明,而在于它提供了一种新的模型分工范式:专注于边界清晰的小判断任务,服务于软件执行流程而非人类聊天,从而可能降低AI自动化系统的成本和延迟。
- 01在50道电商客服选择题测试中,Jev的准确率约为64%-65.2%,在便宜小模型组中排第二,比DeepSeek V4 Flash低约1.2分。
- 02Jev速度极快,平均每道题响应时间约0.73-0.75秒;成本极低,50道题总成本约0.002美元,均为测试中的最低值。
- 03相比之下,DeepSeek V4 Flash虽准确率略高,但平均每题需要5.58秒,成本约为Jev的2.5倍。
- 04更强的模型如MiniMax M3准确率高出约10.8个百分点,但50道题成本仅多约0.0035美元,时间约1.80秒/题,差距并不悬殊。
- 05Jev并非不会犯错,官方宣传的"零幻觉"仅指其输出格式不会跑出预设的schema(如不会产生不存在的选项),但判断结果本身仍可能出错。
- 06测试中Jev的一些失分卡在了阈值附近(如给出1.99分而人工标准是2.00分),且重复测试中出现过通过和失分交替的情况,说明其校准结果在阈值附近仍有波动。
- 07Jev背后的创始人Diogo Almeida曾是OpenAI InstructGPT论文的作者之一,其团队认为未来大规模AI自动化中99%的交互可能发生在机器之间。
反方 / 局限
- — 文章明确承认,Jev的准确率在同等价位模型中并非顶尖,对于准确率敏感的业务,多花一点成本换取更高准确率可能是更优选择。
- — 文章指出,Jev在阈值附近的概率波动问题意味着,模型返回精确数字并不能自动让业务规则变得可靠,开发者仍需处理不确定性。
- — 文章暗示,Jev的测试仅基于50条中文客服样本,其通用判断能力仍有待验证;TypeSafe宣称的概率校准目标也需长期检验。
12 分钟 · 4 卡片 · 12 资料
读原文 →