8.3
深览指数
科技人人都是产品经理·AI搭子木木··AI 生成

大厂后训练视角看Jev模型的更新(大白话)

本文从后训练从业者视角,用大白话拆解了从预训练、RLHF到Jev模型采用的RLCD这一技术演进。核心论点是,RLCD将模型优化目标从“生成人类喜欢的回答”转向“做出校准的概率判断”,让模型更适合嵌入自动化决策系统。文章详细对比了RLHF与RLCD在训练目标、输出形式(Choice/Score/Noul)和数据需求上的差异,并结合客服工单、安全事件处理等场景分析了Jev的价值与局限。适合对AI后训练技术有兴趣、想理解RLCD相对RLHF在应用层核心差异的读者。原文 ↗

核心观点
  • Jev模型和RLCD训练方向的核心价值,不是让模型更会聊天,而是让模型学会做出校准的概率判断,以嵌入自动化决策系统。
  • RLCD相对于RLHF的改变,本质上是优化目标从“人类更喜欢哪个回答”转向了“在给定信息下,每个判断成立的概率是多少”。
  1. 01早期GPT(如GPT-3)的训练目标是预测下一个词,导致模型面对指令时可能继续生成关于指令的描述,而非直接执行任务。
  2. 02RLHF通过人类示范、答案排序、训练奖励模型、强化学习,让模型学会了按人类意图说话,但仍偏向生成文本而非提供可供执行的判断。
  3. 03RLHF输出的建议式回复(如“建议联系售后”)对人类客服够用,但缺少结构化的概率判断和置信度,不适合软件直接执行。
  4. 04RLCD模型的核心输出是三类结构化结果:Choice(从选项中选择)、Score(打分)、Noul(判断概率)。
  5. 05校准(Calibration)指模型给出的概率在长期统计上应与真实发生频率一致:模型常说80%的事情,大约有八成正确。
  6. 06Jev的创始人Diogo Almeida来自OpenAI,参与过InstructGPT的RLHF工作,2024年离职创办TypeSafe。
  7. 07TypeSafe官方文档承认其“零幻觉”声明基于结构匹配的保证,而非语义正确率的实证证明,建议开发者从保守阈值开始测试。
  8. 08文章设想了RLCD模型在客服、安全事件处理、AI模型路由、Agent工具调用、发票审核等场景的应用,核心是给软件增加“智能的if判断”。
反方 / 局限
  • 开头的爆火截图是网友二创,带有夸张效果,Jev并不会真的读心,其输出依赖于输入信息和预设选项的完整性。
  • TypeSafe并未公开RLCD的完整训练论文、奖励设计和数据生成细节,其技术配方的真正价值尚需更多独立验证。
15 分钟 · 5 卡片 · 11 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问