7.8
深览指数
科技Bestblogs·跨国串门儿计划··AI 生成
735. Jev 模型创始人访谈:为什么我无法在 OpenAI 构建 Jev
TypeSafe 联合创始人 Diogo Almeida 在 Latent Space 播客中详细阐述了其构建的 Jev 模型的核心哲学:一类专为代码消费设计的「机器原生」系统 1 模型。他批判了 RLHF 在程序化使用场景下的模式丢失与校准失真问题,并提出以 RLCD(可靠性而非确定性)为新北极星目标。文章的核心贡献在于提供了一个区别于主流大模型(聊天式 AI)的技术路线和评估框架——将 AI 工作流拆解为可验证的最小语义单元,用结构化状态取代巨型系统消息。适合对 LLM 技术原理、AI Agent 工程化有较深理解,并关心「如何让模型可靠地成为软件基础设施」而非「如何让模型更会聊天」的从业者阅读。原文 ↗
核心观点
- ▍Jev 的定位是「机器原生系统 1 大型可编程模型」,其产物目标是直接被代码消费,而非与人聊天,因此其设计哲学(可靠性>确定性、RLCD、结构化状态)与传统 LLM 和 RLHF 聊天机器人有根本性不同。
- ▍RLHF 会造成模式丢失、校准失真与智能碎裂,不适用于程序化使用场景;RLCD(可靠性正确性蒸馏)应作为面向软件依赖的新北极星目标。
- 01Diogo 区分了三类模型:预训练 LLM 是互联网自动补全,RLHF 聊天机器人是为回复文本,而 Jev 的输出是为代码消费而设计的,因此命名取自杰文斯悖论。
- 02他批评 API 中的拒绝响应是一种「类型错误」,认为在软件依赖场景下随机拒绝会导致系统不可预测甚至崩溃,主张安全对齐适用于聊天,能力对齐才适用于软件。
- 03建议将 AI 工作流拆解为最小语义单元,每个决策可用代码验证、设阈值并沉淀为测试用例;用结构化状态(如 JSON)取代巨型系统消息,后者被形容为难以维护的全局变量。
- 04TypeSafe 将自身定位为数据实验室,认为数据远比算力重要,但合成数据不是简单拼凑,必须针对模型成为通用基础设施的未来场景构造数据,解决能力分布不均的「碎片」问题。
- 05公开基准评测容易作弊(例如各实验室有专门团队收集 MMLU 数据提分),应以私有评测和真实工作流评估模型智能。
- 06可靠性不等于确定性:相同输入得相同输出(确定性)不是正确目标,相似输入得相似输出(鲁棒性)才是软件系统需要的。
- 07API 侧提出了三个原语:Choice(对应枚举 switch)、Now(对应 if 语句)、Score(对应排序阈值),将模型调用融入代码逻辑。
反方 / 局限
- — Diogo 承认将工作流拆成更多调用会带来成本和延迟增加,但他认为这是为了可验证性和可靠性必须付出的工程代价。
6 分钟 · 5 卡片 · 11 资料
读原文 →