7.5
深览指数
科技人人都是产品经理·Ai学习的老章··AI 生成
Qwen3.8-27B 彻底成神了:Perplexity拿它改出最强开源决策大模型,可本地部署!
Perplexity 发布了 pplx-decider-v1.1-27b,这是一个基于 Qwen3.8-27B 微调的「决策模型」,专门用于分类、打分和路由等快速判断任务,不生成对话文本。该模型在 Hugging Face 的 Decision Index 排行榜上位列第一,超越了原始闭源模型 Jev。文章详细对比了 Perplexity 的开源模型(可自托管)与 OpenAI 的托管服务 Decisions API,并分析了决策模型的技术路线(非因果注意力、校准温度、决策头)、性能提升来源(数据与架构改进)以及适合的场景(客服分流、内容审核、RAG 相关性判断)。适合有一定 GPU 资源的 AI 应用开发者或对模型技术细节感兴趣的技术决策者阅读。原文 ↗
核心观点
- ▍Perplexity 发布的 pplx-decider-v1.1-27b 是目前最强的开源决策模型,其核心价值在于提供了「一次前向计算、直接输出概率和置信度」的快速判断能力,适用于客服分流、内容审核等自动化场景,而不是像传统大模型那样对话聊天。
- ▍Qwen3.8-27B 已经成为开源社区做决策类微调的「公共底盘」,其语义理解能力和 27B 的适中参数量(单卡可部署)是关键优势。
- 01Perplexity Decider v1.1 在 Hugging Face Decision Index 0.3 版本上以 62.8 分位列第一,击败了原始模型 Jev(60.1 分)和其他 111 个开源复现。
- 02v1.1 的涨分主要来自两项改进:将因果掩码改为非因果注意力(noncausal),以及使用开源的 tasksource 数据集进行训练。
- 03Perplexity API 的定价为 0.02 美元/百万输入 token,是 OpenAI Decisions API(0.10 美元/百万输入 token)价格的五分之一。
- 04模型仓库权重约 49 GiB,官方推荐使用 80GB 显存的 A100/H100 或 96GB 的 RTX PRO 6000 进行推理。社区已有量化版本的计划。
- 05Qwen3.8-27B 的微调模型在 Hugging Face 上已有 478 个,排名前列的多个决策模型如 Torchcast Decision 27B、Kev 27B 等都明确基于该底座。
- 06模型内置了校准温度,调用官方 DecisionModel.predict 会自动应用,以保证模型输出 90% 概率时实际准确率也接近 90%。
- 07OpenAI Decisions API 目前处于公开测试阶段,使用独立的 /v1/decisions 端点,支持 choice、noul(谓词)、score 等类型,且提供 ZDR 和 HIPAA 合规选项。
反方 / 局限
- — 模型在 Knowledge(知识判断)类别的分数(48.18)仍然低于闭源 Jev(51.4),意味着在需要大量世界事实知识的场景下,其判断可能不够准确。
- — 模型本身是一个经特殊微调的权重,缺少标准 lm_head,不能直接用于 vLLM 等通用推理框架,部署流程不标准。
- — 消费级显卡(24GB/32GB)无法直接运行 BF16 权重,官方推理代码写死 CUDA,不支持 Mac 用户,降低了个人开发者的可及性。
Perplexitypplx-decider-v1.1-27bQwen3.8-27BOpenAI Decisions APIJevTypeSafe AIDecision Index非因果注意力校准温度
18 分钟 · 5 卡片 · 14 资料
读原文 →