7.9
深览指数
科技人人都是产品经理·Z Finance··AI 生成

a16z对谈Vals联创:公开刷榜成了大厂最大的遮羞布,AI评测急需独立机构

AI评测公司Vals联合创始人Rayan指出,Llama 4在公开Benchmark上表现出色,但在其保密测试中低于预期,揭示出自评自测模式的根本缺陷。访谈系统阐述了独立评测机构的必要性:作为新兴万亿美元产业的基础设施,它需要为模型实验室、企业和政策制定者提供可信的第三方能力验证。核心观点包括:评测驱动模型进步,企业选模型应比较完成任务的总成本而非单价,无限使用Agent可能导致算力账单远超高额工资,以及AI安全政策需要具体证据而非抽象讨论。同时也探讨了国际间建立共同评测语言的挑战,尤其是在主权AI建设的背景下。适合关注AI产业前沿、模型评估方法论和AI治理的读者。原文 ↗

核心观点
  • ▍公开Benchmark因试题和评分标准完全公开,已被各大模型实验室‘刷榜’,导致榜单成绩与实际能力之间出现巨大差距,行业亟需独立、保密的第三方评测机构。
  • ▍评测是推动模型进步的基础设施;构建新系统与设计新评测紧密相连,只有清晰识别模型缺失的能力,研发才能找到改进方向。
  1. 01Vals联合创始人Rayan指出,Meta发布的Llama 4在主要公开Benchmark上表现亮眼,但在Vals的保密私有Benchmark中低于预期,二者之间存在巨大差距。
  2. 02当模型公司投入数十亿美元开发新模型时,他们需要实质性证据证明投资价值,而非仅依靠自我报告,因此行业内(如DeepMind的Demis)也在呼吁建立第三方评测生态。
  3. 03Vals曾在一个月的免费工具使用期内,内部工程师消耗了价值约150万美元的Token,是同期员工工资支出的约十倍,这促使他们开发工具,基于任务推荐更有效的模型和Agent组合。
  4. 04评测复杂化的趋势是:样本量更少,但标准集合更大、期待更高;未来将转向模拟真实大规模环境(如企业云、电网基础设施)的安全测试。
  5. 05Vals认为,企业客服、文档处理等知识工作的评测,应基于企业已积累的大量工作成果(代码、文档、表格与交付记录),将其编码成动态评测任务。
反方 / 局限
  • — Rayan承认,建立国际间共同的评测语言极其困难,尤其是在各国竞相投资‘主权AI’的背景下,直接重复建设数据中心和训练大模型可能效率低下。
  • — 文章隐含但未充分展开的张力:政府制定规则与私营机构执行规则的理想分工,在现实中面临技术发展速度远超立法进程的挑战,政府不一定能及时理解并确立有效的规则。
21 分钟 · 3 卡片 · 6 资料
读原文 →

概念锚点

平行视角

延伸追问