5.7
深览指数
科技Bestblogs··AI 生成
BestBlogs.dev 第 106 期:1% 法则
以 Jeff Dean 提出的「1% 法则」贯穿,指出模型能力只是 AI 系统的一小部分,决定产品能否真正成立的往往是规格、上下文、工具、记忆、评测与编排等「最后 1%」的工程细节。本期精选 20 篇文章,围绕 GPT-5.6、Kimi K3、Gemini Robotics 等前沿模型,以及 Claude Code、MCP、Skill 等工具链展开,探讨从惊艳演示到可靠系统的全部困难。适合关注 AI 基础设施、Agent 工程化与产品落地的从业者阅读。原文 ↗
核心观点
- ▍AI 产品的成功关键不在于模型能力的一次性突破,而在于围绕模型构建的 Harness、评测、记忆、工具等「最后 1%」的工程细节能否可靠落地。
- 01Jeff Dean 在 YC 对谈中提出「1% 法则」:模型能力可以很快接近可用,但决定产品能否成立的往往是规格、上下文、工具、记忆、评测和编排。
- 02ByteByteGo 将 Agent 请求拆解为编排、API 与推理三层,指出真正值得优化的指标已经从每 Token 价格变成「每个成功任务的成本」。
- 03Kimi K3 的精确规模是 2.78 万亿参数,每 Token 激活约 1042 亿参数,其工程细节(如 LatentMoE、KDA 线性注意力)被公开解读。
- 04OpenAI 官方披露 GPT-5.6 Sol 推理内核优化使服务成本降低 20%,改进的推测解码将 Token 生成效率提升超过 15%。
- 05Anthropic 的 Drone-Bench 显示,模型操控无人机的能力在进步,但从二维画面重建可靠三维环境仍是主要瓶颈。
- 06Karthika Raghavan 的「LLM-as-a-Judge」指南指出,让另一个模型打分并不会自动得到可信评测,位置、长度、熟悉表达甚至提示注入都可能改变结果。
反方 / 局限
- — 作者虽未明说,但全文隐含一个结构性张力:当「1%」的工程细节被强调为关键时,是否意味着模型能力本身已经足够?对于许多尚未达到可用阈值的垂直场景,模型能力可能仍是更紧迫的瓶颈。
Jeff Dean1% 法则GPT-5.6 SolKimi K3Gemini Robotics 2Claude CodeMCPOpenAIAnthropicSam AltmanElon MuskBestBlogs.dev
5 分钟 · 3 卡片 · 5 资料
读原文 →