7.9
深览指数
产品人人都是产品经理·花叔··AI 生成

正式开源!比橙皮书skill更强10倍的Huashu-Report来了!

作者花叔开源了名为Huashu-Report的AI报告生成skill,声称其能力远超此前备受关注的「橙皮书」。文章核心不在于展示AI能写报告,而在于分享解决AI报告瓶颈(编数字、内容重复、前后矛盾)的三层工程化方案:通过数据表锁死数字来源、将可机器判断的规则编译进系统而非留在手册、以及人工逐页目视排版检查。作者还介绍了该skill的六种内容原型(咨询deck、研报、学术综述、论文、调查、科普),并强调其产出品的「品味」借鉴自对Stanford、BCG、OpenAI等顶级机构报告的解剖分析。此文是干货密集的技术方案分享,而非泛泛的产品介绍。原文 ↗

核心观点
  • AI写不好报告的核心瓶颈不在于文笔,而在于它不知道什么叫「好」,且常常产生幻觉(编数字、内容重复、口径不一);Huashu-Report通过三层工程化机制解决这些问题。
  • Huashu-Report定义了六种内容原型(咨询式deck、研报、学术综述、论文、调查、科普),AI默认输出的「平均数」往往哪一种都不是;选错原型是代价最高的错误。
  1. 01文章分享了作者橙皮书skill的销售收入数据:四个月从2.35万降至0.49万,跌了79%,尽管期间上架三本新书也未能止住下滑。
  2. 02第一层「数据表.json」机制:所有正文中出现的数字必须源自该表,并附带口径、样本量、出处和verified位;编译器会检查正文中是否有数据表里不存在的条目,从而从根本上杜绝数字编造。
  3. 03作者以Qwen累计下载量为例,展示了「口径写不出一句完整的话,这个数字就不能用」这条规则的价值:四个流传数据(325.4M/10亿/20.45亿/30亿)实则是四种互不兼容的算法。
  4. 04第二层规则分类法:将「中英文之间不加空格」「引用标记转上标」等可函数化的判据挪进编译器;将「加粗一章几处」等机器可计数的规则做成自检报数;将「章首要写具体的人和时刻」这种无法机器定型化的规则留在手册。
  5. 05第三层人工检查:将PDF逐页渲染为PNG,12页拼成一张检查表进行快速扫描;脚本虽能检查图表编号、目录页码、缩进留白等,但无法检出「负值柱画成零高度」「标题落在页底」等排版缺陷。
  6. 06作者利用19个agent的workflow,扫描了2026年顶级机构(Stanford、BCG、McKinsey、OpenAI、世界银行等)的74份AI报告,并编写了解剖器将其拆解为可比较的结构指标,以此来定义Huashu-Report产出的品味标准。
反方 / 局限
  • 作者承认,最后一道「逐页目视检查」工序存在局限性:对于300页的文档不可能一页一张细看,只能采用高速扫描的策略;排版缺陷并非均匀分布,主要集中在长表、宽图、附录等复杂页。
  • 作者反思了假警报比漏报更贵的问题:早期版本直接搜索「待补」二字,结果将正文中诚实的交代也误报为待补项,导致自检报告失去可信度。
9 分钟 · 4 卡片 · 6 资料
读原文 →

概念锚点

前置背景

平行视角

延伸追问