7.3
深览指数
科技微博·机器之心Pro··AI 生成
LlamaFactory作者开源新工具:0.2元自动造Agent
LlamaFactory 作者郑耀威团队开源 PenguinHarness,一个能让 Agent 自动构建、自我迭代的开源框架。核心卖点是极低成本(0.2元构建、0.5元持续优化)和一套完整的自进化闭环,将 Agent 的提示词、技能等以文件系统管理,并通过多智能体协作流程自动评测、调优。文章提供了具体案例(Agent 准确率从 50% 提升至 90%)、技术原理(文件系统作为唯一真相来源)以及两个生产场景落地数据。适合对 AI Agent 工程化、开源框架、低成本自动化感兴趣的研发人员阅读,可快速了解一种“让 Agent 构建 Agent”的非传统路径。原文 ↗
核心观点
- ▍PenguinHarness 是一个让 Agent 自动构建、自我迭代的开源 Harness(框架),核心理念是“Agent 是文件,提示词是文件,对话历史也是文件”,通过文件系统作为唯一真相来源,将 Agent 构造和优化简化为文件操作。
- 01与 OpenAI Codex 对抗案例:让 AI 生成一个 RAG 应用(分块检索、流式返回、带引用),PenguinHarness 耗时仅为 Codex 的一半,成本低至 1/200,产出结果更接近可交付状态(语言通顺、有流式输出和引用),而 Codex 结果中英混杂且缺少流式输出。
- 02Agent 自进化案例:对一个预测球赛/投资/售后处理的 Agent 自动调优,经过多轮迭代,Agent 评分从 53 分提升至 95 分,整个过程仅消耗 0.5 元 Token(基于 DeepSeek V4 Flash)。
- 03技术原理:PenguinHarness 将文件系统作为唯一真相来源,Agent 对象由文件拼装而成,构造新 Agent 即文件复制粘贴;运行时通过 PenguinMessage 作为唯一消息协议在模型、环境和用户间交换,支持轻量接入。
- 04自进化流程由三个角色 Agents 协作:Optimizer Agent 组织评测与迭代,Evaluator Agent 独立打分,被测 Agent 执行任务;流程包含组织评测、独立打分、分析优化、验证迭代四步,仅当候选版本取得严格更高分时才会被接受。
- 05团队自主研发了评估基准 GDPevo,覆盖医疗、金融、法律等六大真实场景,通过划分训练/测试集防止 Agent 进化时“偷看答案”,解决了现有评估多只有测试集而无训练集的痛点。
- 06两个生产场景落地:某体检机构使用 PenguinHarness 生成报告核查 Agent,核查时间从 30 分钟缩短至几十秒;某制造企业构建流水线巡检 Agents,产线停机时间减少 65%,产出提升近 2 倍。
- 07项目团队背景:创始成员包括 LlamaFactory 作者郑耀威(GitHub 7万星)、前 IBM TJ Watson 研究院高级研究员钱步月、前百度 NLP 创始成员吴雪军、北大博士生胡俊豪、纽约大学商学院教授陈溪等,团队成立于 2025 年。
反方 / 局限
- — 文章未提及 PenguinHarness 与主流 Agent 框架(如 LangChain、AutoGPT、CrewAI)的对比,也未讨论其泛化能力——案例集中在 RAG 应用和特定场景优化,在更复杂、多步骤、长周期任务上的表现未知。
- — Agent 自进化可能带来的“过度优化”风险未被充分讨论:当 Optimizer Agent 不断修改提示词和 Skills,可能在测试集上过拟合,生产环境中面对分布外数据时性能可能退化。文章虽提到“快照和回滚”机制,但未给出防止过拟合的策略。
PenguinHarnessLlamaFactory郑耀威PrismShadowGDPevoAgent 自进化Recursive田渊栋XYZ AI Lab边江姚顺雨DeepSeek V4OpenAI CodexApache 2.0
12 分钟 · 3 卡片 · 9 资料
读原文 →