7.6
深览指数
科技人人都是产品经理·深思圈··AI 生成
让 AI 做研究很容易,难的是让它承认自己错了
本文通过横评五款AI科研系统,揭示了当前自动科研系统普遍存在的核心问题:它们产出的实验结果是否可信。作者以EvoMap团队的开源项目AutoResearch为例,指出其关键差异在于它不仅追求结果,更通过机制设计(如生成-验证分离、独立评审、负结果保留)主动暴露和处理自身的错误,从而建立了可信度。文章适合关注AI科研自动化、Agent系统设计及可信AI的读者,有助于理解当前AI科研系统的能力边界与工程核心挑战。原文 ↗
核心观点
- ▍AI科研系统的核心挑战不是能多快产出结果,而是其产出的结论是否可信。目前大多数系统追求‘跑得快’,AutoResearch则追求‘输出的结论能经受检验’。
- ▍AI科研这个栈将分化为两层:生成层(巨头有算力优势)和可信层(需要中立、公开、可审计),后者是一个高价值的行业切入点。
- 01硅谷在RSI(递归自我改进)方向几个月内涌入超过17亿美元资金,包括AlphaGo之父David Silver的新公司Ineffable Intelligence和Recursive Superintelligence。
- 02横评中,AutoResearch出现5次错误/幻觉事件,全部被自身暴露、定位并处理;相比之下,AI Scientist出现27次,Agent Laboratory出现18次,这些系统的问题包括使用dummy指标和空数据链条穿透。
- 03微软RD-Agent团队自身论文分析90次迭代,其中38.9%是‘Gradient Hallucination’,即系统在自信但错误的改进方向上迭代。
- 04AutoResearch的设计核心包括:至少三个底层模型独立生成Idea并互审、小规模pilot先行验证、独立的reviewer/critic/blind review审计证据链、负结果保留与持久化。
- 05在RSICD数据集测试中,AutoResearch通过三步改进(C1、C2、C3)将mR从32.84提升至34.69(+1.85),每一步均可独立归因和复现。
反方 / 局限
- — AutoResearch的实验结果提升幅度(+1.85 mR)并不大,但其价值在于每一步提升都受控、可归因且可复现,而非绝对值。
- — 文章指出,AutoResearch的商业前景(如药企托管、审计留痕)仍是推演,市场上没有经过验证的定价参考。
AutoResearchEvoMapDavid SilverIneffable IntelligenceRecursive Superintelligence田渊栋RD-AgentAgent LaboratoryAI ScientistRSIHuggingFace TrendingDeepSeek V4 ProRSICD
13 分钟 · 5 卡片 · 13 资料
读原文 →