8.2
深览指数
科技微博·机器之心Pro··AI 生成

清华团队VeriLoop Coder-E1开源:循证螺旋驱动可验证递归式自我改进

清华大学深圳国际研究生院团队发布了一款名为 VeriLoop Coder-E1 的开源代码模型,核心创新在于提出了一种“循证螺旋”机制。该机制并非简单的多轮试错,而是通过“证-伪-探-修-验-化”的闭环,让每次修正都基于可验证的证据,并允许下一次迭代改变问题探索方式,从而实现“递归式自我改进”。模型在多个代码修复基准测试中表现领先,但团队暂未开源核心的Self-Harness控制栈,计划将其用于后续的通用Code Agent商业化。本文适合关注AI代码生成、模型架构创新及开源商业化策略的读者。原文 ↗

核心观点
  • VeriLoop Coder-E1的核心创新是“循证螺旋”(Evidence-Governed Spiral),一种让模型通过可验证的证据进行递归式自我改进的机制,而非简单的多轮重试。
  • 团队将“递归式自我改进”重新定义为:不是系统反复修改自身,而是经证据纠正的方法开始改变系统未来如何发现、判断和纠正错误,且该方法仍可被新的证据再次证伪。
  1. 01模型基于Qwen3.6-27B构建,在Hugging Face四项软件工程Benchmark中,32B及以下开源模型范围内,于SWE-bench Verified(85.20)、SWE-bench Pro(62.38)和Terminal-Bench 2.0(76.40)中排名第一,在DeepSWE(33.63)中排名第二。
  2. 02模型采用“窄域PEFT微调”与“Self-Harness”协同工作:前者冻结基座,通过少量可训练参数强化工具契约遵循、证据绑定等专业能力;后者将任务编译为多轮、分阶段且相互约束的模型调用,并维护任务锚点、证据义务与版本化状态。
  3. 03循证螺旋的执行逻辑为“证-伪-探-修-验-化”六步闭环:每轮生成必须接受反证,只有通过验证的纠正才有资格进入下一轮,并影响后续方法选择。
  4. 04开源不足48小时,即被第三方开发者制作并发布GGUF低精度量化版本,且模型表现出极强的抗“抹除”(abliteration)能力,拒绝率仅从约95%降至约82%。
  5. 05团队依据Apache 2.0许可证开放了模型权重、Tokenizer、配置文件及部分窄域PEFT适配器,但完整实现Self-Harness暂不开放,计划将其作为后续通用Code Agent商业化的核心。
反方 / 局限
  • 团队明确承认,其核心机制Self-Harness的完整实现是商业化的核心壁垒,暂不开放,这限制了社区对其完整推理过程进行验证和复现。
  • 文章引用了波普尔的可证伪性哲学,但“递归式自我改进”的最终效果(改变未来如何发现和纠正错误)在本文中缺乏跨多个独立任务的实证数据支撑,仍停留在理论框架和单次任务演示层面。
15 分钟 · 3 卡片 · 8 资料
读原文 →

前置背景

平行视角

延伸追问