8.2
深览指数
科技Bestblogs·腾讯云开发者··AI 生成
模型越来越强, harness 该留下什么?
本文基于腾讯云TDSQL团队对内部harness框架的实战瘦身(删减61%根指令),结合Anthropic与OpenAI的最新指引,系统论证了模型变强后,冗余指令会从“中性浪费”变为“主动造成质量损失”。作者提出harness撰写的核心应从“规定路径”转向“定义成功判据”,并给出团队自建harness的“四层归属框架”(L0-L3),指出L2(组织特有流程)与L3(责任与价值判断)才是不可替代的立足点。适合AI Agent工程化、Prompt Engineering和AI工作流设计的从业者,可作为团队重构harness的决策参考。原文 ↗
核心观点
- ▍冗余指令在弱模型时代是中性浪费,在强模型时代会主动造成质量损失,因为过度规定会缩小模型搜索空间、导致字面执行和过度触发,覆盖掉模型更好的判断。
- ▍团队自建harness的真正价值在于L2(组织特有流程与工具接入)和L3(验收标准与授权边界),而非L1(公开知识/平台能力),后者贬值最快。
- 01Anthropic为Claude 5系列删掉了Claude Code系统提示词80%的内容,表明行业级转向已发生。
- 02腾讯云TDSQL团队对内部harness框架进行彻底重构,根指令删61%、skills砍40%、agent从10个减到6个。
- 03harness撰写的核心应从“规定路径”转向“定义成功判据”,判据必须能被机械判定(如测试变绿、产物存在、diff为空、命令exit 0)。
- 04作者提出四层归属框架:L0公开知识、L1平台能力、L2组织特有流程、L3责任与价值判断,并论证L2和L3才是团队自建harness的立足点。
- 05验证能力而非任务重要性,才是自主度的真正上界;生成速度超过验证速度会积累“认知债”。
- 06Prefill从API层面消失是“脚手架消失”的标志性案例,体现了从“前置全量上下文”向“渐进式披露”的转变。
反方 / 局限
- — 作者承认,反直觉的是,harness不是在缩小,而是在迁移。更好的模型消灭了某些脚手架,同时解锁了需要另一类脚手架的新能力,假设的地形是移动,不是收缩。
- — 文章未充分讨论不同公司/团队在模型能力差异巨大的情况下,其harness策略是否应有所不同,以及大规模、高复杂度的组织特有流程(L2)的维护成本是否可能超过其收益。
4 分钟 · 4 卡片 · 6 资料
读原文 →