8.2
深览指数
科技Bestblogs·vivo互联网技术··AI 生成
知识不是文件,也不是向量 | KDC 系列 02
文章从RAG系统召回过期政策导致错误回答的案例出发,提出核心观点:检索到高相关材料不等于系统获得了可用于判断的知识。作者给出KDC框架下知识的严格定义——已验证、可复用、能降低不确定性的认知成果,并引入四级知识成熟度链路(Hypothesis→Canonical Knowledge)替代二元正确/错误判断。文章将RAG定位为知识流中的局部机制,并详细定义了知识对象应具备的工程属性(来源、证据、版本、冲突状态等)。适合正在搭建或优化AI知识型Agent/客服系统的工程师阅读。原文 ↗
核心观点
- ▍检索到相关材料不等于系统获得了可用于判断的知识;高相关的过期政策可能比低相关的新政策更危险。
- ▍KDC将知识定义为已经验证、可复用并能降低不确定性的认知成果,包含认知成果、需要验证、需要可复用、需要降低不确定性四个不可省略的部分。
- 01开篇案例中,RAG链路每一步都成功(解析、切块、Embedding、相似度检索、模型生成),但召回的是半年前的旧版退款政策,导致错误回答。
- 02PDF、数据库记录、向量与Embedding、RAG片段、知识图谱、Memory都不是知识本身,它们只是表示或局部机制。
- 03知识成熟度四级链路:Hypothesis → Candidate Knowledge → Verified Knowledge → Canonical Knowledge,且不是单向升级。
- 04知识对象应具备身份、来源、语义、上下文、证据、版本、成熟度、冲突状态、生命周期、责任与权限等要素。
- 05RAG被定位为知识流中的局部机制,负责材料召回与上下文装配,修复检索错误需要补上版本、生效状态与验证流程。
反方 / 局限
- — 文章仅在末尾简单提及开放问题(来源追溯、多Agent环境下的知识同步等),未给出解决方案或深入讨论。
4 分钟 · 3 卡片 · 7 资料
读原文 →