科技Bestblogs·得物技术··AI 生成
指标平台:从语义底座到智能消费的实践路径|得物技术
得物技术团队详述了构建指标语义底座的完整实践路径:通过业务、数仓、产品三线协同,将隐性指标显性化并资产化。文章核心贡献在于用实测数据证明了语义标注密度与 Text2SQL 准确率之间的正相关关系(从 85%+ 提升至 95%+),并提出 AI Coding 提升 70%+ 效率的具体案例。适合数据平台负责人、AI 应用架构师、以及关注「AI + 数据」基础设施落地的技术决策者阅读。原文 ↗原文 ↗
核心观点
- ▍高质量、经过治理的语义底座(指标平台)是提升 Text2SQL 和 AI Coding 等智能消费场景准确率与效率的关键前提,而非模型推理能力本身。
- ▍指标平台的构建需要业务、数仓、产品三方协同,通过「沉淀-观察-转正」机制将隐性知识转化为可被机器消费的结构化资产。
- 01得物实际测评表明,随着语义标注密度提升,Text2SQL 的测评准确率从 85%+ 提升至 95%+,证明瓶颈在语义层元数据,而非模型推理能力。
- 02通过将结构化知识资产(术语字典、开发原则等)喂给 AI Coding 模型,在标准化数仓开发场景下,核心模型开发效率提升了 70% 以上。
- 03业务侧通过「沉淀-观察-转正」机制,将原本在分析师或运营大脑里的隐性指标(如「活跃用户」但没有明确计算口径)显性化并纳入平台管理。
- 04数仓侧将依赖收敛至「域内精品宽表」,消除口径分叉和烟囱式依赖,降低了 AI 理解数据血缘的复杂度。
- 05在产品侧,通过结构化表单、多技术来源(Doris、ClickHouse)统一交付以及 YAML 批量生成,显著提升指标上架效率。
- 06在指标提报环节内置语义相似度检测和口径冲突预警,拦截了二义性指标,这是保证 AI 消费准确性的先决条件。
反方 / 局限
- — 文章虽然证明了语义层的重要性,但未讨论当底层原始数据质量极差(如日志缺失、ETL 逻辑错误)时,语义层能在多大程度上兜底。文章自身也承认「指标字典再规范,给脏数据穿了件干净外套」的潜在风险,但未提供对应的脏数据治理框架。
前置背景
技术原理
平行视角
未来推演
延伸追问