Knowledge Catalog 是一个由 Gemini 提供支持的上下文层,可在整个数据资产中提供通用业务上下文和主动接地功能。通过从结构化和非结构化数据构建动态上下文图,它可帮助数据团队和开发者发现资源、验证数据质量,并安全地将生成式 AI 应用接地,从而减少幻觉。
如需详细了解 Knowledge Catalog,请观看以下视频:
受众群体和前提条件
本概览面向数据和情境工程师、数据科学家、数据管理员和 AI 开发者。在使用 Knowledge Catalog 之前,您必须具备以下条件:
熟悉数据库和存储系统,例如 BigQuery 或 Cloud Storage。
对生成式 AI 概念有基本的了解,例如检索增强生成 (RAG) 或 Model Context Protocol (MCP)。
解决行业特有的数据复杂性问题
在现代企业中,数据复杂且高度分散,既有结构化数据,也有非结构化数据。业务请求很少映射到单个数据库架构或文档存储区。如何安全地协调这些信息孤岛,同时针对跨领域问题提供即时可靠的答案,是一项重大的运营挑战。
Knowledge Catalog 充当弥合这一差距的语义基础,让 AI 智能体和分析工具能够检索到有依据的相关上下文。
关键用户角色
Context Engineers(数据工程师)。自动汇总数据库和 Cloud Storage 中的元数据,通过沿袭跟踪转换,并构建丰富和评估工作流。
数据管理员(治理团队)。通过以下方式监督元数据质量:对 AI 生成的说明进行人机协同审核;使用术语库标准化业务词汇;定义自定义方面,以便将特定领域的背景信息附加到目录条目。
AI 开发者。使用 MCP 服务器或上下文检索 API,基于可信的企业数据架构来训练 LLM 和 AI 应用。
行业使用场景
下表展示了实践中出现的复杂问题、这些问题如何跨越技术界限,以及知识目录如何帮助组织解决这些问题:
| 行业 | 数据和运营方面的挑战 | 要解决的业务问题 | Knowledge Catalog 如何解决此问题 |
|---|---|---|---|
| 电子商务 |
|
“查找退货率高的电子产品,以及显示到货时有损坏迹象的客户照片。” | 跨数据格式的语义接地:自动从事务型数据库中发现元数据,并将其与 Cloud Storage 存储桶中的非结构化图片相关联,从而让 AI 工具能够跨不同的存储系统解析查询。 |
| 制造 |
|
“为上季度未通过安全检查的西部区域机器生成所有相关检查报告的摘要。” | 区域性非结构化爬取:爬取非结构化 PDF 检查报告并将其编入目录,同时爬取资产元数据,让生成式 AI 智能体按区域查找、汇编和总结报告。 |
| 医疗保健 |
|
“如果查看近期的实验室生命体征和预约频率,哪些患者的 30 天再入院风险最高?” | 数据质量和沿袭:计算电子健康记录 Feed 的行级数据质量分析和沿袭图,有助于确保临床预测模型仅依赖经过验证的高质量患者生命体征数据。 |
| 金融服务 |
|
“哪些收入排名前 10 的客户曾抱怨‘效果问题’,这会对第三季度的预测产生什么影响?” | 统一上下文图:统一客户记录、支持反馈和财务表格,让自然语言查询能够将客户收入统计信息与非结构化反馈文件联接起来,以预测财务影响。 |
为应对这些运营挑战,Knowledge Catalog 提供了关键功能,可帮助数据工程师、数据科学家和 AI 开发者构建受治理的数据系统:
使用 Model Context Protocol (MCP) 为 AI 代理提供依据。使用本地或远程 MCP 服务器将元数据、架构、沿袭和业务规则直接公开给 AI 智能体。这些服务器可让模型在提出操作之前验证操作预期。
加速 AI 和分析的探索。使用自然语言语义搜索功能查找相关数据资产。生成式摘要和建议可帮助用户找到数据,而无需等待人工审核文档。
从非结构化数据中提取上下文。自动解析非结构化文件(例如 Cloud Storage 中的 PDF),以提取实体和关系,并将其转换为 BigQuery 中可查询的资产,从而支持对话式代理。
大规模治理数据产品。将具有服务等级协议 (SLA)、合同、所有权详细信息和使用情况备注的资产集合打包成单个受监管的单元,以便进行搜索和订阅。
Knowledge Catalog 的工作原理
Knowledge Catalog 通过三支柱生命周期统一数据管理和上下文。下图展示了该服务如何将物理数据资产映射到业务语义,以用于 AI 代理接地:
如需详细了解这些元数据概念,请参阅元数据简介。
以下部分介绍了元数据生命周期的三大支柱,并说明了一家零售公司如何将它们应用于数据库表、文件和外部目录条目:
汇总(发现和注入)。 Knowledge Catalog 会自动抓取并索引整个数据资产中的技术元数据,而无需移动底层数据:
- 内置数据库。自动编目功能可捕获 BigQuery、AlloyDB for PostgreSQL 和 Spanner 等平台中的架构和属性。
- 受管理的连接。从 Oracle 或 PostgreSQL 等外部系统或 Collibra 等合作伙伴注册表中提取定义,而无需编写自定义流水线。
- 数据沿袭。跟踪整个流水线中的列级转换,以了解数据来源以及数据发生了哪些变化。
- 示例:一家零售公司自动提取事务数据库元数据(例如
orders和order_items表),并为存储在 Cloud Storage 存储桶中的非结构化商品文件建立索引。它们会关联外部数据库,以在可发现的目录下建立统一的元数据索引。
丰富化(精心策划背景信息并验证信任度)。 Knowledge Catalog 可为技术结构附加业务含义并建立信任信号:
- AI 生成的数据分析。Gemini 会分析查询日志,以生成列说明、表摘要和建议的联接。
- 非结构化索引。抓取文件目录,以从 PDF 或图片等非结构化资产中提取实体和关联。
- 术语表和切面。使用业务术语和逻辑模板,将内部指标名称映射到共享词汇。
- 数据质量和异常值检测。强制执行清洁度准则,并运行机器学习扫描来检测统计离群值或数据新鲜度问题,从而生成关键的信任信号。
- 治理审核。通过使用工作流程审核流程在发布前验证元数据更新,从而管理风险。
- 示例:零售团队通过触发数据洞见来推荐列说明并运行数据质量规则,从而丰富资产。他们通过创建术语表和方面,将业务定义与有效订单相关联。
搜索和检索(访问和接地)。AI 应用和业务用户查询统一的上下文图表,以安全地访问数据:
- 接地代理。将基于 LLM 的应用和代理连接到目录。
- Context API。执行低延迟接地载荷请求。
- 语义搜索。使用自然语言查询查找合适的素材资源。
- 数据打包。将表、许可详细信息和 SLA 捆绑到安全的自助式数据包中。
- 示例:分析师执行自然语言语义搜索来查找资源。AI 应用使用 MCP 服务器或上下文检索 API 安全地使用此索引,并将高质量的资源打包到安全视图中。
如需详细了解上下文检索和代理接地,请点击展开
- Model Context Protocol (MCP) 概览:说明如何将生成式 AI 智能体和应用层连接到 Knowledge Catalog 上下文。
- 使用 LookupContext 检索上下文:展示了如何提取关键的运营载荷以用于代理提示。
- 搜索资产:介绍如何使用自然语言语义查询语法查找资产。
Google Cloud 和 AI 生态系统中的 Knowledge Catalog
在构建数据基础时,了解 Knowledge Catalog 如何与相关服务集成至关重要。
Google Cloud 数据库和模型
- BigQuery。Knowledge Catalog 会自动抓取和索引 BigQuery 数据集、表和视图。它会触发由 Gemini 提供支持的数据分析功能,以分析查询历史记录、发布说明并建议经过验证的示例查询。
- Looker (Google Cloud Core)。Knowledge Catalog 会提取 Looker 信息中心、Look 和 LookML 结构(例如视图、探索、维度和测量)。此提取过程会构建沿袭映射,以跟踪运营值如何映射到业务语义。
- Lighthouse 运行时目录。Knowledge Catalog 与 Lighthouse(开源 Iceberg 工作负载的运行时 metastore)集成。它会自动为 Lighthouse 工作负载上的技术元数据编制索引,以提供统一的有效上下文。