知识目录概览

Knowledge Catalog 是一个由 Gemini 提供支持的上下文层,可在整个数据资产中提供通用业务上下文和主动接地功能。通过从结构化和非结构化数据构建动态上下文图,它可帮助数据团队和开发者发现资源、验证数据质量,并安全地将生成式 AI 应用接地,从而减少幻觉。

如需详细了解 Knowledge Catalog,请观看以下视频:

受众群体和前提条件

本概览面向数据和情境工程师、数据科学家、数据管理员和 AI 开发者。在使用 Knowledge Catalog 之前,您必须具备以下条件:

  • 熟悉数据库和存储系统,例如 BigQuery 或 Cloud Storage。

  • 对生成式 AI 概念有基本的了解,例如检索增强生成 (RAG) 或 Model Context Protocol (MCP)。

解决行业特有的数据复杂性问题

在现代企业中,数据复杂且高度分散,既有结构化数据,也有非结构化数据。业务请求很少映射到单个数据库架构或文档存储区。如何安全地协调这些信息孤岛,同时针对跨领域问题提供即时可靠的答案,是一项重大的运营挑战。

Knowledge Catalog 充当弥合这一差距的语义基础,让 AI 智能体和分析工具能够检索到有依据的相关上下文。

关键用户角色

  • Context Engineers(数据工程师)。自动汇总数据库和 Cloud Storage 中的元数据,通过沿袭跟踪转换,并构建丰富和评估工作流。

  • 数据管理员(治理团队)。通过以下方式监督元数据质量:对 AI 生成的说明进行人机协同审核;使用术语库标准化业务词汇;定义自定义方面,以便将特定领域的背景信息附加到目录条目。

  • AI 开发者。使用 MCP 服务器或上下文检索 API,基于可信的企业数据架构来训练 LLM 和 AI 应用。

行业使用场景

下表展示了实践中出现的复杂问题、这些问题如何跨越技术界限,以及知识目录如何帮助组织解决这些问题:

行业 数据和运营方面的挑战 要解决的业务问题 Knowledge Catalog 如何解决此问题
电子商务
  • 事务型数据库和非结构化商品图片位于不同的存储环境中,因此很难将退货历史记录与实物状况相关联。
  • 将退货率与直观的客户反馈相关联需要复杂的手动数据流水线。
“查找退货率高的电子产品,以及显示到货时有损坏迹象的客户照片。” 跨数据格式的语义接地:自动从事务型数据库中发现元数据,并将其与 Cloud Storage 存储桶中的非结构化图片相关联,从而让 AI 工具能够跨不同的存储系统解析查询。
制造
  • 遥测日志和纸质检查 PDF 扫描件在各个地理部门之间是孤立的。
  • 以往,编译安全检查摘要和查找运营模式需要数周的跨团队协调。
“为上季度未通过安全检查的西部区域机器生成所有相关检查报告的摘要。” 区域性非结构化爬取:爬取非结构化 PDF 检查报告并将其编入目录,同时爬取资产元数据,让生成式 AI 智能体按区域查找、汇编和总结报告。
医疗保健
  • 电子健康记录中的临床数据必须保持安全,并符合 HIPAA 法规,同时支持实时预测模型。
  • 未检测到的数据质量异常可能会导致模型预测或患者护理提醒不正确。
“如果查看近期的实验室生命体征和预约频率,哪些患者的 30 天再入院风险最高?” 数据质量和沿袭:计算电子健康记录 Feed 的行级数据质量分析和沿袭图,有助于确保临床预测模型仅依赖经过验证的高质量患者生命体征数据。
金融服务
  • 客户反馈文本文件、CRM 账号和结算账簿在不同的系统中进行管理,无法进行统一分析。
  • 预测财务趋势需要将非结构化情感数据与历史收入数据库联接起来。
“哪些收入排名前 10 的客户曾抱怨‘效果问题’,这会对第三季度的预测产生什么影响?” 统一上下文图:统一客户记录、支持反馈和财务表格,让自然语言查询能够将客户收入统计信息与非结构化反馈文件联接起来,以预测财务影响。

为应对这些运营挑战,Knowledge Catalog 提供了关键功能,可帮助数据工程师、数据科学家和 AI 开发者构建受治理的数据系统:

  • 使用 Model Context Protocol (MCP) 为 AI 代理提供依据。使用本地或远程 MCP 服务器将元数据、架构、沿袭和业务规则直接公开给 AI 智能体。这些服务器可让模型在提出操作之前验证操作预期。

  • 加速 AI 和分析的探索。使用自然语言语义搜索功能查找相关数据资产。生成式摘要和建议可帮助用户找到数据,而无需等待人工审核文档。

  • 从非结构化数据中提取上下文。自动解析非结构化文件(例如 Cloud Storage 中的 PDF),以提取实体和关系,并将其转换为 BigQuery 中可查询的资产,从而支持对话式代理。

  • 大规模治理数据产品。将具有服务等级协议 (SLA)、合同、所有权详细信息和使用情况备注的资产集合打包成单个受监管的单元,以便进行搜索和订阅。

Knowledge Catalog 的工作原理

Knowledge Catalog 通过三支柱生命周期统一数据管理和上下文。下图展示了该服务如何将物理数据资产映射到业务语义,以用于 AI 代理接地:

Knowledge Catalog 的架构,展示了如何将元数据、业务逻辑和数据关系整理成 AI 代理的统一上下文图。 Knowledge Catalog 的架构,展示了如何将元数据、业务逻辑和数据关系整理成 AI 代理的统一上下文图。
图 1.Knowledge Catalog 的架构

如需详细了解这些元数据概念,请参阅元数据简介

以下部分介绍了元数据生命周期的三大支柱,并说明了一家零售公司如何将它们应用于数据库表、文件和外部目录条目:

  1. 汇总(发现和注入)。 Knowledge Catalog 会自动抓取并索引整个数据资产中的技术元数据,而无需移动底层数据:

    • 内置数据库。自动编目功能可捕获 BigQuery、AlloyDB for PostgreSQL 和 Spanner 等平台中的架构和属性。
    • 受管理的连接。从 Oracle 或 PostgreSQL 等外部系统或 Collibra 等合作伙伴注册表中提取定义,而无需编写自定义流水线。
    • 数据沿袭。跟踪整个流水线中的列级转换,以了解数据来源以及数据发生了哪些变化。
    • 示例:一家零售公司自动提取事务数据库元数据(例如 ordersorder_items 表),并为存储在 Cloud Storage 存储桶中的非结构化商品文件建立索引。它们会关联外部数据库,以在可发现的目录下建立统一的元数据索引。

    如需详细了解元数据聚合和数据注入,请点击展开

  2. 丰富化(精心策划背景信息并验证信任度)。 Knowledge Catalog 可为技术结构附加业务含义并建立信任信号:

    • AI 生成的数据分析。Gemini 会分析查询日志,以生成列说明、表摘要和建议的联接。
    • 非结构化索引。抓取文件目录,以从 PDF 或图片等非结构化资产中提取实体和关联。
    • 术语表和切面。使用业务术语和逻辑模板,将内部指标名称映射到共享词汇。
    • 数据质量和异常值检测。强制执行清洁度准则,并运行机器学习扫描来检测统计离群值或数据新鲜度问题,从而生成关键的信任信号。
    • 治理审核。通过使用工作流程审核流程在发布前验证元数据更新,从而管理风险。
    • 示例:零售团队通过触发数据洞见来推荐列说明并运行数据质量规则,从而丰富资产。他们通过创建术语表和方面,将业务定义与有效订单相关联。

    如需详细了解元数据丰富和信任验证,请点击展开

  3. 搜索和检索(访问和接地)。AI 应用和业务用户查询统一的上下文图表,以安全地访问数据:

    • 接地代理。将基于 LLM 的应用和代理连接到目录。
    • Context API。执行低延迟接地载荷请求。
    • 语义搜索。使用自然语言查询查找合适的素材资源。
    • 数据打包。将表、许可详细信息和 SLA 捆绑到安全的自助式数据包中。
    • 示例:分析师执行自然语言语义搜索来查找资源。AI 应用使用 MCP 服务器或上下文检索 API 安全地使用此索引,并将高质量的资源打包到安全视图中。

    如需详细了解上下文检索和代理接地,请点击展开

Google Cloud 和 AI 生态系统中的 Knowledge Catalog

在构建数据基础时,了解 Knowledge Catalog 如何与相关服务集成至关重要。

Google Cloud 数据库和模型

  • BigQuery。Knowledge Catalog 会自动抓取和索引 BigQuery 数据集、表和视图。它会触发由 Gemini 提供支持的数据分析功能,以分析查询历史记录、发布说明并建议经过验证的示例查询。
  • Looker (Google Cloud Core)。Knowledge Catalog 会提取 Looker 信息中心、Look 和 LookML 结构(例如视图、探索、维度和测量)。此提取过程会构建沿袭映射,以跟踪运营值如何映射到业务语义。
  • Lighthouse 运行时目录。Knowledge Catalog 与 Lighthouse(开源 Iceberg 工作负载的运行时 metastore)集成。它会自动为 Lighthouse 工作负载上的技术元数据编制索引,以提供统一的有效上下文。