本主题详细介绍如何创建 Sensitive Data Protection 检查作业,以及如何通过创建作业触发器来安排定期检查作业。如需快速了解如何使用 Sensitive Data Protection 界面创建新的作业触发器,请参阅快速入门:创建 Sensitive Data Protection 作业触发器。
关于检查作业和作业触发器
当 Sensitive Data Protection 执行检查扫描以识别敏感数据时,每次扫描都将作为一项作业运行。如果您指示 Sensitive Data Protection 检查 Google Cloud 存储库(包括 Cloud Storage 存储桶、BigQuery 表、Datastore 种类和外部数据),Sensitive Data Protection 会创建并运行作业资源。
您可以通过创建作业触发器来安排 Sensitive Data Protection 检查扫描作业。作业触发器会自动定期创建 Sensitive Data Protection 作业,并可按需运行。
如需详细了解 Sensitive Data Protection 中的作业和作业触发器,请参阅作业和作业触发器概念页面。
创建新的检查作业
如需创建新的 Sensitive Data Protection 检查作业,请执行以下操作:
控制台
在 Google Cloud 控制台的 Sensitive Data Protection 部分中,前往创建作业或作业触发器页面。
创建作业或作业触发器页面包含以下部分:
选择输入数据
名称
输入作业的名称。可使用字母、数字和连字符。您可以选择为作业命名。如果您未输入名称,Sensitive Data Protection 将为该作业提供一个唯一编号标识符。
位置
从存储类型菜单中,选择用于存储要扫描的数据的存储区种类:
- Cloud Storage:输入您要扫描的存储分区的网址,或从位置类型菜单中选择包含/排除,然后点击浏览以导航到您要扫描的存储分区或子文件夹。如果选中以递归方式扫描文件夹复选框,则扫描指定的目录和所有子目录。如果未选中该复选框,则系统只会扫描指定的目录,而不会扫描其中的子目录。
- BigQuery:输入要扫描的项目、数据集和表格的标识符。
- Datastore:输入要扫描的项目、命名空间(可选)和种类的标识符。
- 混合:您可以添加必需标签、可选标签以及用于处理表格数据的选项。如需了解详情,请参阅您可以提供的元数据类型。
采样
如果您的数据量非常庞大,可选择使用采样以节省资源。
在采样下,您可以选择是扫描所有选定的数据,还是采样扫描特定百分比的数据。根据您要扫描的存储区类型,采样的工作方式有所不同:
- 对于 BigQuery,您可以根据您指定要包含在扫描范围内的文件百分比,对所选总行数的一部分进行采样。
- 对于 Cloud Storage,如有任何文件超出了要扫描的每个文件的最大字节数中指定的大小,Sensitive Data Protection 会扫描到文件大小上限为止,然后转到下一个文件。
如需开启采样功能,请从第一个菜单中选择下列其中一个选项:
- 从顶部开始采样:Sensitive Data Protection 将从数据开头处开始部分扫描。对于 BigQuery,这表示将从第一行开始扫描。对于 Cloud Storage,这表示将从每个文件的开头处开始扫描,并在 Sensitive Data Protection 扫描到指定的文件大小上限后停止扫描。
- 随机开始采样:Sensitive Data Protection 会从随机选择的数据位置开始部分扫描。对于 BigQuery,这表示从随机选择的行开始扫描。对于 Cloud Storage,此设置仅适用于超过指定大小上限的文件。如果文件在文件大小上限以内,Sensitive Data Protection 会扫描整个文件;如果文件超过了文件大小上限,则扫描到上限即止。
如需执行部分扫描,您还必须选择要扫描的数据百分比。请使用滑块设置百分比。
您还可以按日期缩小要扫描的文件或记录范围。如需了解具体方法,请参阅本主题后面的时间表。
高级配置
在创建 Cloud Storage 存储分区或 BigQuery 表的扫描作业时,您可以通过指定高级配置来缩小搜索范围。具体来说,您可以配置:
- 文件(仅限 Cloud Storage):要扫描的文件类型,包括文本文件、二进制文件和图片文件。
- 标识字段(仅限 BigQuery):表中的唯一行标识符。
- 对于 Cloud Storage,如有任何文件超出了要扫描的每个文件的最大字节数中指定的大小,Sensitive Data Protection 会扫描到文件大小上限为止,然后转到下一个文件。
如需开启采样功能,请选择要扫描的数据百分比。请使用滑块设置百分比。然后,从第一个菜单中选择下列其中一个选项:
- 从顶部开始采样:Sensitive Data Protection 将从数据开头处开始部分扫描。对于 BigQuery,这表示将从第一行开始扫描。对于 Cloud Storage,这表示将从每个文件的开头处开始扫描,并在 Sensitive Data Protection 扫描到指定的文件大小上限(参见上文)后停止扫描。
- 随机开始采样:Sensitive Data Protection 会从随机选择的数据位置开始部分扫描。对于 BigQuery,这表示从随机选择的行开始扫描。对于 Cloud Storage,此设置仅适用于超过指定大小上限的文件。如果文件在文件大小上限以内,Sensitive Data Protection 会扫描整个文件;如果文件超过了文件大小上限,则扫描到上限即止。
文件
对于存储在 Cloud Storage 中的文件,您可以在文件下指定要包含在扫描范围内的类型。
您可以选择二进制文件、文本文件、图片文件、CSV 文件、TSV 文件、Microsoft Word 文件、Microsoft Excel 文件、Microsoft PowerPoint 文件、PDF 文件和 Apache Avro 文件。如需查看 Sensitive Data Protection 可以在 Cloud Storage 存储桶中扫描的文件扩展名的详尽列表,请参阅 FileType。
选择二进制会使 Sensitive Data Protection 扫描无法识别的文件类型。
标识字段
对于 BigQuery 中的表,您可以在标识字段字段中指示 Sensitive Data Protection 在结果中包含表的主键列的值。这样一来,您就可以将发现结果与包含这些结果的表格行相关联。
输入可唯一标识表格中每一行的列的名称。必要时,可以使用点表示法指定嵌套字段。您可以根据需要添加任意数量的字段。
您还必须开启保存到 BigQuery 操作,才能将发现结果导出到 BigQuery。将发现结果导出到 BigQuery 时,每个发现结果都包含相应标识字段的值。如需了解详情,请参阅 identifyingFields。
配置检测
您可以在配置检测部分中指定要扫描的敏感数据类型。您可以选择是否填写此部分。如果您跳过此部分,Sensitive Data Protection 将扫描您的数据,查找一组默认的 infoTypes。
模板
您可以选择使用 Sensitive Data Protection 模板,以重复使用之前指定的配置信息。
如果您已创建了要使用的模板,请点击模板名称字段以查看现有检查模板的列表。选择或输入要使用的模板的名称。
如需详细了解如何创建模板,请参阅创建 Sensitive Data Protection 检查模板。
infoType
InfoType 检测器会查找特定类型的敏感数据。例如,Sensitive Data Protection 的 US_SOCIAL_SECURITY_NUMBER 内置 infoType 检测器会查找美国社会保障号。除了内置的 infoType 检测器之外,您还可以自行创建自定义 infoType 检测器。
在 InfoType 下,选择与您要扫描以查找的数据类型相对应的 infoType 检测器。我们不建议将此部分留空。这样做会导致 Sensitive Data Protection 使用一组默认的 infoType 扫描您的数据,其中可能包含您不需要的 infoType。如需详细了解每种检测器,请参阅 InfoType 检测器参考文档。
如需详细了解如何管理此部分中的内置 infoType 和自定义 infoType,请参阅通过 Google Cloud 控制台管理 infoType。
检查规则集
借助检查规则集,您可以使用上下文规则自定义内置和自定义的 infoType 检测器。检查规则的类型包括:
- 排除规则:有助于排除误报或不需要的结果。
- 热词规则:有助于检测其他发现结果。
- 调整规则:根据发现结果出现的上下文调整发现结果的可能性。
如需添加新规则集,请先在 InfoTypes 部分中指定一个或多个内置或自定义 infoType 检测器。选择规则集修改(目标 infoType)或用于评估(上下文 infoType)的所有 infoType 检测器。然后,执行以下操作:
- 点击添加规则集。
- 在选择目标 infoType 字段中,选择规则集在满足规则时修改的 infoType。
- 点击添加规则,打开包含多个选项的菜单,其中包括热词规则、排除规则和调整规则。
如需创建热词规则,请选择热词规则。然后,执行以下操作:
- 在热词字段中,输入 Sensitive Data Protection 要查找的正则表达式。
- 在热词邻近度菜单中,选择您输入的热词是在所选 infoType 之前还是之后找到的。
- 在热词与 infoType 的距离中,输入热词与所选 infoType 之间的大致字符数。
- 在置信度调整中,选择是为匹配项分配固定的可能性级别,还是将默认可能性级别提高或降低一定量。
如需创建排除规则,请选择排除规则和要创建的排除规则类型,例如正则表达式。然后,执行以下操作:
- 根据您选择的排除规则类型,输入必须找到的正则表达式、短语、启动指令或上下文 infoType,规则才能生效。
- 根据您选择的排除规则类型,设置匹配类型或图片包含类型:
- 如果您选择了基于文本的排除规则,请选择以下匹配类型之一:
- 完全匹配:发现结果必须与您提供的文本或上下文 infoType 完全匹配。
- Partial match(部分匹配):发现结果的子字符串必须与您提供的文本或上下文 infoType 相匹配。
- 反向匹配:发现结果不得与您提供的文本或上下文 infoType 相匹配。
- 如果您选择了基于图片的排除规则,请选择目标 infoType 与上下文 infoType 之间所需的空间关系。例如,如果您选择 Encloses,则上下文发现结果必须包含目标发现结果,规则才能适用。
如需创建调整规则,请选择调整规则和调整规则类型,例如根据图片检测结果进行调整。然后,执行以下操作:
- 在上下文 infoType 字段中,选择为目标发现结果提供上下文的 infoType 检测器。Sensitive Data Protection 使用上下文 infoType 来评估是否必须调整目标 infoType。
- 在最低可能性字段中,选择上下文 infoType 可以具有的最低可能性级别,以便仍能触发调整规则。如果任何检测到的上下文发现结果的可能性值低于此值,Sensitive Data Protection 不会调整目标发现结果的可能性。
- 对于图片发现,请在图片包含类型字段中,选择目标信息类型与上下文信息类型之间所需的空间关系。例如,如果您选择 Encloses,则上下文发现结果必须包含目标发现结果,规则才能适用。
- 在可能性字段中,选择要分配给目标发现结果的新可能性级别。
您可以添加更多规则集,以进一步优化扫描结果。
置信度阈值
每次 Sensitive Data Protection 检测到可能匹配的敏感数据时,都会为其分配一个可能性值,该值介于“极不可能”到“极有可能”之间。在此处设置可能性值后,您将指示 Sensitive Data Protection 仅匹配与该可能性值或更高级别可能性值对应的数据。
默认值“可能”(Possible) 足以满足大多数情况。如果您经常获得太过宽泛的匹配项,请调高滑块的值。如果匹配项太少,请调低滑块的值。
完成操作后,请点击继续。
添加操作
对于添加操作,请选择在作业完成后,Sensitive Data Protection 要执行的一项或多项操作。如需了解详情,请参阅启用检查或风险分析操作。
选择操作后,点击继续。
查看
查看部分包含您刚刚指定的作业设置的 JSON 格式摘要。
点击创建以创建作业(如果未指定时间表)并运行一次作业。系统将显示作业的信息页面,其中包含状态和其他信息。如果作业当前正在运行,您可以点击取消按钮将其停止。您也可以通过点击删除来删除该作业。
如需返回 Sensitive Data Protection 主页面,请点击 Google Cloud 控制台中的返回箭头。
C#
如需了解如何安装和使用 Sensitive Data Protection 客户端库,请参阅 Sensitive Data Protection 客户端库。
如需向 Sensitive Data Protection 进行身份验证,请设置应用默认凭证。如需了解详情,请参阅为本地开发环境设置身份验证。
Go
如需了解如何安装和使用 Sensitive Data Protection 客户端库,请参阅 Sensitive Data Protection 客户端库。
如需向 Sensitive Data Protection 进行身份验证,请设置应用默认凭证。如需了解详情,请参阅为本地开发环境设置身份验证。
Java
如需了解如何安装和使用 Sensitive Data Protection 客户端库,请参阅 Sensitive Data Protection 客户端库。
如需向 Sensitive Data Protection 进行身份验证,请设置应用默认凭证。如需了解详情,请参阅为本地开发环境设置身份验证。