Model Armor 概览

Model Armor 是一项 Google Cloud 服务,旨在增强 AI 应用的安防和安全性。它通过主动过滤 LLM 提示和回答来防范各种风险,并确保Responsible AI 实践。无论您是在云环境还是在外部云提供商中部署 AI,Model Armor 都能帮助您防止恶意输入、验证内容安全性、保护敏感数据、保持合规性,并在各种 AI 环境中始终如一地执行 AI 安全政策。

架构

Model Armor 架构 此架构图显示了一个使用 Model Armor 来保护 LLM 和用户的应用。以下步骤介绍了数据流。

  1. 用户向应用提供提示。
  2. Model Armor 会检查传入的提示中是否存在潜在的敏感内容。
  3. 提示(或经过清理的提示)会发送到 LLM。
  4. LLM 会生成响应。
  5. Model Armor 会检查生成的响应是否存在潜在的敏感内容。
  6. 响应(或经过清理的响应)会发送给用户。Model Armor 会在响应中发送已触发的和未触发的过滤条件的详细说明。

Model Armor 会过滤输入(提示)和输出(回答),以防止 LLM 接触或生成恶意或敏感内容。

使用场景

Model Armor 在多个行业中都有多种应用场景:

  • 安全

    • 降低敏感知识产权 (IP) 和个人身份信息 (PII) 泄露的风险,避免将其包含在 LLM 提示或响应中。
    • 防范提示注入和越狱攻击,防止恶意方操纵 AI 系统执行意外操作。
    • 扫描 PDF 中的文本,以查找敏感内容或恶意内容。
  • 安全和 Responsible AI

    • 阻止聊天机器人推荐竞争对手的解决方案,从而维护品牌声誉和客户忠诚度。
    • 组织可以过滤 AI 生成的包含有害信息(例如危险内容或仇恨内容)的社交媒体帖子。

Model Armor 模板

借助 Model Armor 模板,您可以配置 Model Armor 过滤提示和回答的方式。它们作为一套定制化过滤条件及阈值机制运作,专用于检测不同安全与防护置信度级别,可用于控制标记哪些内容。

相应阈值表示置信度,即 Model Armor 对提示或回答中包含冒犯性内容的把握程度。例如,您可以创建一个模板,用于过滤包含仇恨内容的提示,并设置 HIGH 阈值,这意味着 Model Armor 会报告提示包含仇恨内容的高置信度。LOW_AND_ABOVE 阈值表示在做出相应声明时具有任何程度的置信度(LOWMEDIUMHIGH)。

如需了解详情,请参阅 Model Armor 模板

Model Armor 置信度

您可以为 Responsible AI 安全类别(露骨色情、危险、骚扰和仇恨言论)、提示注入和越狱检测以及敏感数据保护(包括主题性)设置置信度水平。

对于允许使用精细阈值的置信度,Model Armor 会按如下方式进行解读:

  • :识别消息是否包含高概率的内容。
  • 中等及以上:识别消息是否包含中或高概率的内容。