Model Armor 是一项 Google Cloud 服务,旨在增强 AI 应用的安防和安全性。它通过主动过滤 LLM 提示和回答来防范各种风险,并确保Responsible AI 实践。无论您是在云环境还是在外部云提供商中部署 AI,Model Armor 都能帮助您防止恶意输入、验证内容安全性、保护敏感数据、保持合规性,并在各种 AI 环境中始终如一地执行 AI 安全政策。
架构
此架构图显示了一个使用 Model Armor 来保护 LLM 和用户的应用。以下步骤介绍了数据流。
- 用户向应用提供提示。
- Model Armor 会检查传入的提示中是否存在潜在的敏感内容。
- 提示(或经过清理的提示)会发送到 LLM。
- LLM 会生成响应。
- Model Armor 会检查生成的响应是否存在潜在的敏感内容。
- 响应(或经过清理的响应)会发送给用户。Model Armor 会在响应中发送已触发的和未触发的过滤条件的详细说明。
Model Armor 会过滤输入(提示)和输出(回答),以防止 LLM 接触或生成恶意或敏感内容。
使用场景
Model Armor 在多个行业中都有多种应用场景:
安全
- 降低敏感知识产权 (IP) 和个人身份信息 (PII) 泄露的风险,避免将其包含在 LLM 提示或响应中。
- 防范提示注入和越狱攻击,防止恶意方操纵 AI 系统执行意外操作。
- 扫描 PDF 中的文本,以查找敏感内容或恶意内容。
安全和 Responsible AI
- 阻止聊天机器人推荐竞争对手的解决方案,从而维护品牌声誉和客户忠诚度。
- 组织可以过滤 AI 生成的包含有害信息(例如危险内容或仇恨内容)的社交媒体帖子。
Model Armor 模板
借助 Model Armor 模板,您可以配置 Model Armor 过滤提示和回答的方式。它们作为一套定制化过滤条件及阈值机制运作,专用于检测不同安全与防护置信度级别,可用于控制标记哪些内容。
相应阈值表示置信度,即 Model Armor 对提示或回答中包含冒犯性内容的把握程度。例如,您可以创建一个模板,用于过滤包含仇恨内容的提示,并设置 HIGH 阈值,这意味着 Model Armor 会报告提示包含仇恨内容的高置信度。LOW_AND_ABOVE 阈值表示在做出相应声明时具有任何程度的置信度(LOW、MEDIUM 和 HIGH)。
如需了解详情,请参阅 Model Armor 模板。
Model Armor 置信度
您可以为 Responsible AI 安全类别(露骨色情、危险、骚扰和仇恨言论)、提示注入和越狱检测以及敏感数据保护(包括主题性)设置置信度水平。
对于允许使用精细阈值的置信度,Model Armor 会按如下方式进行解读:
- 高:识别消息是否包含高概率的内容。
- 中等及以上:识别消息是否包含中或高概率的内容。