跳至主要内容
Google Cloud Documentation
技术领域
  • AI 和机器学习
  • 应用开发
  • 应用托管
  • 计算
  • 数据分析和流水线
  • 数据库
  • 分布式云、混合云和多云
  • 行业解决方案
  • 迁移
  • 网络
  • 可观测性和监控
  • 安全
  • Storage
跨产品工具
  • 访问权限和资源管理
  • 费用和用量管理
  • 基础设施即代码
  • SDK、语言、框架和工具
/
控制台
  • English
  • Deutsch
  • Español
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
  • Google Kubernetes Engine (GKE)
  • GKE AI/ML
免费开始使用吧
概览 指南
Google Cloud Documentation
  • 技术领域
    • 更多
    • 概览
    • 指南
  • 跨产品工具
    • 更多
  • 控制台
  • Discover
  • GKE 上的 AI/机器学习工作负载简介
  • 探索 GKE 文档
    • 概览
    • 主要 GKE 文档
    • GKE AI/机器学习文档
    • GKE 网络文档
    • GKE 安全文档
    • GKE 舰队管理文档
  • 选择如何在 GKE 上获取和使用加速器
  • GKE AI/机器学习一致性
  • 开始使用
  • 为何使用 GKE 进行 AI/机器学习推理
  • GKE 中 AI/机器学习工作负载的简化自动扩缩概念
  • 快速入门:在 GKE 上部署您的第一个 AI 模型
  • 部署 AI 模型以进行推理
  • GKE 上的 AI/机器学习模型推理简介
  • 使用 GKE 推理快速入门分析模型部署性能和费用
  • 使用 GKE 推理网关公开 AI 应用
  • 推理最佳实践
    • 概览
    • 为推理选择负载均衡策略
    • 自动扩缩 GPU 上的推理工作负载
    • 自动扩缩 TPU 上的 LLM 推理工作负载
    • 优化 GPU 上的 LLM 推理工作负载
    • 优化批处理推理工作负载
  • 试用推理示例
    • GPU
      • 通过 vLLM 使用 GPU 部署 Gemma 开放模型
      • 部署 DeepSeek-R1 671B 或 Llama 3.1 405B 等 LLM
      • 使用 GKE 推理网关提供 LLM
      • 通过多个 GPU 提供 LLM
      • 使用 Torch Serve 部署 T5
      • 使用多个 GPU 微调 Gemma 开放模型
      • 使用 Model Armor 保护 GKE 上的部署工作负载
    • TPU
      • 通过 vLLM 在 TPU 上部署 Llama
      • 通过 JetStream 和 Pathways 使用多主机 TPU 部署 LLM
      • 通过 MaxDiffusion 在 TPU 上部署 Stable Diffusion XL
      • 使用 Terraform 在 TPU 上部署开放模型
  • 大规模训练 AI 模型
  • 使用多层级检查点训练大规模模型
  • 尝试训练样本
    • 在 GKE Standard 模式下使用 GPU 训练模型
    • 在 GKE Autopilot 模式下使用 GPU 训练模型
    • 使用 Megatron-LM 在 GPU 上训练 Llama 模型
    • 使用 JAX 在 GKE 上通过 TPU 微调 LLM
  • 在 GKE 上运行强化学习工作负载
    • 使用 verl 微调和扩缩强化学习
    • 使用 NeMo RL 微调和扩缩强化学习
    • 使用 OpenTelemetry 监控强化学习工作负载
  • 部署和编排 AI 代理
  • 使用 ADK 和 Agent Platform API 部署 AI 代理
  • 使用 ADK 和自托管 LLM 部署 AI 代理
  • 使用智能体沙盒保护 AI 智能体工作负载
    • Agent Sandbox 简介
    • 在 GKE 上启用 Agent Sandbox
    • 使用 Agent Sandbox 隔离 AI 代码执行
    • 保存和恢复 Agent Sandbox 环境
    • 从集群内部触发 Agent Sandbox 快照
  • 使用 Ray 开发分布式 AI/机器学习应用
  • Ray on GKE 简介
  • 快速入门:在 GKE 上部署您的第一个 Ray 应用
  • 通过 Ray Operator 插件启用托管式 KubeRay
  • 在 GKE 上使用 Ray 部署 AI/机器学习工作负载
    • 在 GKE 上使用 Ray Serve 部署 AI 模型
      • 使用 Ray Serve 在 GPU 上部署 LLM
      • 使用多集群 Ray Serve 和推理网关部署 LLM
      • 使用 Ray Serve 在 TPU 上部署 LLM
      • 通过 Ray 使用 GKE 中的多主机 TPU 应用 Gemma 开放模型
      • 使用 Ray 在 GPU 上部署 diffusion 模型
      • 使用 Ray 在 TPU 上部署 diffusion 模型
    • 在 GKE 上使用 Ray 训练 AI 模型
      • 使用 PyTorch、Ray 和 GKE 进行训练