跳至主要内容
技术领域
AI 和机器学习
应用开发
应用托管
计算
数据分析和流水线
数据库
分布式云、混合云和多云
行业解决方案
迁移
网络
可观测性和监控
安全
Storage
跨产品工具
访问权限和资源管理
费用和用量管理
基础设施即代码
SDK、语言、框架和工具
/
控制台
English
Deutsch
Español
Español – América Latina
Français
Indonesia
Italiano
Português
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Google Kubernetes Engine (GKE)
GKE AI/ML
免费开始使用吧
概览
指南
技术领域
更多
概览
指南
跨产品工具
更多
控制台
Discover
GKE 上的 AI/机器学习工作负载简介
探索 GKE 文档
概览
主要 GKE 文档
GKE AI/机器学习文档
GKE 网络文档
GKE 安全文档
GKE 舰队管理文档
选择如何在 GKE 上获取和使用加速器
GKE AI/机器学习一致性
开始使用
为何使用 GKE 进行 AI/机器学习推理
GKE 中 AI/机器学习工作负载的简化自动扩缩概念
快速入门:在 GKE 上部署您的第一个 AI 模型
部署 AI 模型以进行推理
GKE 上的 AI/机器学习模型推理简介
使用 GKE 推理快速入门分析模型部署性能和费用
使用 GKE 推理网关公开 AI 应用
推理最佳实践
概览
为推理选择负载均衡策略
自动扩缩 GPU 上的推理工作负载
自动扩缩 TPU 上的 LLM 推理工作负载
优化 GPU 上的 LLM 推理工作负载
优化批处理推理工作负载
试用推理示例
GPU
通过 vLLM 使用 GPU 部署 Gemma 开放模型
部署 DeepSeek-R1 671B 或 Llama 3.1 405B 等 LLM
使用 GKE 推理网关提供 LLM
通过多个 GPU 提供 LLM
使用 Torch Serve 部署 T5
使用多个 GPU 微调 Gemma 开放模型
使用 Model Armor 保护 GKE 上的部署工作负载
TPU
通过 vLLM 在 TPU 上部署 Llama
通过 JetStream 和 Pathways 使用多主机 TPU 部署 LLM
通过 MaxDiffusion 在 TPU 上部署 Stable Diffusion XL
使用 Terraform 在 TPU 上部署开放模型
大规模训练 AI 模型
使用多层级检查点训练大规模模型
尝试训练样本
在 GKE Standard 模式下使用 GPU 训练模型
在 GKE Autopilot 模式下使用 GPU 训练模型
使用 Megatron-LM 在 GPU 上训练 Llama 模型
使用 JAX 在 GKE 上通过 TPU 微调 LLM
在 GKE 上运行强化学习工作负载
使用 verl 微调和扩缩强化学习
使用 NeMo RL 微调和扩缩强化学习
使用 OpenTelemetry 监控强化学习工作负载
部署和编排 AI 代理
使用 ADK 和 Agent Platform API 部署 AI 代理
使用 ADK 和自托管 LLM 部署 AI 代理
使用智能体沙盒保护 AI 智能体工作负载
Agent Sandbox 简介
在 GKE 上启用 Agent Sandbox
使用 Agent Sandbox 隔离 AI 代码执行
保存和恢复 Agent Sandbox 环境
从集群内部触发 Agent Sandbox 快照
使用 Ray 开发分布式 AI/机器学习应用
Ray on GKE 简介
快速入门:在 GKE 上部署您的第一个 Ray 应用
通过 Ray Operator 插件启用托管式 KubeRay
在 GKE 上使用 Ray 部署 AI/机器学习工作负载
在 GKE 上使用 Ray Serve 部署 AI 模型
使用 Ray Serve 在 GPU 上部署 LLM
使用多集群 Ray Serve 和推理网关部署 LLM
使用 Ray Serve 在 TPU 上部署 LLM
通过 Ray 使用 GKE 中的多主机 TPU 应用 Gemma 开放模型
使用 Ray 在 GPU 上部署 diffusion 模型
使用 Ray 在 TPU 上部署 diffusion 模型
在 GKE 上使用 Ray 训练 AI 模型
使用 PyTorch、Ray 和 GKE 进行训练
使用 GKE 中的 TPU 通过 Jax 和 Ray Train 训练 LLM
在 GKE 上使用 Ray Train 在 TPU 上进行多切片训练和弹性训练
将 GPU 与 Ray on GKE 搭配使用
使用 A4X 和 GB200 设置 GKE 上的 Ray
在 GKE 上将 TPU 与 Ray 搭配使用
使用 TPU Trillium 在 GKE 上设置 Ray
使用 DWS 和 Kueue 在 TPU 上优化 AI 训练
监控 GKE 上的 Ray
查看 GKE 上 Ray Operator 的日志
查看 GKE 上 Ray 集群的日志和指标
使用 Ray History Server 调试已完成的 Ray 作业
针对 HPC 和 AI/机器学习工作负载使用 Slurm Operator
GKE 上的 Slurm 简介
快速入门:在 GKE 上部署 Slurm 集群
启用 Slurm Operator 插件
构建自定义 Slurm Docker 映像
为 GKE 上的 Slurm 配置共享存储空间
为 Slurm 配置 Filestore
适用于 Slurm 的 Managed Lustre
管理 GKE 上的 GPU
GPU 简介
为 AI/机器学习工作负载配置 GPU
使用 AI Hypercomputer 配置 A3 或 A4 虚拟机
在 Standard 集群中部署 GPU 工作负载
在 Autopilot 集群中部署 GPU 工作负载
为 GPU 上的 LLM 工作负载配置自动扩缩
使用 NVIDIA GPU Operator 管理 GPU 栈
就地加密 GPU 工作负载
为高性能计算 (HPC) 预配资源
部署 AI Hypercomputer 集群(A3、A4 虚拟机)
通过 GPU 共享策略优化 GPU 利用率
GKE 上的 GPU 共享策略简介
使用多实例 GPU
配置分时 GPU
使用 NVIDIA MPS
使用灵活启动优化 GPU 预配
概览
使用灵活启动运行大规模工作负载
使用 GPU 和灵活启动运行小型批量工作负载
管理 GKE 上的 TPU
TPU 简介
版本
Ironwood (TPU7x)
规划 GKE 上的 TPU
为 AI/机器学习工作负载配置 TPU
在 Standard 集群上部署 TPU 工作负载
在 Autopilot 集群上部署 TPU 工作负载
通过自动联网部署高性能 TPU 工作负载
在 GKE 上部署 TPU 多切片
使用 JobSet 和 Kueue 编排 TPU 多切片工作负载
为 TPU 上的 LLM 工作负载配置自动扩缩
使用灵活启动优化 TPU 预配
概览
使用 TPU 和灵活启动运行小型批量工作负载
在日历模式下请求具有未来预留的 TPU
通过动态切分优化 TPU 利用率
TPU 全容量模式简介
TPU 动态切片简介
概览
将动态切片与自定义调度器搭配使用
使用 Kueue 和 TAS 调度动态切片
管理 GPU 和 TPU 的 GKE 节点中断
GPU 和 TPU 的节点中断简介
使用 Kueue 进行作业排队和资源优化
在 GKE 上运行批处理工作负载的最佳实践
使用 Kueue 部署批处理系统
使用配额共享实现 Job 排队系统
针对混合 AI/机器学习训练和推理工作负载优化资源利用率
优化 AI/机器学习工作负载优先级
使用 JobSet 和 Kueue 编排 TPU 多切片工作负载
为 AI/机器学习工作负载管理网络
使用 GKE 托管的 DRANET 来分配网络资源
为加速器配置自动联网
为 AI/机器学习工作负载管理数据和存储
GKE 集群的存储简介
加快数据访问速度并提升性能
使用 Run:ai Model Streamer 和 vLLM 加快模型加载速度
关于适用于 GKE 的 Cloud Storage FUSE CSI 驱动程序
利用 Hyperdisk ML 加快 AI/机器学习数据加载速度
使用 GKE 数据缓存提升有状态工作负载的读取性能
使用 GKE Volume Populator 从 Cloud Storage 传输数据
使用向量数据库和 RAG 构建应用
使用 GKE 和 Cloud Storage 构建 RAG 聊天机器人
在 GKE 上部署 Qdrant 向量数据库
保护 AI/机器学习工作负载
GKE 上 AI 工作负载安全性的最佳实践
使用 Model Armor 保护 GKE 上的部署工作负载
监控 AI/机器学习工作负载
为 AI/机器学习工作负载部署自动应用监控
排查问题
排查加速器问题
排查 GPU 问题
排查 TPU 问题
AI 和机器学习
应用开发
应用托管
计算
数据分析和流水线
数据库
分布式云、混合云和多云
行业解决方案
迁移
网络
可观测性和监控
安全
Storage
访问权限和资源管理