跳至主要内容
技术领域
AI 和机器学习
应用开发
应用托管
计算
数据分析和流水线
数据库
分布式云、混合云和多云
行业解决方案
迁移
网络
可观测性和监控
安全
Storage
跨产品工具
访问权限和资源管理
费用和用量管理
基础设施即代码
SDK、语言、框架和工具
/
控制台
English
Deutsch
Español
Español – América Latina
Français
Indonesia
Italiano
Português
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Google Kubernetes Engine (GKE)
GKE AI/ML
免费开始使用吧
概览
指南
技术领域
更多
概览
指南
跨产品工具
更多
控制台
Discover
GKE 上的 AI/机器学习工作负载简介
探索 GKE 文档
概览
主要 GKE 文档
GKE AI/机器学习文档
GKE 网络文档
GKE 安全文档
GKE 舰队管理文档
选择如何在 GKE 上获取和使用加速器
GKE AI/机器学习一致性
开始使用
为何使用 GKE 进行 AI/机器学习推理
GKE 中 AI/机器学习工作负载的简化自动扩缩概念
快速入门:在 GKE 上部署您的第一个 AI 模型
部署 AI 模型以进行推理
GKE 上的 AI/机器学习模型推理简介
使用 GKE 推理快速入门分析模型部署性能和费用
使用 GKE 推理网关公开 AI 应用
推理最佳实践
概览
为推理选择负载均衡策略
自动扩缩 GPU 上的推理工作负载
自动扩缩 TPU 上的 LLM 推理工作负载
优化 GPU 上的 LLM 推理工作负载
优化批处理推理工作负载
试用推理示例
GPU
通过 vLLM 使用 GPU 部署 Gemma 开放模型
部署 DeepSeek-R1 671B 或 Llama 3.1 405B 等 LLM
使用 GKE 推理网关提供 LLM
通过多个 GPU 提供 LLM
使用 Torch Serve 部署 T5
使用多个 GPU 微调 Gemma 开放模型
使用 Model Armor 保护 GKE 上的部署工作负载
TPU
通过 vLLM 在 TPU 上部署 Llama
通过 JetStream 和 Pathways 使用多主机 TPU 部署 LLM
通过 MaxDiffusion 在 TPU 上部署 Stable Diffusion XL
使用 Terraform 在 TPU 上部署开放模型
大规模训练 AI 模型
使用多层级检查点训练大规模模型
尝试训练样本
在 GKE Standard 模式下使用 GPU 训练模型
在 GKE Autopilot 模式下使用 GPU 训练模型
使用 Megatron-LM 在 GPU 上训练 Llama 模型
使用 JAX 在 GKE 上通过 TPU 微调 LLM
在 GKE 上运行强化学习工作负载
使用 verl 微调和扩缩强化学习
使用 NeMo RL 微调和扩缩强化学习
使用 OpenTelemetry 监控强化学习工作负载
部署和编排 AI 代理
使用 ADK 和 Agent Platform API 部署 AI 代理
使用 ADK 和自托管 LLM 部署 AI 代理
使用智能体沙盒保护 AI 智能体工作负载
Agent Sandbox 简介
在 GKE 上启用 Agent Sandbox
使用 Agent Sandbox 隔离 AI 代码执行
保存和恢复 Agent Sandbox 环境
从集群内部触发 Agent Sandbox 快照
使用 Ray 开发分布式 AI/机器学习应用
Ray on GKE 简介
快速入门:在 GKE 上部署您的第一个 Ray 应用
通过 Ray Operator 插件启用托管式 KubeRay
在 GKE 上使用 Ray 部署 AI/机器学习工作负载
在 GKE 上使用 Ray Serve 部署 AI 模型
使用 Ray Serve 在 GPU 上部署 LLM
使用多集群 Ray Serve 和推理网关部署 LLM
使用 Ray Serve 在 TPU 上部署 LLM
通过 Ray 使用 GKE 中的多主机 TPU 应用 Gemma 开放模型
使用 Ray 在 GPU 上部署 diffusion 模型
使用 Ray 在 TPU 上部署 diffusion 模型
在 GKE 上使用 Ray 训练 AI 模型
使用 PyTorch、Ray 和 GKE 进行训练