跳至主要內容
技術領域
AI 和機器學習
應用程式開發
應用程式託管
運算
資料分析和管道
資料庫
分散式雲端、混合雲和多雲端
產業解決方案
遷移
網路
觀測能力與監控
安全性
Storage
跨產品工具
存取權與資源管理
費用與用量管理
基礎架構即程式碼
SDK、語言、框架和工具
/
控制台
English
Deutsch
Español – América Latina
Français
Indonesia
Italiano
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Google Kubernetes Engine (GKE)
GKE AI/ML
免費試用
總覽
指南
技術領域
更多
總覽
指南
跨產品工具
更多
控制台
Discover
GKE 中的 AI/機器學習工作負載簡介
瀏覽 GKE 說明文件
總覽
主要 GKE 說明文件
GKE AI/機器學習說明文件
GKE 網路說明文件
GKE 安全性說明文件
GKE 機群管理說明文件
選取在 GKE 上取得及使用加速器的方式
GKE AI/機器學習一致性
開始使用
為何要使用 GKE 執行 AI/機器學習推論作業
簡化 GKE 中 AI/機器學習工作負載的自動調度概念
快速入門導覽課程:在 GKE 上提供第一個 AI 模型
提供 AI 模型以進行推論
關於 GKE 的 AI/機器學習模型推論功能
使用 GKE Inference Quickstart 分析提供模型效能和成本
使用 GKE Inference Gateway 公開 AI 應用程式
最佳推論做法
總覽
選擇推論的負載平衡策略
在 GPU 上自動調度推論工作負載
在 TPU 上自動調整大型語言模型推論工作負載
在 GPU 上最佳化 LLM 推論工作負載
最佳化批次推論工作負載
試用推論範例
GPU
使用 vLLM 和 GPU 提供 Gemma 開放原始碼模型
提供 DeepSeek-R1 671B 或 Llama 3.1 405B 等大型語言模型
透過 GKE Inference Gateway 提供 LLM
提供具備多 GPU 的 LLM
使用 Torch Serve 提供 T5 模型
使用多個 GPU 微調 Gemma 開放模型
使用 Model Armor 保護 GKE 上的服務工作負載
TPU
透過 vLLM 在 TPU 上提供 Llama 服務
使用 JetStream 和 Pathways 透過多主機 TPU 提供 LLM
使用 MaxDiffusion 在 TPU 上提供 Stable Diffusion XL
使用 Terraform 在 TPU 上提供開放原始碼模型
大規模訓練 AI 模型
使用多層檢查點訓練大型模型
試用訓練範例
在 GKE Standard 模式下使用 GPU 訓練模型
在 GKE Autopilot 模式中,使用 GPU 訓練模型
使用 Megatron-LM 在 GPU 上訓練 Llama 模型
透過 JAX 在 GKE 上使用 TPU 微調 LLM
在 GKE 上執行強化學習工作負載
使用 verl 微調及擴展強化學習
使用 NeMo RL 微調及擴展強化學習
使用 OpenTelemetry 監控強化學習工作負載
部署及自動調度管理 AI 代理
使用 ADK 和 Agent Platform API 部署 AI 代理
使用 ADK 和自行代管的 LLM 部署 AI 代理
透過 Agent Sandbox 保護 AI 代理式工作負載
關於 Agent Sandbox
在 GKE 上啟用 Agent Sandbox
使用 Agent Sandbox 隔離 AI 程式碼執行作業
儲存及還原 Agent Sandbox 環境
從叢集內觸發 Agent Sandbox 快照
使用 Ray 處理分散式 AI/機器學習應用程式
關於 GKE 中的 Ray
快速入門:在 GKE 部署第一個 Ray 應用程式
透過 Ray Operator 外掛程式啟用代管 KubeRay
在 GKE 上使用 Ray 部署 AI/機器學習工作負載
在 GKE 上使用 Ray Serve 提供 AI 模型
透過 Ray Serve 在 GPU 上提供大型語言模型
透過多叢集 Ray Serve 和 Inference Gateway 提供大型語言模型
透過 Ray Serve 在 TPU 上提供 LLM
透過 Ray 在 GKE 上使用多主機 TPU 提供 Gemma 開放原始碼模型
透過 Ray 在 GPU 上提供擴散模型
使用 Ray 在 TPU 上提供擴散模型
使用 Ray 在 GKE 上訓練 AI 模型
使用 PyTorch、Ray 和 GKE 進行訓練
使用 Jax 和 Ray Train 在 GKE 的 TPU 上訓練 LLM
使用 GKE 上的 Ray Train,在 TPU 上進行多切片和彈性訓練
在 GKE 上使用 Ray 搭配 GPU
使用 A4X 和 GB200 在 GKE 上設定 Ray
在 GKE 上透過 Ray 使用 TPU
在 GKE 上使用 TPU Trillium 設定 Ray
使用 DWS 和 Kueue 最佳化 TPU 上的 AI 訓練
監控 GKE 中的 Ray
查看 GKE 上 Ray 運算子的記錄
查看 GKE 上 Ray 叢集的記錄和指標
使用 Ray 記錄伺服器對已完成的 Ray 工作進行偵錯
使用 Slurm Operator 處理 HPC 和 AI/機器學習工作負載
關於 GKE 上的 Slurm
快速入門:在 GKE 上部署 Slurm 叢集
啟用 Slurm Operator 外掛程式
建構自訂 Slurm Docker 映像檔
為 GKE 上的 Slurm 設定共用儲存空間
為 Slurm 設定 Filestore
適用於 Slurm 的 Managed Lustre
管理 GKE 的 GPU
關於 GPU
為 AI/機器學習工作負載設定 GPU
使用 AI Hypercomputer 設定 A3 或 A4 VM
在 Standard 叢集中部署 GPU 工作負載
在 Autopilot 叢集中部署 GPU 工作負載
設定 GPU 上 LLM 工作負載的自動調度資源功能
使用 NVIDIA GPU Operator 管理 GPU 堆疊
就地加密 GPU 工作負載
為高效能運算 (HPC) 佈建資源
部署 AI Hypercomputer 叢集 (A3、A4 VM)
運用 GPU 共用策略,盡量提高 GPU 使用率
關於 GKE 的 GPU 共用策略
使用多實體 GPU
設定分時 GPU
使用 NVIDIA MPS
使用彈性啟動功能,最佳化 GPU 佈建作業
總覽
使用彈性啟動執行大規模工作負載
使用 GPU 和彈性啟動模式執行小型批次工作負載
管理 GKE 中的 TPU
關於 TPU
版本
Ironwood (TPU7x)
規劃 GKE 中的 TPU
為 AI/機器學習工作負載設定 TPU
在 Standard 叢集上部署 TPU 工作負載
在 Autopilot 叢集上部署 TPU 工作負載
透過自動聯網功能部署高效能 TPU 工作負載
在 GKE 上部署 TPU Multislices
使用 JobSet 和 Kueue 自動化調度管理 TPU Multislice 工作負載
在 TPU 上為 LLM 工作負載設定自動調度資源功能
使用彈性啟動模式最佳化 TPU 佈建作業
總覽
使用 TPU 和彈性啟動功能執行小型批次工作負載
在日曆模式中,要求未來預留項目 TPU
使用動態切片功能,盡量提高 TPU 使用率
關於 TPU All Capacity 模式
關於 TPU 動態配量
總覽
使用自訂排程器進行動態切片
使用 Kueue 和 TAS 排定動態配額
管理 GPU 和 TPU 的 GKE 節點中斷情形
關於 GPU 和 TPU 的節點中斷
使用 Kueue 進行工作佇列和資源最佳化
在 GKE 上執行批次工作負載的最佳做法
使用 Kueue 部署批次系統
實作配額共用的工作佇列系統
針對混合式 AI/機器學習訓練和推論工作負載,最佳化資源用量
最佳化 AI/機器學習工作負載優先順序
使用 JobSet 和 Kueue 自動化調度管理 TPU Multislice 工作負載
管理 AI/機器學習工作負載的網路
使用 GKE 管理的 DRANET 分配網路資源
設定加速器的自動網路功能
管理 AI/機器學習工作負載的資料和儲存空間
關於 GKE 叢集的儲存空間
加快資料存取速度並提升效能
使用 Run:ai Model Streamer 和 vLLM 加快模型載入速度
關於 GKE 適用的 Cloud Storage FUSE CSI 驅動程式
使用 Hyperdisk ML 加速載入 AI/機器學習資料
使用 GKE 資料快取功能,加快有狀態工作負載的讀取效能
使用 GKE Volume Populator 從 Cloud Storage 移轉資料
使用向量資料庫和 RAG 建構應用程式
使用 GKE 和 Cloud Storage 建構 RAG 聊天機器人
在 GKE 上部署 Qdrant 向量資料庫
保護 AI/機器學習工作負載
GKE 上 AI 工作負載的安全防護最佳做法
使用 Model Armor 保護 GKE 上的服務工作負載
監控 AI/機器學習工作負載
為 AI/機器學習工作負載部署自動應用程式監控功能
疑難排解
排解加速器問題
排解 GPU 問題
排解 TPU 問題
AI 和機器學習
應用程式開發