跳至主要內容
Google Cloud Documentation
技術領域
  • AI 和機器學習
  • 應用程式開發
  • 應用程式託管
  • 運算
  • 資料分析和管道
  • 資料庫
  • 分散式雲端、混合雲和多雲端
  • 產業解決方案
  • 遷移
  • 網路
  • 觀測能力與監控
  • 安全性
  • Storage
跨產品工具
  • 存取權與資源管理
  • 費用與用量管理
  • 基礎架構即程式碼
  • SDK、語言、框架和工具
/
控制台
  • English
  • Deutsch
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
  • Google Kubernetes Engine (GKE)
  • GKE AI/ML
免費試用
總覽 指南
Google Cloud Documentation
  • 技術領域
    • 更多
    • 總覽
    • 指南
  • 跨產品工具
    • 更多
  • 控制台
  • Discover
  • GKE 中的 AI/機器學習工作負載簡介
  • 瀏覽 GKE 說明文件
    • 總覽
    • 主要 GKE 說明文件
    • GKE AI/機器學習說明文件
    • GKE 網路說明文件
    • GKE 安全性說明文件
    • GKE 機群管理說明文件
  • 選取在 GKE 上取得及使用加速器的方式
  • GKE AI/機器學習一致性
  • 開始使用
  • 為何要使用 GKE 執行 AI/機器學習推論作業
  • 簡化 GKE 中 AI/機器學習工作負載的自動調度概念
  • 快速入門導覽課程:在 GKE 上提供第一個 AI 模型
  • 提供 AI 模型以進行推論
  • 關於 GKE 的 AI/機器學習模型推論功能
  • 使用 GKE Inference Quickstart 分析提供模型效能和成本
  • 使用 GKE Inference Gateway 公開 AI 應用程式
  • 最佳推論做法
    • 總覽
    • 選擇推論的負載平衡策略
    • 在 GPU 上自動調度推論工作負載
    • 在 TPU 上自動調整大型語言模型推論工作負載
    • 在 GPU 上最佳化 LLM 推論工作負載
    • 最佳化批次推論工作負載
  • 試用推論範例
    • GPU
      • 使用 vLLM 和 GPU 提供 Gemma 開放原始碼模型
      • 提供 DeepSeek-R1 671B 或 Llama 3.1 405B 等大型語言模型
      • 透過 GKE Inference Gateway 提供 LLM
      • 提供具備多 GPU 的 LLM
      • 使用 Torch Serve 提供 T5 模型
      • 使用多個 GPU 微調 Gemma 開放模型
      • 使用 Model Armor 保護 GKE 上的服務工作負載
    • TPU
      • 透過 vLLM 在 TPU 上提供 Llama 服務
      • 使用 JetStream 和 Pathways 透過多主機 TPU 提供 LLM
      • 使用 MaxDiffusion 在 TPU 上提供 Stable Diffusion XL
      • 使用 Terraform 在 TPU 上提供開放原始碼模型
  • 大規模訓練 AI 模型
  • 使用多層檢查點訓練大型模型
  • 試用訓練範例
    • 在 GKE Standard 模式下使用 GPU 訓練模型
    • 在 GKE Autopilot 模式中,使用 GPU 訓練模型
    • 使用 Megatron-LM 在 GPU 上訓練 Llama 模型
    • 透過 JAX 在 GKE 上使用 TPU 微調 LLM
  • 在 GKE 上執行強化學習工作負載
    • 使用 verl 微調及擴展強化學習
    • 使用 NeMo RL 微調及擴展強化學習
    • 使用 OpenTelemetry 監控強化學習工作負載
  • 部署及自動調度管理 AI 代理
  • 使用 ADK 和 Agent Platform API 部署 AI 代理
  • 使用 ADK 和自行代管的 LLM 部署 AI 代理
  • 透過 Agent Sandbox 保護 AI 代理式工作負載
    • 關於 Agent Sandbox
    • 在 GKE 上啟用 Agent Sandbox
    • 使用 Agent Sandbox 隔離 AI 程式碼執行作業
    • 儲存及還原 Agent Sandbox 環境
    • 從叢集內觸發 Agent Sandbox 快照
  • 使用 Ray 處理分散式 AI/機器學習應用程式
  • 關於 GKE 中的 Ray
  • 快速入門:在 GKE 部署第一個 Ray 應用程式
  • 透過 Ray Operator 外掛程式啟用代管 KubeRay
  • 在 GKE 上使用 Ray 部署 AI/機器學習工作負載
    • 在 GKE 上使用 Ray Serve 提供 AI 模型
      • 透過 Ray Serve 在 GPU 上提供大型語言模型
      • 透過多叢集 Ray Serve 和 Inference Gateway 提供大型語言模型
      • 透過 Ray Serve 在 TPU 上提供 LLM
      • 透過 Ray 在 GKE 上使用多主機 TPU 提供 Gemma 開放原始碼模型
      • 透過 Ray 在 GPU 上提供擴散模型
      • 使用 Ray 在 TPU 上提供擴散模型
    • 使用 Ray 在 GKE 上訓練 AI 模型
      • 使用 PyTorch、Ray 和 GKE 進行訓練
      • 使用 Jax 和 Ray Train 在 GKE 的 TPU 上訓練 LLM
      • 使用 GKE 上的 Ray Train,在 TPU 上進行多切片和彈性訓練
  • 在 GKE 上使用 Ray 搭配 GPU
    • 使用 A4X 和 GB200 在 GKE 上設定 Ray
  • 在 GKE 上透過 Ray 使用 TPU
    • 在 GKE 上使用 TPU Trillium 設定 Ray
    • 使用 DWS 和 Kueue 最佳化 TPU 上的 AI 訓練
  • 監控 GKE 中的 Ray
    • 查看 GKE 上 Ray 運算子的記錄
    • 查看 GKE 上 Ray 叢集的記錄和指標
    • 使用 Ray 記錄伺服器對已完成的 Ray 工作進行偵錯
  • 使用 Slurm Operator 處理 HPC 和 AI/機器學習工作負載
  • 關於 GKE 上的 Slurm
  • 快速入門:在 GKE 上部署 Slurm 叢集
  • 啟用 Slurm Operator 外掛程式
  • 建構自訂 Slurm Docker 映像檔
  • 為 GKE 上的 Slurm 設定共用儲存空間
    • 為 Slurm 設定 Filestore
    • 適用於 Slurm 的 Managed Lustre
  • 管理 GKE 的 GPU
  • 關於 GPU
  • 為 AI/機器學習工作負載設定 GPU
    • 使用 AI Hypercomputer 設定 A3 或 A4 VM
    • 在 Standard 叢集中部署 GPU 工作負載
    • 在 Autopilot 叢集中部署 GPU 工作負載
    • 設定 GPU 上 LLM 工作負載的自動調度資源功能
    • 使用 NVIDIA GPU Operator 管理 GPU 堆疊
    • 就地加密 GPU 工作負載
  • 為高效能運算 (HPC) 佈建資源
    • 部署 AI Hypercomputer 叢集 (A3、A4 VM)
  • 運用 GPU 共用策略,盡量提高 GPU 使用率
    • 關於 GKE 的 GPU 共用策略
    • 使用多實體 GPU
    • 設定分時 GPU
    • 使用 NVIDIA MPS
  • 使用彈性啟動功能,最佳化 GPU 佈建作業
    • 總覽
    • 使用彈性啟動執行大規模工作負載
    • 使用 GPU 和彈性啟動模式執行小型批次工作負載
  • 管理 GKE 中的 TPU
  • 關於 TPU
  • 版本
    • Ironwood (TPU7x)
  • 規劃 GKE 中的 TPU
  • 為 AI/機器學習工作負載設定 TPU
    • 在 Standard 叢集上部署 TPU 工作負載
    • 在 Autopilot 叢集上部署 TPU 工作負載
    • 透過自動聯網功能部署高效能 TPU 工作負載
    • 在 GKE 上部署 TPU Multislices
    • 使用 JobSet 和 Kueue 自動化調度管理 TPU Multislice 工作負載
  • 在 TPU 上為 LLM 工作負載設定自動調度資源功能
  • 使用彈性啟動模式最佳化 TPU 佈建作業
    • 總覽
    • 使用 TPU 和彈性啟動功能執行小型批次工作負載
    • 在日曆模式中,要求未來預留項目 TPU
  • 使用動態切片功能,盡量提高 TPU 使用率
    • 關於 TPU All Capacity 模式
    • 關於 TPU 動態配量
      • 總覽
      • 使用自訂排程器進行動態切片
      • 使用 Kueue 和 TAS 排定動態配額
  • 管理 GPU 和 TPU 的 GKE 節點中斷情形
  • 關於 GPU 和 TPU 的節點中斷
  • 使用 Kueue 進行工作佇列和資源最佳化
    • 在 GKE 上執行批次工作負載的最佳做法
    • 使用 Kueue 部署批次系統
    • 實作配額共用的工作佇列系統
    • 針對混合式 AI/機器學習訓練和推論工作負載,最佳化資源用量
    • 最佳化 AI/機器學習工作負載優先順序
    • 使用 JobSet 和 Kueue 自動化調度管理 TPU Multislice 工作負載
  • 管理 AI/機器學習工作負載的網路
  • 使用 GKE 管理的 DRANET 分配網路資源
  • 設定加速器的自動網路功能
  • 管理 AI/機器學習工作負載的資料和儲存空間
  • 關於 GKE 叢集的儲存空間
  • 加快資料存取速度並提升效能
    • 使用 Run:ai Model Streamer 和 vLLM 加快模型載入速度
    • 關於 GKE 適用的 Cloud Storage FUSE CSI 驅動程式
    • 使用 Hyperdisk ML 加速載入 AI/機器學習資料
    • 使用 GKE 資料快取功能,加快有狀態工作負載的讀取效能
    • 使用 GKE Volume Populator 從 Cloud Storage 移轉資料
  • 使用向量資料庫和 RAG 建構應用程式
    • 使用 GKE 和 Cloud Storage 建構 RAG 聊天機器人
    • 在 GKE 上部署 Qdrant 向量資料庫
  • 保護 AI/機器學習工作負載
  • GKE 上 AI 工作負載的安全防護最佳做法
  • 使用 Model Armor 保護 GKE 上的服務工作負載
  • 監控 AI/機器學習工作負載
  • 為 AI/機器學習工作負載部署自動應用程式監控功能
  • 疑難排解
  • 排解加速器問題
    • 排解 GPU 問題
    • 排解 TPU 問題
  • AI 和機器學習
  • 應用程式開發