Langsung ke konten utama
Google Cloud Documentation
Area teknologi
  • AI dan ML
  • Pengembangan aplikasi
  • Hosting aplikasi
  • Compute
  • Pipeline dan analisis data
  • Database
  • Terdistribusi, hybrid, dan multicloud
  • Solusi industri
  • Migrasi
  • Jaringan
  • Kemampuan observasi dan pemantauan
  • Keamanan
  • Storage
Alat cross product
  • Pengelolaan akses dan resource
  • Pengelolaan biaya dan penggunaan
  • Infrastruktur sebagai kode
  • SDK, bahasa, framework, dan alat
/
Konsol
  • English
  • Deutsch
  • Español
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
Masuk
  • Google Kubernetes Engine (GKE)
  • GKE AI/ML
Mulai gratis
Ringkasan Panduan
Google Cloud Documentation
  • Area teknologi
    • Lainnya
    • Ringkasan
    • Panduan
  • Alat cross product
    • Lainnya
  • Konsol
  • Temukan
  • Pengantar workload AI/ML di GKE
  • Mempelajari dokumentasi GKE
    • Ringkasan
    • Dokumentasi utama GKE
    • Dokumentasi AI/ML GKE
    • Dokumentasi jaringan GKE
    • Dokumentasi keamanan GKE
    • Dokumentasi pengelolaan fleet GKE
  • Pilih cara mendapatkan dan menggunakan akselerator di GKE
  • Kesesuaian AI/ML GKE
  • Mulai
  • Alasan menggunakan GKE untuk inferensi AI/ML
  • Konsep penskalaan otomatis yang disederhanakan untuk workload AI/ML di GKE
  • Panduan memulai: Menyajikan model AI pertama Anda di GKE
  • Menyajikan model AI untuk inferensi
  • Tentang inferensi model AI/ML di GKE
  • Menganalisis performa dan biaya penyajian model dengan Panduan Memulai Inferensi GKE
  • Mengekspos aplikasi AI dengan GKE Inference Gateway
  • Praktik terbaik untuk inferensi
    • Ringkasan
    • Memilih strategi load balancing untuk inferensi
    • Menskalakan otomatis workload inferensi di GPU
    • Menskalakan otomatis workload inferensi LLM di TPU
    • Mengoptimalkan workload inferensi LLM di GPU
    • Mengoptimalkan workload inferensi batch
  • Coba contoh inferensi
    • GPU
      • Menyajikan model terbuka Gemma menggunakan GPU dengan vLLM
      • Menyajikan LLM seperti DeepSeek-R1 671B atau Llama 3.1 405B
      • Menyajikan LLM dengan GKE Inference Gateway
      • Menyajikan LLM dengan beberapa GPU
      • Menayangkan T5 dengan TorchServe
      • Menyesuaikan model terbuka Gemma menggunakan beberapa GPU
      • Mengamankan workload penayangan di GKE dengan Model Armor
    • TPU
      • Menyajikan Llama di TPU dengan vLLM
      • Menyajikan LLM menggunakan TPU multi-host dengan JetStream dan Pathways
      • Menyajikan Stable Diffusion XL di TPU dengan MaxDiffusion
      • Menyajikan model terbuka di TPU dengan Terraform
  • Melatih model AI dalam skala besar
  • Melatih model skala besar dengan Checkpointing Multi-tingkat
  • Coba contoh pelatihan
    • Melatih model dengan GPU pada mode GKE Standar
    • Melatih model dengan GPU pada mode GKE Autopilot
    • Melatih model Llama di GPU dengan Megatron-LM
    • Menyesuaikan LLM menggunakan TPU di GKE dengan JAX
  • Menjalankan workload reinforcement learning di GKE
    • Menyesuaikan dan menskalakan reinforcement learning dengan verl
    • Menyesuaikan dan menskalakan reinforcement learning dengan NeMo RL
    • Memantau workload reinforcement learning dengan OpenTelemetry
  • Men-deploy dan mengorkestrasi agen AI
  • Men-deploy agen AI dengan ADK dan Agent Platform API
  • Men-deploy agen AI dengan ADK dan LLM yang dihosting sendiri
  • Mengamankan workload agentic AI dengan Agent Sandbox
    • Tentang Sandbox Agen
    • Mengaktifkan Sandbox Agen di GKE
    • Mengisolasi eksekusi kode AI dengan Sandbox Agen
    • Menyimpan dan memulihkan lingkungan Sandbox Agen
    • Memicu snapshot Sandbox Agen dari dalam cluster
  • Menggunakan Ray untuk aplikasi AI/ML terdistribusi
  • Tentang Ray di GKE
  • Panduan memulai: Men-deploy aplikasi Ray pertama Anda di GKE
  • Mengaktifkan KubeRay terkelola dengan add-on Ray Operator
  • Men-deploy workload AI/ML dengan Ray di GKE
    • Menayangkan model AI dengan Ray Serve di GKE
      • Menyajikan LLM di GPU dengan Ray Serve
      • Menyajikan LLM dengan Ray Serve multi-cluster dan Inference Gateway
      • Menyajikan LLM di TPU dengan Ray Serve
      • Menyajikan model terbuka Gemma menggunakan TPU multi-host di GKE dengan Ray
      • Menyajikan model difusi di GPU dengan Ray
      • Menyajikan model difusi di TPU dengan Ray
    • Melatih model AI dengan Ray di GKE
      • Melatih dengan PyTorch, Ray, dan GKE
      • Melatih LLM menggunakan Jax dan Ray Train di TPU dengan GKE
      • Multislice dan Pelatihan Elastis di TPU menggunakan Ray Train di GKE
  • Menggunakan GPU dengan Ray di GKE
    • Menyiapkan Ray di GKE dengan A4X dan GB200
  • Menggunakan TPU dengan Ray di GKE
    • Menyiapkan Ray di GKE dengan TPU Trillium
    • Mengoptimalkan pelatihan AI di TPU dengan DWS dan Kueue
  • Memantau Ray di GKE
    • Melihat log untuk Ray Operator di GKE
    • Melihat log dan metrik untuk cluster Ray di GKE
    • Men-debug Tugas Ray yang selesai dengan Ray History Server
  • Menggunakan Slurm Operator untuk workload HPC dan AI/ML
  • Tentang Slurm di GKE