Langsung ke konten utama
Google Cloud Documentation
Area teknologi
  • AI dan ML
  • Pengembangan aplikasi
  • Hosting aplikasi
  • Compute
  • Pipeline dan analisis data
  • Database
  • Terdistribusi, hybrid, dan multicloud
  • Solusi industri
  • Migrasi
  • Jaringan
  • Kemampuan observasi dan pemantauan
  • Keamanan
  • Storage
Alat cross product
  • Pengelolaan akses dan resource
  • Pengelolaan biaya dan penggunaan
  • Infrastruktur sebagai kode
  • SDK, bahasa, framework, dan alat
/
Konsol
  • English
  • Deutsch
  • Español
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
Masuk
  • Google Kubernetes Engine (GKE)
  • GKE AI/ML
Mulai gratis
Ringkasan Panduan
Google Cloud Documentation
  • Area teknologi
    • Lainnya
    • Ringkasan
    • Panduan
  • Alat cross product
    • Lainnya
  • Konsol
  • Temukan
  • Pengantar workload AI/ML di GKE
  • Mempelajari dokumentasi GKE
    • Ringkasan
    • Dokumentasi utama GKE
    • Dokumentasi AI/ML GKE
    • Dokumentasi jaringan GKE
    • Dokumentasi keamanan GKE
    • Dokumentasi pengelolaan fleet GKE
  • Pilih cara mendapatkan dan menggunakan akselerator di GKE
  • Kesesuaian AI/ML GKE
  • Mulai
  • Alasan menggunakan GKE untuk inferensi AI/ML
  • Konsep penskalaan otomatis yang disederhanakan untuk workload AI/ML di GKE
  • Panduan memulai: Menyajikan model AI pertama Anda di GKE
  • Menyajikan model AI untuk inferensi
  • Tentang inferensi model AI/ML di GKE
  • Menganalisis performa dan biaya penyajian model dengan Panduan Memulai Inferensi GKE
  • Mengekspos aplikasi AI dengan GKE Inference Gateway
  • Praktik terbaik untuk inferensi
    • Ringkasan
    • Memilih strategi load balancing untuk inferensi
    • Menskalakan otomatis workload inferensi di GPU
    • Menskalakan otomatis workload inferensi LLM di TPU
    • Mengoptimalkan workload inferensi LLM di GPU
    • Mengoptimalkan workload inferensi batch
  • Coba contoh inferensi
    • GPU
      • Menyajikan model terbuka Gemma menggunakan GPU dengan vLLM
      • Menyajikan LLM seperti DeepSeek-R1 671B atau Llama 3.1 405B
      • Menyajikan LLM dengan GKE Inference Gateway
      • Menyajikan LLM dengan beberapa GPU
      • Menayangkan T5 dengan TorchServe
      • Menyesuaikan model terbuka Gemma menggunakan beberapa GPU
      • Mengamankan workload penayangan di GKE dengan Model Armor
    • TPU
      • Menyajikan Llama di TPU dengan vLLM
      • Menyajikan LLM menggunakan TPU multi-host dengan JetStream dan Pathways
      • Menyajikan Stable Diffusion XL di TPU dengan MaxDiffusion
      • Menyajikan model terbuka di TPU dengan Terraform
  • Melatih model AI dalam skala besar
  • Melatih model skala besar dengan Checkpointing Multi-tingkat
  • Coba contoh pelatihan
    • Melatih model dengan GPU pada mode GKE Standar
    • Melatih model dengan GPU pada mode GKE Autopilot
    • Melatih model Llama di GPU dengan Megatron-LM
    • Menyesuaikan LLM menggunakan TPU di GKE dengan JAX
  • Menjalankan workload reinforcement learning di GKE
    • Menyesuaikan dan menskalakan reinforcement learning dengan verl
    • Menyesuaikan dan menskalakan reinforcement learning dengan NeMo RL
    • Memantau workload reinforcement learning dengan OpenTelemetry
  • Men-deploy dan mengorkestrasi agen AI
  • Men-deploy agen AI dengan ADK dan Agent Platform API
  • Men-deploy agen AI dengan ADK dan LLM yang dihosting sendiri
  • Mengamankan workload agentic AI dengan Agent Sandbox
    • Tentang Sandbox Agen
    • Mengaktifkan Sandbox Agen di GKE
    • Mengisolasi eksekusi kode AI dengan Sandbox Agen
    • Menyimpan dan memulihkan lingkungan Sandbox Agen
    • Memicu snapshot Sandbox Agen dari dalam cluster
  • Menggunakan Ray untuk aplikasi AI/ML terdistribusi
  • Tentang Ray di GKE
  • Panduan memulai: Men-deploy aplikasi Ray pertama Anda di GKE
  • Mengaktifkan KubeRay terkelola dengan add-on Ray Operator
  • Men-deploy workload AI/ML dengan Ray di GKE
    • Menayangkan model AI dengan Ray Serve di GKE
      • Menyajikan LLM di GPU dengan Ray Serve
      • Menyajikan LLM dengan Ray Serve multi-cluster dan Inference Gateway
      • Menyajikan LLM di TPU dengan Ray Serve
      • Menyajikan model terbuka Gemma menggunakan TPU multi-host di GKE dengan Ray
      • Menyajikan model difusi di GPU dengan Ray
      • Menyajikan model difusi di TPU dengan Ray
    • Melatih model AI dengan Ray di GKE
      • Melatih dengan PyTorch, Ray, dan GKE
      • Melatih LLM menggunakan Jax dan Ray Train di TPU dengan GKE
      • Multislice dan Pelatihan Elastis di TPU menggunakan Ray Train di GKE
  • Menggunakan GPU dengan Ray di GKE
    • Menyiapkan Ray di GKE dengan A4X dan GB200
  • Menggunakan TPU dengan Ray di GKE
    • Menyiapkan Ray di GKE dengan TPU Trillium
    • Mengoptimalkan pelatihan AI di TPU dengan DWS dan Kueue
  • Memantau Ray di GKE
    • Melihat log untuk Ray Operator di GKE
    • Melihat log dan metrik untuk cluster Ray di GKE
    • Men-debug Tugas Ray yang selesai dengan Ray History Server
  • Menggunakan Slurm Operator untuk workload HPC dan AI/ML
  • Tentang Slurm di GKE
  • Panduan memulai: Men-deploy cluster Slurm di GKE
  • Mengaktifkan add-on Slurm Operator
  • Membangun image Docker Slurm kustom
  • Mengonfigurasi penyimpanan bersama untuk Slurm di GKE
    • Mengonfigurasi Filestore untuk Slurm
    • Managed Lustre untuk Slurm
  • Mengelola GPU di GKE
  • Tentang GPU
  • Mengonfigurasi GPU untuk workload AI/ML
    • Mengonfigurasi VM A3 atau A4 dengan AI Hypercomputer
    • Men-deploy workload GPU di cluster Standard
    • Men-deploy workload GPU di cluster Autopilot
    • Mengonfigurasi penskalaan otomatis untuk workload LLM di GPU
    • Mengelola stack GPU dengan Operator GPU NVIDIA
    • Mengenkripsi workload GPU secara langsung
  • Menyediakan resource untuk komputasi berperforma tinggi (HPC)
    • Men-deploy cluster AI Hypercomputer (VM A3, A4)
  • Mengoptimalkan pemanfaatan GPU dengan strategi berbagi GPU
    • Tentang strategi berbagi GPU di GKE
    • Menggunakan GPU multi-instance
    • Mengonfigurasi GPU berbagi waktu
    • Menggunakan NVIDIA MPS
  • Mengoptimalkan penyediaan GPU dengan flex-start
    • Ringkasan
    • Menjalankan workload berskala besar dengan mulai fleksibel
    • Menjalankan workload batch kecil dengan GPU dan mulai fleksibel
  • Mengelola TPU di GKE
  • Tentang TPU