Langsung ke konten utama
Area teknologi
close
AI dan ML
Pengembangan aplikasi
Hosting aplikasi
Compute
Pipeline dan analisis data
Database
Terdistribusi, hybrid, dan multicloud
Solusi industri
Migrasi
Jaringan
Kemampuan observasi dan pemantauan
Keamanan
Storage
Alat cross product
close
Pengelolaan akses dan resource
Pengelolaan biaya dan penggunaan
Infrastruktur sebagai kode
SDK, bahasa, framework, dan alat
/
Konsol
English
Deutsch
Español
Español – América Latina
Français
Indonesia
Italiano
Português
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Masuk
Google Kubernetes Engine (GKE)
GKE AI/ML
Mulai gratis
Ringkasan
Panduan
Area teknologi
Lainnya
Ringkasan
Panduan
Alat cross product
Lainnya
Konsol
Temukan
Pengantar workload AI/ML di GKE
Mempelajari dokumentasi GKE
Ringkasan
Dokumentasi utama GKE
Dokumentasi AI/ML GKE
Dokumentasi jaringan GKE
Dokumentasi keamanan GKE
Dokumentasi pengelolaan fleet GKE
Pilih cara mendapatkan dan menggunakan akselerator di GKE
Kesesuaian AI/ML GKE
Mulai
Alasan menggunakan GKE untuk inferensi AI/ML
Konsep penskalaan otomatis yang disederhanakan untuk workload AI/ML di GKE
Panduan memulai: Menyajikan model AI pertama Anda di GKE
Menyajikan model AI untuk inferensi
Tentang inferensi model AI/ML di GKE
Menganalisis performa dan biaya penyajian model dengan Panduan Memulai Inferensi GKE
Mengekspos aplikasi AI dengan GKE Inference Gateway
Praktik terbaik untuk inferensi
Ringkasan
Memilih strategi load balancing untuk inferensi
Menskalakan otomatis workload inferensi di GPU
Menskalakan otomatis workload inferensi LLM di TPU
Mengoptimalkan workload inferensi LLM di GPU
Mengoptimalkan workload inferensi batch
Coba contoh inferensi
GPU
Menyajikan model terbuka Gemma menggunakan GPU dengan vLLM
Menyajikan LLM seperti DeepSeek-R1 671B atau Llama 3.1 405B
Menyajikan LLM dengan GKE Inference Gateway
Menyajikan LLM dengan beberapa GPU
Menayangkan T5 dengan TorchServe
Menyesuaikan model terbuka Gemma menggunakan beberapa GPU
Mengamankan workload penayangan di GKE dengan Model Armor
TPU
Menyajikan Llama di TPU dengan vLLM
Menyajikan LLM menggunakan TPU multi-host dengan JetStream dan Pathways
Menyajikan Stable Diffusion XL di TPU dengan MaxDiffusion
Menyajikan model terbuka di TPU dengan Terraform
Melatih model AI dalam skala besar
Melatih model skala besar dengan Checkpointing Multi-tingkat
Coba contoh pelatihan
Melatih model dengan GPU pada mode GKE Standar
Melatih model dengan GPU pada mode GKE Autopilot
Melatih model Llama di GPU dengan Megatron-LM
Menyesuaikan LLM menggunakan TPU di GKE dengan JAX
Menjalankan workload reinforcement learning di GKE
Menyesuaikan dan menskalakan reinforcement learning dengan verl
Menyesuaikan dan menskalakan reinforcement learning dengan NeMo RL
Memantau workload reinforcement learning dengan OpenTelemetry
Men-deploy dan mengorkestrasi agen AI
Men-deploy agen AI dengan ADK dan Agent Platform API
Men-deploy agen AI dengan ADK dan LLM yang dihosting sendiri
Mengamankan workload agentic AI dengan Agent Sandbox
Tentang Sandbox Agen
Mengaktifkan Sandbox Agen di GKE
Mengisolasi eksekusi kode AI dengan Sandbox Agen
Menyimpan dan memulihkan lingkungan Sandbox Agen
Memicu snapshot Sandbox Agen dari dalam cluster
Menggunakan Ray untuk aplikasi AI/ML terdistribusi
Tentang Ray di GKE
Panduan memulai: Men-deploy aplikasi Ray pertama Anda di GKE
Mengaktifkan KubeRay terkelola dengan add-on Ray Operator
Men-deploy workload AI/ML dengan Ray di GKE
Menayangkan model AI dengan Ray Serve di GKE
Menyajikan LLM di GPU dengan Ray Serve
Menyajikan LLM dengan Ray Serve multi-cluster dan Inference Gateway
Menyajikan LLM di TPU dengan Ray Serve
Menyajikan model terbuka Gemma menggunakan TPU multi-host di GKE dengan Ray
Menyajikan model difusi di GPU dengan Ray
Menyajikan model difusi di TPU dengan Ray
Melatih model AI dengan Ray di GKE
Melatih dengan PyTorch, Ray, dan GKE
Melatih LLM menggunakan Jax dan Ray Train di TPU dengan GKE
Multislice dan Pelatihan Elastis di TPU menggunakan Ray Train di GKE
Menggunakan GPU dengan Ray di GKE
Menyiapkan Ray di GKE dengan A4X dan GB200
Menggunakan TPU dengan Ray di GKE
Menyiapkan Ray di GKE dengan TPU Trillium
Mengoptimalkan pelatihan AI di TPU dengan DWS dan Kueue
Memantau Ray di GKE
Melihat log untuk Ray Operator di GKE
Melihat log dan metrik untuk cluster Ray di GKE
Men-debug Tugas Ray yang selesai dengan Ray History Server
Menggunakan Slurm Operator untuk workload HPC dan AI/ML
Tentang Slurm di GKE
Panduan memulai: Men-deploy cluster Slurm di GKE
Mengaktifkan add-on Slurm Operator
Membangun image Docker Slurm kustom
Mengonfigurasi penyimpanan bersama untuk Slurm di GKE
Mengonfigurasi Filestore untuk Slurm
Managed Lustre untuk Slurm
Mengelola GPU di GKE
Tentang GPU
Mengonfigurasi GPU untuk workload AI/ML
Mengonfigurasi VM A3 atau A4 dengan AI Hypercomputer
Men-deploy workload GPU di cluster Standard
Men-deploy workload GPU di cluster Autopilot
Mengonfigurasi penskalaan otomatis untuk workload LLM di GPU
Mengelola stack GPU dengan Operator GPU NVIDIA
Mengenkripsi workload GPU secara langsung
Menyediakan resource untuk komputasi berperforma tinggi (HPC)
Men-deploy cluster AI Hypercomputer (VM A3, A4)
Mengoptimalkan pemanfaatan GPU dengan strategi berbagi GPU
Tentang strategi berbagi GPU di GKE
Menggunakan GPU multi-instance
Mengonfigurasi GPU berbagi waktu
Menggunakan NVIDIA MPS
Mengoptimalkan penyediaan GPU dengan flex-start
Ringkasan
Menjalankan workload berskala besar dengan mulai fleksibel
Menjalankan workload batch kecil dengan GPU dan mulai fleksibel
Mengelola TPU di GKE
Tentang TPU