Passer au contenu principal
Domaines technologiques
close
IA et ML
Développement d'applications
Hébergement d'applications
Calcul
Analyses de données et pipelines
Bases de données
Solutions distribuées, hybrides et multicloud
Solutions par secteur d'activité
Migration
Mise en réseau
Observabilité et surveillance
Sécurité
Storage
Outils de produits croisés
close
Gestion des accès et des ressources
Gestion des coûts et de l'utilisation
Infrastructure as Code
SDK, langages, frameworks et outils
/
Console
English
Deutsch
Español
Español – América Latina
Français
Indonesia
Italiano
Português
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Connexion
Google Kubernetes Engine (GKE)
GKE AI/ML
Commencer l'essai gratuit
Aperçu
Guides
Domaines technologiques
Plus
Aperçu
Guides
Outils de produits croisés
Plus
Console
Découvrir
Présentation des charges de travail d'IA/de ML sur GKE
Explorer la documentation GKE
Aperçu
Documentation principale de GKE
Documentation GKE AI/ML
Documentation sur la mise en réseau GKE
Documentation sur la sécurité de GKE
Documentation sur la gestion de parc GKE
Sélectionner la façon d'obtenir et d'utiliser les accélérateurs sur GKE
Conformité de l'IA/ML GKE
Premiers pas
Pourquoi utiliser GKE pour l'inférence d'IA/ML ?
Concepts d'autoscaling simplifiés pour les charges de travail d'IA/de ML dans GKE
Guide de démarrage rapide : Diffuser votre premier modèle d'IA sur GKE
Diffuser des modèles d'IA pour l'inférence
À propos de l'inférence de modèles d'IA/de ML sur GKE
Analyser les performances et les coûts de mise en service du modèle avec GKE Inference Quickstart
Exposer des applications d'IA avec GKE Inference Gateway
Bonnes pratiques pour l'inférence
Aperçu
Choisir une stratégie d'équilibrage de charge pour l'inférence
Autoscaler les charges de travail d'inférence sur les GPU
Autoscaler les charges de travail d'inférence LLM sur les TPU
Optimiser les charges de travail d'inférence LLM sur les GPU
Optimiser les charges de travail d'inférence par lot
Essayer des exemples d'inférence
GPU
Diffuser des modèles ouverts Gemma à l'aide de GPU avec vLLM
Mettre en service des LLM tels que DeepSeek-R1 671B ou Llama 3.1 405B
Diffuser un LLM avec GKE Inference Gateway
Diffuser un LLM avec plusieurs GPU
Diffuser T5 avec TorchServe
Affiner les modèles ouverts Gemma à l'aide de plusieurs GPU
Sécuriser une charge de travail de diffusion sur GKE avec Model Armor
TPU
Diffuser Llama sur des TPU avec vLLM
Diffuser des LLM à l'aide de TPU multi-hôtes avec JetStream et Pathways
Diffuser Stable Diffusion XL sur des TPU avec MaxDiffusion
Diffuser des modèles ouverts sur des TPU avec Terraform
Entraîner des modèles d'IA à grande échelle
Entraîner des modèles à grande échelle avec le checkpointing multicouche
Essayer des exemples d'entraînement
Entraîner les modèles avec des GPU en mode GKE Standard
Entraîner un modèle avec des GPU en mode GKE Autopilot
Entraîner un modèle Llama sur des GPU avec Megatron-LM
Affiner un LLM à l'aide de TPU sur GKE avec JAX
Exécuter des charges de travail d'apprentissage par renforcement sur GKE
Régler finement et mettre à l'échelle l'apprentissage par renforcement avec verl
Ajuster et faire évoluer l'apprentissage par renforcement avec NeMo RL
Surveiller les charges de travail d'apprentissage par renforcement avec OpenTelemetry
Déployer et orchestrer des agents d'IA
Déployer des agents IA avec ADK et l'API Agent Platform
Déployer des agents IA avec ADK et un LLM auto-hébergé
Sécuriser les charges de travail d'IA agentive avec Agent Sandbox
À propos du bac à sable de l'agent
Activer Agent Sandbox sur GKE
Isoler l'exécution du code d'IA avec Agent Sandbox
Enregistrer et restaurer les environnements bac à sable de l'agent
Déclencher des instantanés Agent Sandbox depuis un cluster
Utiliser Ray pour les applications d'IA/ML distribuées
À propos de Ray sur GKE
Démarrage rapide : Déployer votre première application Ray sur GKE
Activer KubeRay géré avec le module complémentaire Ray Operator
Déployer des charges de travail d'IA/de ML avec Ray sur GKE
Diffuser des modèles d'IA avec Ray Serve sur GKE
Diffuser un LLM sur des GPU avec Ray Serve
Diffuser un LLM avec Ray Serve et Inference Gateway multiclusters
Diffuser un LLM sur des TPU avec Ray Serve
Diffuser des modèles ouverts Gemma à l'aide de TPU multi-hôtes sur GKE avec Ray
Diffuser un modèle de diffusion sur des GPU avec Ray
Diffuser un modèle de diffusion sur des TPU avec Ray
Entraîner des modèles d'IA avec Ray sur GKE
Entraîner avec PyTorch, Ray et GKE
Entraîner un LLM à l'aide de Jax et Ray Train sur des TPU avec GKE
Entraînement multislices et élastique sur TPU à l'aide de Ray Train sur GKE
Utiliser des GPU avec Ray sur GKE
Configurer Ray sur GKE avec A4X et GB200
Utiliser des TPU avec Ray sur GKE
Configurer Ray sur GKE avec TPU Trillium
Optimiser l'entraînement de l'IA sur les TPU avec DWS et Kueue
Surveiller Ray sur GKE
Afficher les journaux de l'opérateur Ray sur GKE
Afficher les journaux et les métriques pour les clusters Ray sur GKE
Déboguer les jobs Ray terminés avec le serveur d'historique Ray
Utiliser l'opérateur Slurm pour les charges de travail HPC et d'IA/de ML
À propos de Slurm sur GKE
Guide de démarrage rapide : Déployer un cluster Slurm sur GKE
Activer le module complémentaire Slurm Operator
Créer des images Docker Slurm personnalisées
Configurer le stockage partagé pour Slurm sur GKE
Configurer Filestore pour Slurm
Managed Lustre pour Slurm
Gérer les GPU sur GKE
À propos des GPU
Configurer des GPU pour les charges de travail d'IA/de ML
Configurer des VM A3 ou A4 avec AI Hypercomputer
Déployer des charges de travail GPU dans des clusters Standard
Déployer des charges de travail GPU dans des clusters Autopilot
Configurer l'autoscaling pour les charges de travail LLM sur les GPU
Gérer la pile de GPU avec l'opérateur GPU NVIDIA
Chiffrer les charges de travail GPU sur place
Provisionner des ressources pour le calcul hautes performances (HPC)
Déployer des clusters AI Hypercomputer (VM A3, A4)
Optimiser l'utilisation des GPU avec des stratégies de partage de GPU
À propos des stratégies de partage de GPU sur GKE
Utiliser des GPU multi-instances
Configurer des GPU partagés
Utiliser NVIDIA MPS
Optimiser le provisionnement de GPU avec le démarrage flexible
Aperçu
Exécuter une charge de travail à grande échelle avec le démarrage flexible
Exécuter une petite charge de travail par lot avec des GPU et un démarrage flexible
Gérer les TPU sur GKE
À propos des TPU
Versions
Ironwood (TPU7x)
Planifier des TPU sur GKE
Configurer des TPU pour les charges de travail d'IA/de ML
Déployer des charges de travail TPU sur des clusters Standard
Déployer des charges de travail TPU sur des clusters Autopilot
Déployer des charges de travail TPU hautes performances avec la mise en réseau automatique
Déployer des TPU Multislice sur GKE
Orchestrer des charges de travail TPU Multislice à l'aide de JobSet et de Kueue
Configurer l'autoscaling pour les charges de travail LLM sur les TPU
Optimiser le provisionnement de TPU avec le démarrage flexible
Aperçu
Exécuter une petite charge de travail par lot avec des TPU et un démarrage flexible
Demander des TPU avec une réservation future en mode Agenda
Optimiser l'utilisation du TPU avec le slicing dynamique
À propos du mode "Toute la capacité TPU"
À propos du découpage dynamique des TPU
Aperçu
Utiliser le fractionnement dynamique avec un planificateur personnalisé
Planifier des tranches dynamiques avec Kueue et TAS
Gérer les interruptions des nœuds GKE pour les GPU et les TPU
À propos des interruptions de nœuds pour les GPU et les TPU
Utiliser Kueue pour la mise en file d'attente des jobs et l'optimisation des ressources
Bonnes pratiques pour l'exécution de charges de travail par lot sur GKE
Déployer un système de traitement par lots à l'aide de Kueue
Implémenter un système de mise en file d'attente de jobs avec un partage de quota
Optimiser l'utilisation des ressources pour les charges de travail mixtes d'entraînement et d'inférence d'IA/de ML
Optimiser la priorisation des charges de travail d'IA/de ML
Orchestrer des charges de travail TPU Multislice à l'aide de JobSet et de Kueue
Gérer la mise en réseau pour les charges de travail d'IA/ML
Allouer des ressources réseau à l'aide de DRANET géré par GKE
Configurer la mise en réseau automatique pour les accélérateurs
Gérer les données et le stockage pour les charges de travail d'IA/de ML
À propos du stockage des clusters GKE
Accélérer l'accès aux données et les performances
Accélérer le chargement de modèles avec Run:ai Model Streamer et vLLM
À propos du pilote CSI Cloud Storage FUSE pour GKE
Accélération du chargement des données d'IA/ML avec Hyperdisk ML
Accélérer les performances de lecture des charges de travail avec état grâce au cache de données GKE
Transférer des données depuis Cloud Storage à l'aide de GKE Volume Populator
Créer des applications avec des bases de données vectorielles et le RAG
Créer un chatbot RAG avec GKE et Cloud Storage
Déployer une base de données vectorielle Qdrant sur GKE
Sécuriser les charges de travail d'IA/ML
Bonnes pratiques pour la sécurité des charges de travail d'IA sur GKE
Sécuriser une charge de travail de diffusion sur GKE avec Model Armor
Surveiller les charges de travail d'IA/ML
Déployer la surveillance automatique des applications pour les charges de travail d'IA/ML
Dépannage
Résoudre les problèmes liés aux accélérateurs
Résoudre les problèmes liés aux GPU
Résoudre les problèmes liés aux TPU
IA et ML
Développement d'applications
Hébergement d'applications
Calcul
Analyses de données et pipelines
Bases de données
Solutions distribuées, hybrides et multicloud
Solutions par secteur d'activité
Migration
Mise en réseau
Observabilité et surveillance
Sécurité
Storage