Passer au contenu principal
Google Cloud Documentation
Domaines technologiques
  • IA et ML
  • Développement d'applications
  • Hébergement d'applications
  • Calcul
  • Analyses de données et pipelines
  • Bases de données
  • Solutions distribuées, hybrides et multicloud
  • Solutions par secteur d'activité
  • Migration
  • Mise en réseau
  • Observabilité et surveillance
  • Sécurité
  • Storage
Outils de produits croisés
  • Gestion des accès et des ressources
  • Gestion des coûts et de l'utilisation
  • Infrastructure as Code
  • SDK, langages, frameworks et outils
/
Console
  • English
  • Deutsch
  • Español
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
Connexion
  • Google Kubernetes Engine (GKE)
  • GKE AI/ML
Commencer l'essai gratuit
Aperçu Guides
Google Cloud Documentation
  • Domaines technologiques
    • Plus
    • Aperçu
    • Guides
  • Outils de produits croisés
    • Plus
  • Console
  • Découvrir
  • Présentation des charges de travail d'IA/de ML sur GKE
  • Explorer la documentation GKE
    • Aperçu
    • Documentation principale de GKE
    • Documentation GKE AI/ML
    • Documentation sur la mise en réseau GKE
    • Documentation sur la sécurité de GKE
    • Documentation sur la gestion de parc GKE
  • Sélectionner la façon d'obtenir et d'utiliser les accélérateurs sur GKE
  • Conformité de l'IA/ML GKE
  • Premiers pas
  • Pourquoi utiliser GKE pour l'inférence d'IA/ML ?
  • Concepts d'autoscaling simplifiés pour les charges de travail d'IA/de ML dans GKE
  • Guide de démarrage rapide : Diffuser votre premier modèle d'IA sur GKE
  • Diffuser des modèles d'IA pour l'inférence
  • À propos de l'inférence de modèles d'IA/de ML sur GKE
  • Analyser les performances et les coûts de mise en service du modèle avec GKE Inference Quickstart
  • Exposer des applications d'IA avec GKE Inference Gateway
  • Bonnes pratiques pour l'inférence
    • Aperçu
    • Choisir une stratégie d'équilibrage de charge pour l'inférence
    • Autoscaler les charges de travail d'inférence sur les GPU
    • Autoscaler les charges de travail d'inférence LLM sur les TPU
    • Optimiser les charges de travail d'inférence LLM sur les GPU
    • Optimiser les charges de travail d'inférence par lot
  • Essayer des exemples d'inférence
    • GPU
      • Diffuser des modèles ouverts Gemma à l'aide de GPU avec vLLM
      • Mettre en service des LLM tels que DeepSeek-R1 671B ou Llama 3.1 405B
      • Diffuser un LLM avec GKE Inference Gateway
      • Diffuser un LLM avec plusieurs GPU
      • Diffuser T5 avec TorchServe
      • Affiner les modèles ouverts Gemma à l'aide de plusieurs GPU
      • Sécuriser une charge de travail de diffusion sur GKE avec Model Armor
    • TPU
      • Diffuser Llama sur des TPU avec vLLM
      • Diffuser des LLM à l'aide de TPU multi-hôtes avec JetStream et Pathways
      • Diffuser Stable Diffusion XL sur des TPU avec MaxDiffusion
      • Diffuser des modèles ouverts sur des TPU avec Terraform
  • Entraîner des modèles d'IA à grande échelle
  • Entraîner des modèles à grande échelle avec le checkpointing multicouche
  • Essayer des exemples d'entraînement
    • Entraîner les modèles avec des GPU en mode GKE Standard
    • Entraîner un modèle avec des GPU en mode GKE Autopilot
    • Entraîner un modèle Llama sur des GPU avec Megatron-LM
    • Affiner un LLM à l'aide de TPU sur GKE avec JAX
  • Exécuter des charges de travail d'apprentissage par renforcement sur GKE
    • Régler finement et mettre à l'échelle l'apprentissage par renforcement avec verl
    • Ajuster et faire évoluer l'apprentissage par renforcement avec NeMo RL
    • Surveiller les charges de travail d'apprentissage par renforcement avec OpenTelemetry
  • Déployer et orchestrer des agents d'IA
  • Déployer des agents IA avec ADK et l'API Agent Platform
  • Déployer des agents IA avec ADK et un LLM auto-hébergé
  • Sécuriser les charges de travail d'IA agentive avec Agent Sandbox
    • À propos du bac à sable de l'agent
    • Activer Agent Sandbox sur GKE
    • Isoler l'exécution du code d'IA avec Agent Sandbox
    • Enregistrer et restaurer les environnements bac à sable de l'agent
    • Déclencher des instantanés Agent Sandbox depuis un cluster
  • Utiliser Ray pour les applications d'IA/ML distribuées
  • À propos de Ray sur GKE
  • Démarrage rapide : Déployer votre première application Ray sur GKE
  • Activer KubeRay géré avec le module complémentaire Ray Operator
  • Déployer des charges de travail d'IA/de ML avec Ray sur GKE
    • Diffuser des modèles d'IA avec Ray Serve sur GKE
      • Diffuser un LLM sur des GPU avec Ray Serve
      • Diffuser un LLM avec Ray Serve et Inference Gateway multiclusters
      • Diffuser un LLM sur des TPU avec Ray Serve
      • Diffuser des modèles ouverts Gemma à l'aide de TPU multi-hôtes sur GKE avec Ray
      • Diffuser un modèle de diffusion sur des GPU avec Ray
      • Diffuser un modèle de diffusion sur des TPU avec Ray
    • Entraîner des modèles d'IA avec Ray sur GKE
      • Entraîner avec PyTorch, Ray et GKE
      • Entraîner un LLM à l'aide de Jax et Ray Train sur des TPU avec GKE
      • Entraînement multislices et élastique sur TPU à l'aide de Ray Train sur GKE
  • Utiliser des GPU avec Ray sur GKE
    • Configurer Ray sur GKE avec A4X et GB200
  • Utiliser des TPU avec Ray sur GKE
    • Configurer Ray sur GKE avec TPU Trillium
    • Optimiser l'entraînement de l'IA sur les TPU avec DWS et Kueue
  • Surveiller Ray sur GKE
    • Afficher les journaux de l'opérateur Ray sur GKE
    • Afficher les journaux et les métriques pour les clusters Ray sur GKE
    • Déboguer les jobs Ray terminés avec le serveur d'historique Ray
  • Utiliser l'opérateur Slurm pour les charges de travail HPC et d'IA/de ML
  • À propos de Slurm sur GKE
  • Guide de démarrage rapide : Déployer un cluster Slurm sur GKE
  • Activer le module complémentaire Slurm Operator
  • Créer des images Docker Slurm personnalisées
  • Configurer le stockage partagé pour Slurm sur GKE
    • Configurer Filestore pour Slurm
    • Managed Lustre pour Slurm
  • Gérer les GPU sur GKE
  • À propos des GPU
  • Configurer des GPU pour les charges de travail d'IA/de ML
    • Configurer des VM A3 ou A4 avec AI Hypercomputer
    • Déployer des charges de travail GPU dans des clusters Standard
    • Déployer des charges de travail GPU dans des clusters Autopilot
    • Configurer l'autoscaling pour les charges de travail LLM sur les GPU
    • Gérer la pile de GPU avec l'opérateur GPU NVIDIA
    • Chiffrer les charges de travail GPU sur place
  • Provisionner des ressources pour le calcul hautes performances (HPC)
    • Déployer des clusters AI Hypercomputer (VM A3, A4)
  • Optimiser l'utilisation des GPU avec des stratégies de partage de GPU
    • À propos des stratégies de partage de GPU sur GKE
    • Utiliser des GPU multi-instances
    • Configurer des GPU partagés
    • Utiliser NVIDIA MPS
  • Optimiser le provisionnement de GPU avec le démarrage flexible
    • Aperçu
    • Exécuter une charge de travail à grande échelle avec le démarrage flexible
    • Exécuter une petite charge de travail par lot avec des GPU et un démarrage flexible
  • Gérer les TPU sur GKE
  • À propos des TPU
  • Versions
    • Ironwood (TPU7x)
  • Planifier des TPU sur GKE
  • Configurer des TPU pour les charges de travail d'IA/de ML
    • Déployer des charges de travail TPU sur des clusters Standard
    • Déployer des charges de travail TPU sur des clusters Autopilot
    • Déployer des charges de travail TPU hautes performances avec la mise en réseau automatique
    • Déployer des TPU Multislice sur GKE
    • Orchestrer des charges de travail TPU Multislice à l'aide de JobSet et de Kueue
  • Configurer l'autoscaling pour les charges de travail LLM sur les TPU
  • Optimiser le provisionnement de TPU avec le démarrage flexible
    • Aperçu
    • Exécuter une petite charge de travail par lot avec des TPU et un démarrage flexible
    • Demander des TPU avec une réservation future en mode Agenda
  • Optimiser l'utilisation du TPU avec le slicing dynamique
    • À propos du mode "Toute la capacité TPU"
    • À propos du découpage dynamique des TPU
      • Aperçu
      • Utiliser le fractionnement dynamique avec un planificateur personnalisé
      • Planifier des tranches dynamiques avec Kueue et TAS
  • Gérer les interruptions des nœuds GKE pour les GPU et les TPU
  • À propos des interruptions de nœuds pour les GPU et les TPU
  • Utiliser Kueue pour la mise en file d'attente des jobs et l'optimisation des ressources
    • Bonnes pratiques pour l'exécution de charges de travail par lot sur GKE
    • Déployer un système de traitement par lots à l'aide de Kueue
    • Implémenter un système de mise en file d'attente de jobs avec un partage de quota
    • Optimiser l'utilisation des ressources pour les charges de travail mixtes d'entraînement et d'inférence d'IA/de ML
    • Optimiser la priorisation des charges de travail d'IA/de ML
    • Orchestrer des charges de travail TPU Multislice à l'aide de JobSet et de Kueue
  • Gérer la mise en réseau pour les charges de travail d'IA/ML
  • Allouer des ressources réseau à l'aide de DRANET géré par GKE
  • Configurer la mise en réseau automatique pour les accélérateurs
  • Gérer les données et le stockage pour les charges de travail d'IA/de ML
  • À propos du stockage des clusters GKE
  • Accélérer l'accès aux données et les performances
    • Accélérer le chargement de modèles avec Run:ai Model Streamer et vLLM
    • À propos du pilote CSI Cloud Storage FUSE pour GKE
    • Accélération du chargement des données d'IA/ML avec Hyperdisk ML
    • Accélérer les performances de lecture des charges de travail avec état grâce au cache de données GKE
    • Transférer des données depuis Cloud Storage à l'aide de GKE Volume Populator
  • Créer des applications avec des bases de données vectorielles et le RAG
    • Créer un chatbot RAG avec GKE et Cloud Storage
    • Déployer une base de données vectorielle Qdrant sur GKE
  • Sécuriser les charges de travail d'IA/ML
  • Bonnes pratiques pour la sécurité des charges de travail d'IA sur GKE
  • Sécuriser une charge de travail de diffusion sur GKE avec Model Armor
  • Surveiller les charges de travail d'IA/ML
  • Déployer la surveillance automatique des applications pour les charges de travail d'IA/ML
  • Dépannage
  • Résoudre les problèmes liés aux accélérateurs
    • Résoudre les problèmes liés aux GPU
    • Résoudre les problèmes liés aux TPU
  • IA et ML
  • Développement d'applications
  • Hébergement d'applications
  • Calcul
  • Analyses de données et pipelines
  • Bases de données
  • Solutions distribuées, hybrides et multicloud
  • Solutions par secteur d'activité
  • Migration
  • Mise en réseau
  • Observabilité et surveillance
  • Sécurité
  • Storage