Description: Serve Llama 3.1 70b on Tensor Processing Units (TPUs) in GKE, using vLLM.
Ir para o conteúdo principal
Documentação
close
Começar
Começar a usar o Google Cloud
Lista de produtos
Cloud Customer Care
Produtos em destaque
Agent Platform
Gerenciamento de APIs da Apigee
BigQuery
Compute Engine
Cloud CDN
Cloud Run
Cloud Storage
Cloud SQL
Gemini Enterprise
Google Kubernetes Engine
Looker
Ferramentas de vários produtos
Gerenciamento de recursos e acesso
Gerenciamento de custos e uso
Infraestrutura como código
SDK, linguagens, frameworks e ferramentas
Áreas de tecnologia
IA e ML
Desenvolvimento de aplicativos
Hospedagem de aplicativos
Computação
Pipelines e análises de dados
Bancos de dados
Distribuído, híbrido e multicloud
Soluções por setor
Migração
Rede
Observabilidade e monitoramento
Segurança
Storage
/
Console
English
Deutsch
Español
Español – América Latina
Français
Indonesia
Italiano
Português
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Fazer login
Google Kubernetes Engine (GKE)
GKE AI/ML
Comece sem custos financeiros
Visão geral
Guias
Documentação
Mais
Visão geral
Guias
Console
Descoberta
Introdução às cargas de trabalho de IA/ML no GKE
Conferir a documentação do GKE
Visão geral
Documentação principal do GKE
Documentação de IA/ML do GKE
Documentação de rede do GKE
Documentação de segurança do GKE
Documentação do gerenciamento de frotas do GKE
Selecione como receber e consumir aceleradores no GKE
Design para capacidade de obtenção de recursos com o Gemini
Conformidade de IA/ML do GKE
Começar
Por que usar o GKE para inferência de IA/ML
Conceitos simplificados de escalonamento automático para cargas de trabalho de IA/ML no GKE
Guia de início rápido: disponibilizar seu primeiro modelo de IA no GKE
Disponibilizar modelos de IA para inferência
Sobre a inferência de modelos de IA/ML no GKE
Analise o desempenho e os custos da disponibilização de modelos com o guia de início rápido do GKE Inference
Expor aplicativos de IA com o GKE Inference Gateway
Práticas recomendadas para inferência
Visão geral
Escolher uma estratégia de balanceamento de carga para inferência
Escalonar automaticamente cargas de trabalho de inferência em GPUs
Escalonar automaticamente cargas de trabalho de inferência de LLM em TPUs
Otimizar cargas de trabalho de inferência de LLM em GPUs
Otimizar cargas de trabalho de inferência em lote
Testar exemplos de inferência
GPUs
Disponibilizar modelos abertos do Gemma usando GPUs com vLLM
Disponibilizar LLMs como DeepSeek-R1 671B ou Llama 3.1 405B
Disponibilizar um LLM com o GKE Inference Gateway
Exibir um LLM com várias GPUs
Disponibilizar o T5 com o TorchServe
TPUs
Disponibilizar o Llama em TPUs com o vLLM
Disponibilizar LLMs usando TPUs de vários hosts com o JetStream e o Pathways
Disponibilizar o Stable Diffusion XL em TPUs com o MaxDiffusion
Disponibilizar modelos abertos em TPUs com o Terraform
Treinar modelos de IA em escala
Treinar modelos em grande escala com o checkpointing de vários níveis
Testar exemplos de treinamento
Treinar um modelo com GPUs no modo do GKE Standard
Treinar um modelo com GPUs no modo Autopilot do GKE
Treinar um modelo Llama em GPUs com o Megatron-LM
Ajustar um LLM usando TPUs no GKE com o JAX
Executar cargas de trabalho de aprendizado por reforço no GKE
Ajuste e dimensione o aprendizado por reforço com o verl
Ajustar e dimensionar o aprendizado por reforço com o NeMo RL
Monitorar cargas de trabalho de aprendizado por reforço com o OpenTelemetry
Implantar e orquestrar agentes de IA
Implantar agentes de IA com o ADK e a API Agent Platform
Implantar agentes de IA com o ADK e um LLM autohospedado
Escalone cargas de trabalho de agente de IA com o Agent Substrate
Sobre o Agent Substrate
Instalar o Agent Substrate no GKE
Proteja cargas de trabalho agênticas de IA com o sandbox do agente
Sobre o sandbox do agente
Escolher o armazenamento para cargas de trabalho de agentes de IA
Ativar o Agent Sandbox no GKE
Isolar a execução de código de IA com o sandbox do agente
Gerenciar o armazenamento do sandbox do agente
Salvar e restaurar ambientes de sandbox do agente
Acionar snapshots do sandbox do agente de dentro de um cluster
Usar o Ray para aplicativos de IA/ML distribuídos
Sobre o Ray no GKE
Guia de início rápido: implante seu primeiro aplicativo Ray no GKE
Ativar o KubeRay gerenciado com o complemento do operador do Ray
Implantar cargas de trabalho de IA/ML com o Ray no GKE
Disponibilizar modelos de IA com o Ray Serve no GKE
Disponibilizar um LLM em GPUs com o Ray Serve
Disponibilizar um LLM com o Ray Serve e o Inference Gateway de vários clusters
Disponibilizar um LLM em TPUs com o Ray Serve
Disponibilizar modelos abertos do Gemma usando TPUs de vários hosts no GKE com o Ray
Disponibilizar um modelo de difusão em GPUs com Ray
Disponibilizar um modelo de difusão em TPUs com o Ray
Treinar modelos de IA com o Ray no GKE
Treinar com PyTorch, Ray e GKE
Treinar um LLM usando o Jax e o Ray Train em TPUs com o GKE
Treinamento multislice e elástico em TPUs usando o Ray Train no GKE
Compartilhar computação entre equipes com o Kueue
Inicie RayJobs mais rápido em várias opções de computação
Usar GPUs com o Ray no GKE
Configurar o Ray no GKE com A4X e GB200
Usar TPUs com o Ray no GKE
Configurar o Ray no GKE com a TPU Trillium
Otimizar o treinamento de IA em TPUs com DWS e Kueue
Monitorar o Ray no GKE
Ver registros do operador Ray no GKE
Ver registros e métricas para clusters do Ray no GKE
Depurar jobs do Ray concluídos com o servidor de histórico do Ray
Usar o operador Slurm para cargas de trabalho de HPC e IA/ML
Sobre o Slurm no GKE
Guia de início rápido: implantar um cluster do Slurm no GKE
Ativar o complemento do operador do Slurm
Criar imagens personalizadas do Docker do Slurm
Escalonar automaticamente um cluster Slurm usando métricas
Configurar o armazenamento compartilhado para o Slurm no GKE
Configurar o Filestore para o Slurm
Managed Lustre para Slurm
Gerenciar GPUs no GKE
Sobre GPUs
Configurar GPUs para cargas de trabalho de IA/ML
Configurar VMs A3 ou A4 com o Hipercomputador de IA
Implantar cargas de trabalho de GPU em clusters padrão
Implantar cargas de trabalho de GPU em clusters do Autopilot
Configurar o escalonamento automático para cargas de trabalho de LLM em GPUs
Gerenciar a pilha de GPU com o operador de GPU NVIDIA
Criptografar cargas de trabalho de GPU no local
Provisionar recursos para computação de alto desempenho (HPC)
Implantar clusters do Hipercomputador de IA (VMs A3 e A4)
Otimizar a utilização da GPU com estratégias de compartilhamento
Sobre as estratégias de compartilhamento de GPU no GKE
Usar GPUs de várias instâncias
Configurar GPUs de compartilhamento de tempo
Usar MPS da NVIDIA
Otimizar o provisionamento de GPU com início flexível
Visão geral
Executar uma carga de trabalho em grande escala com início flexível
Executar uma pequena carga de trabalho em lote com GPUs e início flexível
Gerenciar TPUs no GKE
Sobre TPUs
Versões
Ironwood (TPU7x)
Planejar TPUs no GKE
Configurar TPUs para cargas de trabalho de IA/ML
Implantar cargas de trabalho de TPU em clusters Standard
Implantar cargas de trabalho de TPU em clusters do Autopilot
Implantar cargas de trabalho de TPU de alta performance com rede automática
Implantar Multislices de TPU no GKE
Orquestrar cargas de trabalho do TPU Multislice usando o JobSet e Kueue
Configurar o escalonamento automático para cargas de trabalho LLM em TPUs
Otimizar o provisionamento de TPU com início flexível
Visão geral
Executar uma pequena carga de trabalho em lote com TPUs e início flexível
Solicitar TPUs com reserva adiantada no modo de calendário
Otimizar a utilização da TPU com segmentação dinâmica
Sobre o modo de capacidade total da TPU