기본 콘텐츠로 건너뛰기
문서
시작하기
Google Cloud 시작하기
제품 목록
Cloud Customer Care
추천 제품
Agent Platform
Apigee API 관리
BigQuery
Compute Engine은
Cloud CDN
Cloud Run
Cloud Storage
Cloud SQL
Gemini Enterprise
Google Kubernetes Engine
Looker
크로스 프로덕트 도구
액세스 및 리소스 관리
비용 및 사용량 관리
코드형 인프라
SDK, 언어, 프레임워크, 도구
기술 분야
AI 및 ML
애플리케이션 개발
애플리케이션 호스팅
컴퓨팅
데이터 분석 및 파이프라인
데이터베이스
분산, 하이브리드, 멀티 클라우드
업종별 솔루션
이전
네트워킹
모니터링 가능성 및 모니터링
보안
Storage
/
콘솔
English
Deutsch
Español
Español – América Latina
Français
Indonesia
Italiano
Português
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
Google Kubernetes Engine (GKE)
GKE AI/ML
무료로 시작하기
개요
가이드
문서
더보기
개요
가이드
콘솔
Discover
GKE의 AI/ML 워크로드 소개
GKE 문서 살펴보기
개요
기본 GKE 문서
GKE AI/ML 문서
GKE 네트워킹 문서
GKE 보안 문서
GKE Fleet 관리 문서
GKE에서 가속기를 획득하고 사용하는 방법 선택
Gemini로 리소스 획득 가능성 설계
GKE AI/ML 적합성
시작하기
AI/ML 추론에 GKE를 사용해야 하는 이유
GKE의 AI/ML 워크로드를 위한 간소화된 자동 확장 개념
빠른 시작: GKE에서 첫 번째 AI 모델 서빙
추론을 위한 AI 모델 서빙
GKE의 AI/ML 모델 추론 정보
GKE Inference Quickstart로 모델 서빙 성능 및 비용 분석
GKE Inference Gateway를 사용하여 AI 애플리케이션 노출
추론 권장사항
개요
추론을 위한 부하 분산 전략 선택
GPU에서 추론 워크로드 자동 확장
TPU에서 LLM 추론 워크로드 자동 확장
GPU에서 LLM 추론 워크로드 최적화
일괄 추론 워크로드 최적화
추론 예시 사용해 보기
GPU
vLLM과 함께 GPU를 사용하여 Gemma 개방형 모델 제공
DeepSeek-R1 671B 또는 Llama 3.1 405B와 같은 LLM 제공
GKE 추론 게이트웨이를 사용하여 LLM 서빙
여러 GPU로 LLM 서빙
Torch Serve로 T5 서빙
TPU
vLLM을 사용하여 TPU에서 Llama 서빙
JetStream 및 Pathways를 사용하여 멀티 호스트 TPU를 사용하여 LLM 서빙
MaxDiffusion을 사용하여 TPU에서 Stable Diffusion XL 제공
Terraform을 사용하여 TPU에서 개방형 모델 서빙
대규모 AI 모델 학습
멀티 계층 체크포인트를 사용하여 대규모 모델 학습
학습 예시 사용해 보기
GKE Standard 모드에서 GPU로 모델 학습
GKE Autopilot 모드에서 GPU로 모델 학습
Megatron-LM으로 GPU에서 Llama 모델 학습
JAX를 사용하여 GKE에서 TPU로 LLM 미세 조정
GKE에서 강화 학습 워크로드 실행
verl로 강화 학습 미세 조정 및 확장
NeMo RL로 강화 학습 미세 조정 및 확장
OpenTelemetry로 강화 학습 워크로드 모니터링
AI 에이전트 배포 및 조정
ADK 및 Agent Platform API를 사용하여 AI 에이전트 배포
ADK 및 자체 호스팅 LLM을 사용하여 AI 에이전트 배포
에이전트 Substrate로 AI 에이전트 워크로드 확장
Agent Substrate 정보
GKE에 에이전트 Substrate 설치
에이전트 샌드박스로 AI 에이전트 워크로드 보호
에이전트 샌드박스 정보
AI 에이전트 워크로드용 스토리지 선택
GKE에서 에이전트 샌드박스 사용 설정
에이전트 샌드박스로 AI 코드 실행 격리
에이전트 샌드박스 스토리지 관리
에이전트 샌드박스 환경 저장 및 복원