기본 콘텐츠로 건너뛰기
Google Cloud Documentation
문서
  • 시작하기
  • Google Cloud 시작하기
  • 제품 목록
  • Cloud Customer Care
  • 추천 제품
  • Agent Platform
  • Apigee API 관리
  • BigQuery
  • Compute Engine은
  • Cloud CDN
  • Cloud Run
  • Cloud Storage
  • Cloud SQL
  • Gemini Enterprise
  • Google Kubernetes Engine
  • Looker
  • 크로스 프로덕트 도구
  • 액세스 및 리소스 관리
  • 비용 및 사용량 관리
  • 코드형 인프라
  • SDK, 언어, 프레임워크, 도구
  • 기술 분야
  • AI 및 ML
  • 애플리케이션 개발
  • 애플리케이션 호스팅
  • 컴퓨팅
  • 데이터 분석 및 파이프라인
  • 데이터베이스
  • 분산, 하이브리드, 멀티 클라우드
  • 업종별 솔루션
  • 이전
  • 네트워킹
  • 모니터링 가능성 및 모니터링
  • 보안
  • Storage
/
콘솔
  • English
  • Deutsch
  • Español
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
  • Google Kubernetes Engine (GKE)
  • GKE AI/ML
무료로 시작하기
개요 가이드
Google Cloud Documentation
  • 문서
    • 더보기
    • 개요
    • 가이드
  • 콘솔
  • Discover
  • GKE의 AI/ML 워크로드 소개
  • GKE 문서 살펴보기
    • 개요
    • 기본 GKE 문서
    • GKE AI/ML 문서
    • GKE 네트워킹 문서
    • GKE 보안 문서
    • GKE Fleet 관리 문서
  • GKE에서 가속기를 획득하고 사용하는 방법 선택
  • Gemini로 리소스 획득 가능성 설계
  • GKE AI/ML 적합성
  • 시작하기
  • AI/ML 추론에 GKE를 사용해야 하는 이유
  • GKE의 AI/ML 워크로드를 위한 간소화된 자동 확장 개념
  • 빠른 시작: GKE에서 첫 번째 AI 모델 서빙
  • 추론을 위한 AI 모델 서빙
  • GKE의 AI/ML 모델 추론 정보
  • GKE Inference Quickstart로 모델 서빙 성능 및 비용 분석
  • GKE Inference Gateway를 사용하여 AI 애플리케이션 노출
  • 추론 권장사항
    • 개요
    • 추론을 위한 부하 분산 전략 선택
    • GPU에서 추론 워크로드 자동 확장
    • TPU에서 LLM 추론 워크로드 자동 확장
    • GPU에서 LLM 추론 워크로드 최적화
    • 일괄 추론 워크로드 최적화
  • 추론 예시 사용해 보기
    • GPU
      • vLLM과 함께 GPU를 사용하여 Gemma 개방형 모델 제공
      • DeepSeek-R1 671B 또는 Llama 3.1 405B와 같은 LLM 제공
      • GKE 추론 게이트웨이를 사용하여 LLM 서빙
      • 여러 GPU로 LLM 서빙
      • Torch Serve로 T5 서빙
    • TPU
      • vLLM을 사용하여 TPU에서 Llama 서빙
      • JetStream 및 Pathways를 사용하여 멀티 호스트 TPU를 사용하여 LLM 서빙
      • MaxDiffusion을 사용하여 TPU에서 Stable Diffusion XL 제공
      • Terraform을 사용하여 TPU에서 개방형 모델 서빙
  • 대규모 AI 모델 학습
  • 멀티 계층 체크포인트를 사용하여 대규모 모델 학습
  • 학습 예시 사용해 보기
    • GKE Standard 모드에서 GPU로 모델 학습
    • GKE Autopilot 모드에서 GPU로 모델 학습
    • Megatron-LM으로 GPU에서 Llama 모델 학습
    • JAX를 사용하여 GKE에서 TPU로 LLM 미세 조정
  • GKE에서 강화 학습 워크로드 실행
    • verl로 강화 학습 미세 조정 및 확장
    • NeMo RL로 강화 학습 미세 조정 및 확장
    • OpenTelemetry로 강화 학습 워크로드 모니터링
  • AI 에이전트 배포 및 조정
  • ADK 및 Agent Platform API를 사용하여 AI 에이전트 배포
  • ADK 및 자체 호스팅 LLM을 사용하여 AI 에이전트 배포
  • 에이전트 Substrate로 AI 에이전트 워크로드 확장
    • Agent Substrate 정보
    • GKE에 에이전트 Substrate 설치
  • 에이전트 샌드박스로 AI 에이전트 워크로드 보호
    • 에이전트 샌드박스 정보
    • AI 에이전트 워크로드용 스토리지 선택
    • GKE에서 에이전트 샌드박스 사용 설정
    • 에이전트 샌드박스로 AI 코드 실행 격리
    • 에이전트 샌드박스 스토리지 관리
    • 에이전트 샌드박스 환경 저장 및 복원