דילוג לתוכן הראשי
Google Cloud Documentation
תחומים טכנולוגיים
  • ‫AI ו-ML
  • פיתוח אפליקציות
  • אירוח אפליקציות
  • Compute
  • ניתוח נתונים וצינורות עיבוד נתונים
  • מסדי נתונים
  • סביבות מבוזרות, היברידיות ומרובות עננים (multi-cloud)
  • פתרונות לתעשייה
  • העברה
  • קשרים מקצועיים
  • ניראות ומעקב
  • אבטחה
  • Storage
כלים למכפלה וקטורית (cross product)
  • ניהול גישה ומשאבים
  • ניהול עלויות ושימוש
  • תשתית כקוד
  • ‫SDK, שפות, frameworks וכלים
/
מסוף
  • English
  • Deutsch
  • Español
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
היכנס
  • Google Kubernetes Engine (GKE)
  • GKE AI/ML
התחלת תקופת ניסיון בחינם
סקירה כללית מדריכים
Google Cloud Documentation
  • תחומים טכנולוגיים
    • עוד
    • סקירה כללית
    • מדריכים
  • כלים למכפלה וקטורית (cross product)
    • עוד
  • מסוף
  • Discover
  • מבוא לעומסי עבודה של AI/ML ב-GKE
  • עיון במסמכי התיעוד של GKE
    • סקירה כללית
    • המסמכים העיקריים בנושא GKE
    • מאמרי עזרה בנושא AI/ML ב-GKE
    • מסמכי התיעוד של GKE Networking
    • מסמכי תיעוד בנושא אבטחה ב-GKE
    • מסמכי ניהול המכשירים בארגון באמצעות GKE
  • בחירת האופן שבו יתקבלו וינוצלו מאיצים ב-GKE
  • תאימות של AI/ML ב-GKE
  • מתחילים
  • למה כדאי להשתמש ב-GKE להסקת מסקנות מ-AI/ML
  • הסבר פשוט על מושגי התאמה אוטומטית לעומס (autoscaling) לעומסי עבודה של AI/ML ב-GKE
  • מדריך למתחילים: הפעלת מודל ה-AI הראשון ב-GKE
  • הצגת מודלים של AI להסקת מסקנות
  • מידע על הסקת מסקנות ממודלים של AI/ML ב-GKE
  • ניתוח הביצועים והעלויות של מודלים שמוצגים באמצעות GKE Inference Quickstart
  • חשיפת אפליקציות AI באמצעות GKE Inference Gateway
  • שיטות מומלצות להסקת מסקנות
    • סקירה כללית
    • בחירה של אסטרטגיית איזון עומסים להסקת מסקנות
    • שינוי אוטומטי של קנה מידה של עומסי עבודה של הסקת מסקנות ב-GPU
    • שינוי אוטומטי של קנה מידה של עומסי עבודה של הסקת מסקנות של מודלים גדולים של שפה (LLM) ב-TPU
    • אופטימיזציה של עומסי עבודה של הסקת מסקנות של LLM במעבדי GPU
    • אופטימיזציה של עומסי עבודה של הסקת מסקנות באצווה
  • דוגמאות להסקת מסקנות
    • יחידות GPU
      • הפעלת מודלים פתוחים של Gemma באמצעות מעבדים גרפיים עם vLLM
      • הפעלת מודלים מסוג LLM כמו DeepSeek-R1 671B או Llama 3.1 405B
      • הצגת מודל LLM באמצעות GKE Inference Gateway
      • הפעלת מודל LLM עם כמה מעבדי GPU
      • הפעלת T5 באמצעות Torch Serve
      • ביצוע התאמה עדינה של מודלים פתוחים של Gemma באמצעות כמה מעבדי GPU
      • אבטחת עומס עבודה של שרת ב-GKE באמצעות הגנה מוגברת על המודל
    • TPUs
      • הצגת מודלים של Llama ב-TPU באמצעות vLLM
      • הצגת מודלים גדולים של שפה (LLM) באמצעות מעבדי TPU מרובי-מארחים עם JetStream ו-Pathways
      • הצגת Stable Diffusion XL ב-TPUs באמצעות MaxDiffusion
      • הצגת מודלים פתוחים ב-TPU באמצעות Terraform
  • אימון מודלים של AI בקנה מידה נרחב
  • אימון מודלים בקנה מידה גדול באמצעות Multi-tier Checkpointing
  • דוגמאות לאימון
    • אימון מודל באמצעות GPU במצב Standard ב-GKE
    • אימון מודל באמצעות GPU במצב GKE Autopilot
    • אימון מודל Llama במעבדי GPU באמצעות Megatron-LM
    • איך מבצעים כוונון עדין של מודל LLM באמצעות TPUs ב-GKE עם JAX
  • הרצת עומסי עבודה של למידת חיזוק ב-GKE
    • שיפור ושינוי קנה מידה של למידת חיזוק באמצעות verl
    • כוונון עדין והרחבה של למידה חיזוקית באמצעות NeMo RL
    • מעקב אחרי עומסי עבודה של למידת חיזוק באמצעות OpenTelemetry
  • Deploy and orchestrate AI agents
  • פריסת סוכני AI באמצעות ADK ו-Agent Platform API
  • פריסת סוכני AI באמצעות ADK ו-LLM באירוח עצמי
  • אבטחת עומסי עבודה של סוכני AI באמצעות Agent Sandbox
    • מידע על ארגז החול של סוכנים
    • הפעלת ארגז חול של סוכנים ב-GKE
    • בידוד של ביצוע קוד מבוסס-AI באמצעות ארגז חול של סוכן
    • שמירה ושחזור של סביבות Sandbox של סוכנים
    • הפעלת תמונות מצב של ארגז חול של סוכנים מתוך אשכול
  • שימוש ב-Ray לאפליקציות מבוזרות של AI/ML
  • מידע על Ray ב-GKE
  • מדריך למתחילים: פריסת אפליקציית Ray הראשונה ב-GKE
  • הפעלה של KubeRay מנוהל באמצעות התוסף Ray Operator
  • פריסת עומסי עבודה של AI/ML באמצעות Ray ב-GKE
    • הצגת מודלים של AI באמצעות Ray Serve ב-GKE
      • הצגת מודל LLM ב-GPU באמצעות Ray Serve
      • הפעלת מודל LLM באמצעות Ray Serve ו-Inference Gateway באשכולות מרובים
      • הצגת מודל LLM במעבדי TPU באמצעות Ray Serve
      • מילוי בקשות של מודלים פתוחים של Gemma באמצעות TPU מרובה מארחים ב-GKE עם Ray
      • הצגת מודל דיפוזיה ב-GPU באמצעות Ray
      • הצגת מודל דיפוזיה ב-TPU באמצעות Ray
    • אימון מודלים של AI באמצעות Ray ב-GKE
      • אימון באמצעות PyTorch,‏ Ray ו-GKE
      • אימון של LLM באמצעות Jax ו-Ray Train ב-TPU עם GKE
      • אימון רשתות עצביות עם כמה פרוסות ואימון גמיש ביחידות TPU באמצעות Ray Train ב-GKE
  • שימוש ב-GPU עם Ray ב-GKE
    • הגדרה של Ray ב-GKE עם A4X ו-GB200
  • שימוש במעבדי TPU עם Ray ב-GKE
    • הגדרה של Ray ב-GKE עם TPU Trillium
    • אופטימיזציה של אימון AI במעבדי TPU באמצעות DWS ו-Kueue
  • מעקב אחרי Ray ב-GKE
    • צפייה ביומנים של Ray Operator ב-GKE
    • צפייה ביומנים ובמדדים של אשכולות Ray ב-GKE
    • ניפוי באגים במשימות Ray שהושלמו באמצעות Ray History Server
  • שימוש באופרטור Slurm לעומסי עבודה של HPC ו-AI/ML
  • מידע על Slurm ב-GKE
  • מדריך למתחילים: פריסת אשכול Slurm ב-GKE
  • הפעלת התוסף Slurm Operator