דילוג לתוכן הראשי
תחומים טכנולוגיים
close
AI ו-ML
פיתוח אפליקציות
אירוח אפליקציות
Compute
ניתוח נתונים וצינורות עיבוד נתונים
מסדי נתונים
סביבות מבוזרות, היברידיות ומרובות עננים (multi-cloud)
פתרונות לתעשייה
העברה
קשרים מקצועיים
ניראות ומעקב
אבטחה
Storage
כלים למכפלה וקטורית (cross product)
close
ניהול גישה ומשאבים
ניהול עלויות ושימוש
תשתית כקוד
SDK, שפות, frameworks וכלים
/
מסוף
English
Deutsch
Español
Español – América Latina
Français
Indonesia
Italiano
Português
Português – Brasil
עברית
中文 – 简体
中文 – 繁體
日本語
한국어
היכנס
Google Kubernetes Engine (GKE)
GKE AI/ML
התחלת תקופת ניסיון בחינם
סקירה כללית
מדריכים
תחומים טכנולוגיים
עוד
סקירה כללית
מדריכים
כלים למכפלה וקטורית (cross product)
עוד
מסוף
Discover
מבוא לעומסי עבודה של AI/ML ב-GKE
עיון במסמכי התיעוד של GKE
סקירה כללית
המסמכים העיקריים בנושא GKE
מאמרי עזרה בנושא AI/ML ב-GKE
מסמכי התיעוד של GKE Networking
מסמכי תיעוד בנושא אבטחה ב-GKE
מסמכי ניהול המכשירים בארגון באמצעות GKE
בחירת האופן שבו יתקבלו וינוצלו מאיצים ב-GKE
תאימות של AI/ML ב-GKE
מתחילים
למה כדאי להשתמש ב-GKE להסקת מסקנות מ-AI/ML
הסבר פשוט על מושגי התאמה אוטומטית לעומס (autoscaling) לעומסי עבודה של AI/ML ב-GKE
מדריך למתחילים: הפעלת מודל ה-AI הראשון ב-GKE
הצגת מודלים של AI להסקת מסקנות
מידע על הסקת מסקנות ממודלים של AI/ML ב-GKE
ניתוח הביצועים והעלויות של מודלים שמוצגים באמצעות GKE Inference Quickstart
חשיפת אפליקציות AI באמצעות GKE Inference Gateway
שיטות מומלצות להסקת מסקנות
סקירה כללית
בחירה של אסטרטגיית איזון עומסים להסקת מסקנות
שינוי אוטומטי של קנה מידה של עומסי עבודה של הסקת מסקנות ב-GPU
שינוי אוטומטי של קנה מידה של עומסי עבודה של הסקת מסקנות של מודלים גדולים של שפה (LLM) ב-TPU
אופטימיזציה של עומסי עבודה של הסקת מסקנות של LLM במעבדי GPU
אופטימיזציה של עומסי עבודה של הסקת מסקנות באצווה
דוגמאות להסקת מסקנות
יחידות GPU
הפעלת מודלים פתוחים של Gemma באמצעות מעבדים גרפיים עם vLLM
הפעלת מודלים מסוג LLM כמו DeepSeek-R1 671B או Llama 3.1 405B
הצגת מודל LLM באמצעות GKE Inference Gateway
הפעלת מודל LLM עם כמה מעבדי GPU
הפעלת T5 באמצעות Torch Serve
ביצוע התאמה עדינה של מודלים פתוחים של Gemma באמצעות כמה מעבדי GPU
אבטחת עומס עבודה של שרת ב-GKE באמצעות הגנה מוגברת על המודל
TPUs
הצגת מודלים של Llama ב-TPU באמצעות vLLM
הצגת מודלים גדולים של שפה (LLM) באמצעות מעבדי TPU מרובי-מארחים עם JetStream ו-Pathways
הצגת Stable Diffusion XL ב-TPUs באמצעות MaxDiffusion
הצגת מודלים פתוחים ב-TPU באמצעות Terraform
אימון מודלים של AI בקנה מידה נרחב
אימון מודלים בקנה מידה גדול באמצעות Multi-tier Checkpointing
דוגמאות לאימון
אימון מודל באמצעות GPU במצב Standard ב-GKE
אימון מודל באמצעות GPU במצב GKE Autopilot
אימון מודל Llama במעבדי GPU באמצעות Megatron-LM
איך מבצעים כוונון עדין של מודל LLM באמצעות TPUs ב-GKE עם JAX
הרצת עומסי עבודה של למידת חיזוק ב-GKE
שיפור ושינוי קנה מידה של למידת חיזוק באמצעות verl
כוונון עדין והרחבה של למידה חיזוקית באמצעות NeMo RL
מעקב אחרי עומסי עבודה של למידת חיזוק באמצעות OpenTelemetry
Deploy and orchestrate AI agents
פריסת סוכני AI באמצעות ADK ו-Agent Platform API
פריסת סוכני AI באמצעות ADK ו-LLM באירוח עצמי
אבטחת עומסי עבודה של סוכני AI באמצעות Agent Sandbox
מידע על ארגז החול של סוכנים
הפעלת ארגז חול של סוכנים ב-GKE
בידוד של ביצוע קוד מבוסס-AI באמצעות ארגז חול של סוכן
שמירה ושחזור של סביבות Sandbox של סוכנים
הפעלת תמונות מצב של ארגז חול של סוכנים מתוך אשכול
שימוש ב-Ray לאפליקציות מבוזרות של AI/ML
מידע על Ray ב-GKE
מדריך למתחילים: פריסת אפליקציית Ray הראשונה ב-GKE
הפעלה של KubeRay מנוהל באמצעות התוסף Ray Operator
פריסת עומסי עבודה של AI/ML באמצעות Ray ב-GKE
הצגת מודלים של AI באמצעות Ray Serve ב-GKE
הצגת מודל LLM ב-GPU באמצעות Ray Serve
הפעלת מודל LLM באמצעות Ray Serve ו-Inference Gateway באשכולות מרובים
הצגת מודל LLM במעבדי TPU באמצעות Ray Serve
מילוי בקשות של מודלים פתוחים של Gemma באמצעות TPU מרובה מארחים ב-GKE עם Ray
הצגת מודל דיפוזיה ב-GPU באמצעות Ray
הצגת מודל דיפוזיה ב-TPU באמצעות Ray
אימון מודלים של AI באמצעות Ray ב-GKE
אימון באמצעות PyTorch, Ray ו-GKE
אימון של LLM באמצעות Jax ו-Ray Train ב-TPU עם GKE
אימון רשתות עצביות עם כמה פרוסות ואימון גמיש ביחידות TPU באמצעות Ray Train ב-GKE
שימוש ב-GPU עם Ray ב-GKE
הגדרה של Ray ב-GKE עם A4X ו-GB200
שימוש במעבדי TPU עם Ray ב-GKE
הגדרה של Ray ב-GKE עם TPU Trillium
אופטימיזציה של אימון AI במעבדי TPU באמצעות DWS ו-Kueue
מעקב אחרי Ray ב-GKE
צפייה ביומנים של Ray Operator ב-GKE
צפייה ביומנים ובמדדים של אשכולות Ray ב-GKE
ניפוי באגים במשימות Ray שהושלמו באמצעות Ray History Server
שימוש באופרטור Slurm לעומסי עבודה של HPC ו-AI/ML
מידע על Slurm ב-GKE
מדריך למתחילים: פריסת אשכול Slurm ב-GKE
הפעלת התוסף Slurm Operator