מעבדי GPU מקובצים באשכולות מותאמים לעומסי עבודה של בינה מלאכותית (AI) ולמידת מכונה (ML) שבהם יש עדיפות לאימון מבוזר בקנה מידה עצום, להסקת מסקנות במארחים מרובים ולמשימות מורכבות של מחשוב בעל ביצועים גבוהים (HPC).
מערכות GPU באשכול מאפשרות לצוותים לפרוס אלפי מאיצים מקושרים ולהרחיב אותם כמערכת יחידה ומקושרת היטב, באמצעות רשתות מיוחדות ותחזוקה מסונכרנת. הם אידיאליים לעומסי עבודה שדורשים מחשוב קיצוני, זיכרון וסנכרון מהיר של רשתות. תרחישי שימוש נפוצים כוללים אימון מוקדם של מודלים בסיסיים עם טריליוני פרמטרים, הפעלה של מודלים מתקדמים וסימולציות לגילוי תרופות.
מאפיינים מרכזיים של GPU מרוכז
- תחזוקה מסונכרנת: Google Cloud עדכונים של כל הצמתים באשכול בו-זמנית, כדי למנוע מצב שבו הפעלה מחדש של צומת יחיד תגרום לעיכוב של עבודה.
- ניטור אוטומטי של תקינות המערכת: המערכת מזהה באופן יזום מכשירים שמתקשים להתחבר לרשת ומנטרת את המערכת כדי לזהות כשלים בחומרה או שיבושים שקטים בנתונים.
- החלפת צמתים באופן יזום: המערכת מוציאה מכונות וירטואליות עם ביצועים נמוכים ממכונות תקינות ומקצה אותן מחדש ממאגר חלופי.
- טופולוגיה בארכיטקטורת rail-aligned: טופולוגיה בארכיטקטורת rail-aligned מבודדת את תעבורת הנתונים מ-GPU ל-GPU מתקשורת מארח רגילה, כדי להבטיח ביצועים ללא רעידות לתיאום של מספר רב של צמתים.
- פרוטוקולים מתקדמים: סדרות המכונות האלה תומכות בחיבורים מהירים בין רכיבים, כולל GPUDirect RDMA (מבוסס על RoCE).
משפחות של GPU מקובצים ומפרטים טכניים
בטבלאות הבאות מפורטים עומסי העבודה ומפרטי החומרה של סדרת מכונות ה-GPU בתצורת אשכול פרימיום. לאימון בקנה מידה של אקסה, משתמשים בסדרות A4X או A3 Ultra.
A4X Max ו-A4X series
אם אתם מאמנים מודלים בסיסיים בקנה מידה עצום או מריצים סימולציות מורכבות מאוד של מחשוב עתיר ביצועים (HPC) על מתכת חשופה, כדאי להשתמש בסדרת המכונות A4X Max או A4X. בסדרות האלה יש שבבי NVIDIA GB300 Grace Blackwell Ultra Superchips לטיפול בדרישות קיצוניות של חישוב וזיכרון.
A4X Max (Bare metal)
סוגי מכונות A4X Max
משתמשים ב-NVIDIA GB300 Grace Blackwell Ultra Superchips (nvidia-gb300) והם אידיאליים לאימון מודלים בסיסיים ולמילוי בקשות. סוגי המכונות A4X Max זמינים כמכונות Bare Metal.
A4X Max היא פלטפורמה בקנה מידה אקססקייל שמבוססת על NVIDIA GB300 NVL72. לכל מכונה יש שני שקעים עם מעבדי NVIDIA Grace עם ליבות Arm Neoverse V2. יחידות העיבוד המרכזיות האלה מחוברות לארבע יחידות GPU מסוג NVIDIA B300 Blackwell עם תקשורת מהירה בין שבבים (NVLink-C2C).
| מצורפים שבבי NVIDIA GB300 Grace Blackwell Ultra Superchips | |||||||
|---|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | אחסון SSD מקומי מצורף (GiB) | מספר כרטיסי ה-NIC הפיזיים | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB HBM3e) |
a4x-maxgpu-4g-metal |
144 | 960 | 12,000 | 6 | 3,600 | 4 | 1,116 |
1 vCPU מיושם כ-hyper-thread יחיד בחומרה באחת מפלטפורמות ה-CPU הזמינות.
2 רוחב הפס המקסימלי של התעבורה היוצאת לא יכול להיות גבוה מהמספר שצוין. רוחב הפס בפועל של התעבורה היוצאת תלוי בכתובת ה-IP של היעד ובגורמים אחרים.
מידע נוסף על רוחב פס ברשת זמין במאמר רוחב פס ברשת.
3זיכרון GPU הוא הזיכרון במכשיר GPU שאפשר להשתמש בו לאחסון זמני של נתונים. הזיכרון הזה נפרד מהזיכרון של המופע, והוא מיועד במיוחד לטיפול בדרישות רוחב הפס הגבוהות יותר של עומסי עבודה עתירי גרפיקה.
A4X
סוגי המכונות A4X
משתמשים ב-NVIDIA GB200 Grace Blackwell Superchips (nvidia-gb200) והם
אידיאליים לאימון מודלים בסיסיים ולהצגתם.
A4X היא פלטפורמה בקנה מידה אקססקייל שמבוססת על NVIDIA GB200 NVL72. לכל מכונה יש שני שקעים עם מעבדי NVIDIA Grace עם ליבות Arm Neoverse V2. המעבדים האלה מחוברים לארבע יחידות GPU מסוג NVIDIA B200 Blackwell עם תקשורת מהירה בין שבבים (NVLink-C2C).
| מצורפים שבבי NVIDIA GB200 Grace Blackwell Superchips | |||||||
|---|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | אחסון SSD מקומי מצורף (GiB) | מספר כרטיסי ה-NIC הפיזיים | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB HBM3e) |
a4x-highgpu-4g |
140 | 884 | 12,000 | 6 | 2,000 | 4 | 744 |
1 vCPU מיושם כ-hyper-thread יחיד בחומרה באחת מפלטפורמות ה-CPU הזמינות.
2 רוחב הפס המקסימלי של התעבורה היוצאת לא יכול להיות גבוה מהמספר שצוין. רוחב הפס בפועל של התעבורה היוצאת תלוי בכתובת ה-IP של היעד ובגורמים אחרים.
מידע נוסף על רוחב פס ברשת זמין במאמר רוחב פס ברשת.
3זיכרון GPU הוא הזיכרון במכשיר GPU שאפשר להשתמש בו לאחסון זמני של נתונים. הזיכרון הזה נפרד מהזיכרון של המופע, והוא מיועד במיוחד לטיפול בדרישות רוחב הפס הגבוהות יותר של עומסי עבודה עתירי גרפיקה.
A4 series
אם המטרה שלכם היא לאמן מודלים בסיסיים מתקדמים שדורשים עיבוד מקבילי בקנה מידה עצום, כדאי להשתמש בסדרת מכונות A4 כדי לבצע אופטימיזציה של זמן העיבוד ולמקסם את קצב העברת הנתונים של החומרה.
לסוגי המכונות A4 מצורפים מעבדי NVIDIA B200 Blackwell GPU (nvidia-b200), והם אידיאליים לאימון מודלים בסיסיים ולהצגתם.
| מעבדים גרפיים (GPU) מסוג NVIDIA B200 Blackwell מצורפים | |||||||
|---|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | אחסון SSD מקומי מצורף (GiB) | מספר כרטיסי ה-NIC הפיזיים | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB HBM3e) |
a4-highgpu-8g |
224 | 3,968 | 12,000 | 10 | 3,600 | 8 | 1,440 |
1 vCPU מיושם כ-hyper-thread יחיד בחומרה באחת מפלטפורמות ה-CPU הזמינות.
2 רוחב הפס המקסימלי של התעבורה היוצאת לא יכול להיות גבוה מהמספר שצוין. רוחב הפס בפועל של התעבורה היוצאת תלוי בכתובת ה-IP של היעד ובגורמים אחרים.
מידע נוסף על רוחב פס ברשת זמין במאמר בנושא רוחב פס ברשת.
3זיכרון GPU הוא הזיכרון במכשיר GPU שאפשר להשתמש בו לאחסון זמני של נתונים. הזיכרון הזה נפרד מהזיכרון של המופע, והוא מיועד במיוחד לטיפול בדרישות רוחב הפס הגבוהות יותר של עומסי עבודה עתירי גרפיקה.
סדרת A3 (Ultra, Mega ו-High עם 8 יחידות GPU)
אם אתם צריכים להריץ הרצות אימון מבוזרות בקנה מידה גדול או להכניס לשימוש בסביבת הייצור מודלים פורצי דרך בכמה מארחים עם טבלאות גדולות של קבוצות נתונים, כדאי להשתמש בסדרת מכונות A3 כדי לצמצם את זמן האחזור ברשת בין המארחים.
A3 Ultra
| מעבדי GPU מסוג NVIDIA H200 שמצורפים | |||||||
|---|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | אחסון SSD מקומי מצורף (GiB) | מספר כרטיסי ה-NIC הפיזיים | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB HBM3e) |
a3-ultragpu-8g |
224 | 2,952 | 12,000 | 10 | 3,600 | 8 | 1128 |
A3 Mega
| כרטיסי GPU של NVIDIA H100 מצורפים | |||||||
|---|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | אחסון SSD מקומי מצורף (GiB) | מספר כרטיסי ה-NIC הפיזיים | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB HBM3) |
a3-megagpu-8g |
208 | 1,872 | 6,000 | 9 | 1,800 | 8 | 640 |
A3 High
| כרטיסי GPU של NVIDIA H100 מצורפים | |||||||
|---|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | אחסון SSD מקומי מצורף (GiB) | מספר כרטיסי ה-NIC הפיזיים | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1,500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3,000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1,872 | 6,000 | 5 | 1,000 | 8 | 640 |
1 vCPU מיושם כ-hyper-thread יחיד בחומרה באחת מפלטפורמות ה-CPU הזמינות.
2 רוחב הפס המקסימלי של התעבורה היוצאת לא יכול להיות גבוה מהמספר שצוין. רוחב הפס בפועל של התעבורה היוצאת תלוי בכתובת ה-IP של היעד ובגורמים אחרים.
מידע נוסף על רוחב פס ברשת זמין במאמר רוחב פס ברשת.
3זיכרון GPU הוא הזיכרון במכשיר GPU שאפשר להשתמש בו לאחסון זמני של נתונים. הזיכרון הזה נפרד מהזיכרון של המופע, והוא מיועד במיוחד לטיפול בדרישות רוחב הפס הגבוהות יותר של עומסי עבודה עתירי גרפיקה.
הגדלת הקיבולת
כדי לרכוש קיבולת מחשוב עבור GPU מקובצים, צריך לתאם בין ההיצע והביקוש של מאיצים עם ביצועים גבוהים. מכיוון שהמשאבים האלה ממוקמים פיזית ברשתות מיוחדות, צריך לבקש אותם באמצעות תהליכי עבודה מנוהלים.
אתם יכולים להזמין קיבולת דרך צוות ניהול החשבון שלכם או להשתמש במקומות שמורים לעתיד ובכלי לתזמון עומסי עבודה דינמיים.
המאמרים הבאים
- במאמר אפשרויות צריכה מוסבר איך לרכוש נפח אחסון.
- כדי להעריך את דרישות התשתית, אפשר לעיין במאמר בחירת תשתית.
- כדי לתכנן את טופולוגיית הרשת, אפשר לעיין במאמר בנושא דרישות רשת של GPU לסביבות מקובצות.
- כדי לשריין משאבי מחשוב, אפשר לעיין במאמר בנושא שמירת קיבולת.