一般 GPU 經過最佳化,適用於人工智慧 (AI) 和機器學習 (ML) 工作負載,可優先考量作業彈性、資源獨立性和成本效益。
團隊可完全自主地部署及擴充 NVIDIA 加速器,不必費心處理協調式超級運算叢集的架構複雜性。這個系列非常適合優先考量高可用性、自助式佈建和獨立調整資源配置的工作負載。常見用途包括即時推論、RAG、原型設計,以及訓練中小型模型。
一般用途 GPU 的主要特徵
- 作業彈性:您可以使用標準 GKE (Autopilot 和 Standard) 和 Compute Engine 介面管理資源,簡化部署和擴充作業。
- 高可用性: Google Cloud 獨立更新個別執行個體,確保一個節點的更新不會影響其他節點的可用性,讓負載平衡器重新導向流量,而不會停止服務機群。
- 網路簡化:工作負載使用標準虛擬私有雲 (VPC) 服務和標準 TCP/IP (透過 Google 虛擬 NIC (gVNIC) 介面),可消除複雜的硬體層級結構。
- 成本最佳化:您可以將 Spot VM 用於容錯研究,與標準隨選費率相比,最多可節省 90% 的成本。
- 自助式取得:您可以透過標準預訂和隨選要求直接取得容量,不必使用帳戶團隊管理的工作流程。
一般 GPU 系列和技術規格
請查看一般 GPU 機器系列的硬體規格和工作負載。如要提供高輸送量的服務,請使用 A3 Edge 系列。
A3 系列 (High,配備 1、2 或 4 個 GPU,以及 Edge)
A3 High (1 個、2 個或 4 個 GPU)
如果您執行推論或標準訓練工作負載時需要高效能,但不需要完整的 8 個 GPU 同步叢集,請使用 A3 High 機器系列,並附加 1、2 或 4 個 GPU。
A3 High 機型配備 NVIDIA H100 SXM GPU,適合大型模型推論與模型微調。
| 附加的 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 附加的本機 SSD (GiB) | 實體 NIC 數量 | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1,500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3,000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1,872 | 6,000 | 5 | 1,000 | 8 | 640 |
1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。
A3 Edge
如果您在多個主機上執行高處理量的分散式推論工作負載,但沒有協調的叢集架構,請使用 A3 Edge 系列,簡化標準虛擬私有網路的部署作業。
A3 Edge 機型搭載 NVIDIA H100 SXM GPU,專為部署工作負載而設計,僅適用於部分區域。
| 附加的 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 附加的本機 SSD (GiB) | 實體 NIC 數量 | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB HBM3) |
a3-edgegpu-8g |
208 | 1,872 | 6,000 | 5 |
|
8 | 640 |
A2 系列 (標準版和 Ultra 版)
如要執行高效能單一節點提供模型或小規模模型微調作業,請使用 A2 機器系列存取專屬的 NVIDIA A100 GPU 資源。
A2 Ultra
| 已連結 NVIDIA A100 80GB GPU | ||||||
|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 附加的本機 SSD (GiB) | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB HBM2e) |
a2-ultragpu-1g |
12 | 170 | 375 | 24 | 1 | 80 |
a2-ultragpu-2g |
24 | 340 | 750 | 32 | 2 | 160 |
a2-ultragpu-4g |
48 | 680 | 1,500 | 50 | 4 | 320 |
a2-ultragpu-8g |
96 | 1,360 | 3,000 | 100 | 8 | 640 |
1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。
A2 Standard
| 已連結 NVIDIA A100 40GB GPU | ||||||
|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 支援本機 SSD | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB HBM2) |
a2-highgpu-1g |
12 | 85 | 是 | 24 | 1 | 40 |
a2-highgpu-2g |
24 | 170 | 是 | 32 | 2 | 80 |
a2-highgpu-4g |
48 | 340 | 是 | 50 | 4 | 160 |
a2-highgpu-8g |
96 | 680 | 是 | 100 | 8 | 320 |
a2-megagpu-16g |
96 | 1,360 | 是 | 100 | 16 | 640 |
1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。
G4 系列
如果團隊需要經濟實惠的入門級推論或標準圖形轉譯工作負載,請使用搭載 NVIDIA RTX PRO 6000 GPU 的 G4 機器系列。
G4
機器類型使用
NVIDIA RTX PRO 6000 Blackwell 伺服器版 GPU (nvidia-rtx-pro-6000),
適用於 NVIDIA Omniverse 模擬工作負載、需要大量圖形處理的應用程式、影片轉碼和虛擬桌面。與 A 系列機型相比,G4 機型也提供低成本解決方案,可執行單一主機推論和模型微調。
| 已連結的 NVIDIA RTX PRO 6000 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 支援的 Titanium SSD 容量上限 (GiB)2 | 實體 NIC 數量 | 網路頻寬上限 (Gbps)3 | GPU 數量 | GPU 記憶體4 (GB GDDR7) |
g4-standard-6 |
6 | 22 | 0 | 1 | 20 | 1/8 | 12 |
g4-standard-12 |
12 | 45 | 375 | 1 | 20 | 1/4 | 24 |
g4-standard-24 |
24 | 90 | 750 | 1 | 20 | 1/2 | 48 |
g4-standard-48 |
48 | 180 | 1,500 | 1 | 50 | 1 | 96 |
g4-standard-96 |
96 | 360 | 3,000 | 1 | 100 | 2 | 192 |
g4-standard-192 |
192 | 720 | 6,000 | 1 | 200 | 4 | 384 |
g4-standard-384 |
384 | 1,440 | 12,000 | 2 | 400 | 8 | 768 |
*GPU 記憶體是指 GPU 裝置可用的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理加速工作負載 (例如機器學習和需要大量繪圖資源的工作負載) 的高頻寬需求。
G2 系列
如果您要部署主流的即時推論應用程式或檢索增強生成 (RAG) 管道,請使用 G2 機器系列搭配 NVIDIA L4 GPU,兼顧效能和成本效益。
| 附加的 NVIDIA L4 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 預設執行個體記憶體 (GB) | 自訂執行個體記憶體範圍 (GB) | 支援的最大本機 SSD (GiB) | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB GDDR6) |
g2-standard-4 |
4 | 16 | 16 至 32 | 375 | 10 | 1 | 24 |
g2-standard-8 |
8 | 32 | 32 至 54 | 375 | 16 | 1 | 24 |
g2-standard-12 |
12 | 48 | 48 到 54 歲 | 375 | 16 | 1 | 24 |
g2-standard-16 |
16 | 64 | 54 到 64 | 375 | 32 | 1 | 24 |
g2-standard-24 |
24 | 96 | 96 至 108 | 750 | 32 | 2 | 48 |
g2-standard-32 |
32 | 128 | 96 至 128 | 375 | 32 | 1 | 24 |
g2-standard-48 |
48 | 192 | 192 至 216 | 1,500 | 50 | 4 | 96 |
g2-standard-96 |
96 | 384 | 384 至 432 | 3,000 | 100 | 8 | 192 |
1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。
N1 系列 (NVIDIA T4 或 V100)
如果您的首要考量是成本,或是要執行低並行程度的入門級推論,請使用 N1 機器系列,並連結 NVIDIA T4 或 V100 GPU。
NVIDIA T4
| 加速器類型 | GPU 數量 | GPU 記憶體1 (GB GDDR6) | vCPU 數量 | 執行個體記憶體 (GB) | 支援本機 SSD |
|---|---|---|---|---|---|
nvidia-tesla-t4 或 nvidia-tesla-t4-vws
|
1 | 16 | 1 至 48 | 1 至 312 | 是 |
| 2 | 32 | 1 至 48 | 1 至 312 | 是 | |
| 4 | 64 | 1 至 96 | 1 至 624 | 是 |
NVIDIA V100
| 加速器類型 | GPU 數量 | GPU 記憶體1 (GB HBM2) | vCPU 數量 | 執行個體記憶體 (GB) | 支援本機 SSD2 |
|---|---|---|---|---|---|
nvidia-tesla-v100 |
1 | 16 | 1 至 12 | 1 至 78 | 是 |
| 2 | 32 | 1 至 24 | 1 至 156 | 是 | |
| 4 | 64 | 1 至 48 | 1 至 312 | 是 | |
| 8 | 128 | 1 至 96 | 1 至 624 | 是 |
取得容量
一般 GPU 加速器使用標準的自助式佈建方式。您可以透過標準預留、隨選要求或 Spot VM 取得容量。由於隨選容量可能會缺貨,請盡可能使用 Spot VM 或彈性啟動 VM。
後續步驟
- 如要瞭解如何取得容量,請參閱「用量方案」。
- 如要評估基礎架構需求,請參閱「選擇基礎架構」。
- 如要查看 GPU 的網路服務,請參閱 GPU 網路總覽。
- 如要查看啟動叢集時的程序和選擇,請參閱「規劃及建立 AI 基礎架構」。