GPU-Beschleuniger

AI Hypercomputer bietet eine vertikal integrierte Infrastruktur, die für anspruchsvolle Arbeitslasten im Bereich künstliche Intelligenz (KI) und maschinelles Lernen (ML) optimiert ist. Leistungsstarke NVIDIA-GPUs werden danach kategorisiert, wie das System ihre Lebenszyklusereignisse und Wartung verarbeitet: Allgemeine GPUs und Cluster-GPUs.

Informationen zum Ermitteln der optimalen Infrastrukturkategorie für Ihre Arbeitslast finden Sie unter Beschleunigerinfrastruktur auswählen.

Allgemeine GPUs

Allgemeine GPUs werden als unabhängige Rechen einheiten verwaltet. Dazu werden Standard-Compute Engine- und Google Kubernetes Engine (GKE)-APIs verwendet, um sie direkt in die Steuerungsebene von Google Cloudzu integrieren.

Zu den allgemeinen GPUs gehören die folgenden Maschinenserien:

  • A3 High mit 1, 2 oder 4 (NVIDIA H100)-GPUs: Optimiert für Standard-Trainings- und Inferenzarbeitslasten, für die kein synchronisierter Cluster mit 8 GPUs erforderlich ist.
  • A3 Edge (NVIDIA H100): Optimiert für die Inferenz, die mit hohem Durchsatz auf mehrere Hosts verteilt wird, und verwendet dabei das Standard-VPC-Netzwerk.
  • A2 (NVIDIA A100): Optimiert für die Bereitstellung auf einem einzelnen Knoten mit hoher Leistung und für die Feinabstimmung im kleinen Maßstab.
  • G4 (NVIDIA RTX PRO 6000): Optimiert für kostengünstige Inferenz- und Grafikarbeitslasten der Einstiegsklasse.
  • G2 (NVIDIA L4): Optimiert für Mainstream-Inferenz und RAG.
  • N1 (NVIDIA T4 oder V100): Optimiert für Inferenz- und Forschungsaufgaben der Einstiegsklasse, bei denen die Kosten wichtiger sind als leistungsstarke Verbindungen.

Cluster-GPUs

Cluster-GPUs werden als einzelnes, eng gekoppeltes System aus Tausenden von miteinander verbundenen Beschleunigern mit Cluster Director verwaltet.

Zu den Cluster-GPUs gehören die folgenden Maschinenserien:

Überlegungen zur GPU-Leistung

Um die Leistung Ihrer Arbeitslast zu bewerten und zu optimieren, können Sie Messwerte auf Hardwareebene wie die Auslastung von CUDA- und Tensor-Cores verfolgen. Informationen zum Überwachen Ihrer Ressourcen und zum Bewerten der Leistung in allgemeinen und Cluster-Umgebungen finden Sie unter:

  • Monitoring-Dashboards: Verfolgen Sie die GPU Auslastung und die Arbeitsspeichernutzung in Echtzeit für einzelne eigenständige Instanzen oder orchestrierte Clusterflotten.
  • Rezepte für Goodput-Messwerte: Messen Sie den Prozentsatz der Zeit, in der Ihre Beschleuniger nützliche Berechnungen ausführen im Vergleich zum System-Overhead. Dies wird für verteiltes Training im großen Maßstab auf Cluster-Hardware dringend empfohlen.

Nächste Schritte