Wenn Sie Arbeitslasten für künstliche Intelligenz (KI) oder maschinelles Lernen (ML) effizient ausführen möchten, müssen Sie sowohl einen Arbeitslast-Orchestrator als auch eine Bereitstellungsplattform auswählen. Diese Komponenten haben folgende Funktionen:
Ein Orchestrator plant und führt Ihre Jobs aus.
Eine Bereitstellungsoption verwaltet einen Orchestrator.
Nachdem Sie festgelegt haben, welche GPU-Infrastruktur (Cluster-GPUs oder allgemeine GPUs) zum Ausführen Ihrer Arbeitslasten verwendet werden soll, folgen Sie der Anleitung in diesem Dokument, um den Orchestrator und die Bereitstellung zu ermitteln, die am besten zu Ihrer Arbeitslast und Ihrem Verwaltungsaufwand passen.
Informationen zu den GPU-Maschinentypen, die Sie zum Ausführen Ihrer Arbeitslasten verwenden können, finden Sie unter GPU Maschinen.
Orchestratoren und Bereitstellungsoptionen vergleichen
AI Hypercomputer bietet mehrere Orchestratoren und Bereitstellungsoptionen für Ihre Compute-Instanzen. Diese Optionen reichen von vollständig verwalteten Clustern, mit denen Sie sich auf Ihre Arbeitslasten konzentrieren können, bis hin zu selbstverwalteten Umgebungen, die eine detaillierte Kontrolle darüber bieten, wie Sie Ihre Compute-Instanzen verwalten und aktualisieren.
In der folgenden Tabelle werden die Orchestratoren und Bereitstellungsoptionen verglichen, die Sie beim Ausführen von KI-Arbeitslasten verwenden können:
| Produkt | Orchestrator | Technische Komplexität | Empfohlen für | Vorteil |
|---|---|---|---|---|
| Cluster Director | Slurm | Niedrig | KI-Forscher, Data Scientists | Verwalteter Lebenszyklus für Slurm-Cluster |
| Google Kubernetes Engine (GKE) | Kubernetes | Mittel bis hoch | ML-Entwickler, Plattformentwickler | Containerorchestrierung und ‑skalierung |
| Cluster Toolkit | Slurm, Kubernetes | Medium | ML-DevOps, Plattformentwickler | Validierte Infrastructure as Code-Blueprints |
| Compute Engine | Benutzerdefiniert / Keine | Hoch | Infrastrukturarchitekten | Detaillierte Kontrolle über Betriebssystem und Netzwerk |
Orchestrator und Bereitstellungsoption auswählen
Verwenden Sie das folgende Flussdiagramm, um einen Orchestrator und eine Bereitstellungsoption auszuwählen:
Das obige Flussdiagramm enthält die folgenden Fragen:
Möchten Sie eine Clusterorchestrierung für Ihre Arbeitslasten?
- Ja: Fahren Sie mit Frage 2 fort.
- Nein: Verwenden Sie die Compute Engine.
Möchten Sie standardmäßige containerisierte Anwendungen ausführen?
- Ja: Verwenden Sie GKE.
- Nein: Fahren Sie mit Frage 3 fort.
Möchten Sie, dass Google den Clusterlebenszyklus verwaltet?
- Ja: Verwenden Sie Cluster Director.
- Nein: Verwenden Sie Cluster Toolkit.
Unterstützte Orchestratoren
Ein Orchestrator automatisiert die Clusterverwaltung und macht es überflüssig, jede Compute-Instanz einzeln zu verwalten. Orchestratoren wie Slurm oder Kubernetes verarbeiten die Jobwarteschlange, die Ressourcenzuweisung und das Autoscaling.
Slurm: Ein Open-Source-Orchestrator, der häufig für KI-, ML-, und HPC-Arbeitslasten verwendet wird. Sie können Slurm mit Cluster Toolkit oder Cluster Director verwenden.
Kubernetes: Eine Open-Source-Plattform für die Containerorchestrierung. Sie können Kubernetes direkt mit GKE oder über Cluster Toolkit bereitstellen.
Benutzerdefiniert oder keine: Verwenden Sie die Compute Engine, wenn Sie einen anderen Orchestrator bevorzugen oder Ihre Compute-Instanzen ohne Orchestrator verwalten möchten. Diese Option bietet die höchste Kontrolle, erfordert jedoch, dass Sie Ihre Compute-Instanzen manuell einrichten, verwalten und aktualisieren.
Unterstützte Bereitstellungsplattformen
Nachdem Sie den empfohlenen Orchestrator und die Bereitstellungsoption für Ihren Anwendungsfall ermittelt haben, lesen Sie die Beschreibungen unten, um zu prüfen, ob die Verwaltungsstufen und Funktionen Ihren Anforderungen an die Arbeitslast entsprechen.
Verwaltete und automatisierte Plattformen
Wenn Sie den Aufwand für die Verwaltung eines Clusters vermeiden und sich stattdessen auf die Ausführung Ihrer Arbeitslasten konzentrieren möchten, verwenden Sie eine der folgenden verwalteten Plattformen:
Cluster Director: Ein vollständig verwalteter Dienst, der den Lebenszyklus von Slurm-Clustern automatisiert. Mit Cluster Director können Sie die Einrichtung und Konfiguration Ihrer Slurm-Cluster vereinfachen. Cluster Director automatisiert den Lebenszyklus Ihrer Cluster, sodass Sie sich auf die Ausführung Ihrer KI-, ML- oder HPC-Arbeitslasten konzentrieren können. Weitere Informationen finden Sie unter Cluster Director – Übersicht.
GKE: Eine verwaltete Kubernetes-Umgebung, die für KI und ML-Arbeitslasten optimiert ist. Mit GKE können Sie containerisierte Arbeitslasten orchestrieren, in spezielle Compute Engine-Hardware integrieren und GKE-spezifische Funktionen wie die topologieabhängige Planung (Topology Aware Scheduling, TAS) nutzen. Weitere Informationen finden Sie unter GKE – Übersicht.
Teilweise verwaltete und selbstverwaltete Plattformen
Wenn Sie eine detaillierte Kontrolle über das Betriebssystem, die Kernelkonfigurationen oder die Treiberversionen benötigen, verwenden Sie eine teilweise verwaltete oder selbstverwaltete Plattform:
Cluster Toolkit: Ein Open-Source-Toolkit mit validierten, anpassbaren Blueprints für die Bereitstellung reproduzierbarer KI- und ML Umgebungen. Es bietet hohe Flexibilität und Kontrolle durch Infrastructure as Code-Prinzipien (IaC). Weitere Informationen finden Sie unter Cluster Toolkit – Übersicht.
Compute Engine: Ein anpassbarer Computing-Dienst, der maximale Kontrolle bietet, um benutzerdefinierte Umgebungen von Grund auf zu erstellen. Die Compute Engine ist zwar kein eigenständiger Orchestrator, dient aber als Grundlage für Nutzer, die ihre eigenen spezialisierten benutzerdefinierten Stacks erstellen und verwalten möchten. Weitere Informationen finden Sie unter Compute Engine – Übersicht.
Nächste Schritte
- Informationen zum Abrufen von Kapazität finden Sie unter Verbrauchsoptionen.
- Informationen zum Bereitstellen Ihres Clusters finden Sie unter Cluster erstellen.