AI Hypercomputer fournit une infrastructure intégrée verticalement, optimisée pour les charges de travail exigeantes d'intelligence artificielle (IA) et de machine learning (ML). Les GPU NVIDIA hautes performances sont classés en fonction de la manière dont le système gère leurs événements de cycle de vie et leur maintenance : GPU généraux et GPU en cluster.
Pour identifier la catégorie d'infrastructure optimale pour votre charge de travail, consultez Choisir votre infrastructure d'accélérateur.
GPU généraux
Les GPU généraux sont gérés en tant qu'unités de calcul indépendantes, à l'aide des API Compute Engine et Google Kubernetes Engine (GKE) standards pour s'intégrer directement au plan de contrôle de Google Cloud.
Les GPU généraux incluent les séries de machines suivantes :
- A3 High avec 1, 2 ou 4 GPU (NVIDIA H100): optimisées pour les charges de travail d'entraînement et d'inférence standards qui ne nécessitent pas de cluster synchronisé à 8 GPU.
- A3 Edge (NVIDIA H100): optimisées pour l'inférence distribuée sur plusieurs hôtes avec un débit élevé à l'aide d'un réseau VPC standard.
- A2 (NVIDIA A100): optimisées pour la mise en service hautes performances à nœud unique et le réglage fin à petite échelle.
- G4 (NVIDIA RTX PRO 6000): optimisées pour l'inférence d'entrée de gamme économique et les charges de travail graphiques.
- G2 (NVIDIA L4): optimisées pour l'inférence courante et la génération augmentée par récupération (RAG).
- N1 (NVIDIA T4 ou V100): optimisées pour les tâches d'inférence et de recherche d'entrée de gamme qui privilégient le coût aux interconnexions hautes performances.
GPU en cluster
Les GPU en cluster sont gérés en tant que système unique et étroitement couplé de milliers d'accélérateurs interconnectés à l'aide de Cluster Director.
Les GPU en cluster incluent les séries de machines suivantes :
- A4X Max (NVIDIA GB300): conçues pour l'entraînement exaflopique bare metal et le calcul hautes performances, avec des superchips NVIDIA GB300 Grace Blackwell Ultra.
- A4X (NVIDIA GB200) et A4 (NVIDIA B200) : conçues pour l'entraînement de modèles de fondation et l'entraînement de modèles de fondation exaflopiques.
- A3 Ultra (NVIDIA H200), A3 Mega (NVIDIA H100) et A3 High avec 8 GPU (NVIDIA H100) : optimisées pour l'entraînement distribué à grande échelle et l'inférence multihôte impliquant des tables de données volumineuses.
Considérations sur les performances des GPU
Pour évaluer et optimiser les performances de votre charge de travail, vous pouvez suivre les métriques au niveau matériel, telles que l'utilisation des cœurs CUDA et des Tensor Cores. Pour surveiller vos ressources et évaluer les performances dans les environnements généraux et en cluster, consultez les ressources suivantes :
- Tableaux de bord de surveillance : suivez l'utilisation du GPU et de la mémoire en temps réel pour des instances autonomes individuelles ou des flottes de clusters orchestrées.
- Recettes de métriques de débit utile: mesurez le pourcentage de temps pendant lequel vos accélérateurs effectuent des calculs utiles par rapport à la surcharge du système. Cette mesure est fortement recommandée pour l'entraînement distribué à grande échelle sur du matériel en cluster.
Étape suivante
- Pour évaluer les exigences de votre infrastructure, consultez Choisir votre infrastructure d'accélérateur.
- Pour examiner le processus et les choix à faire lorsque vous démarrez un cluster, consultez Planifier et créer votre infrastructure d'IA.