Terminologie

Les conditions suivantes s'appliquent à l'IA Hypercomputer.

Accélérateur
Appareil matériel spécialisé, tel qu'un GPU ou un TPU, conçu pour effectuer des tâches spécifiques, telles que des charges de travail de machine learning, plus efficacement qu'un processeur à usage général.

Bloc
Ensemble de sous-blocs interconnectés par un réseau haut débit non bloquant qui fournit une bande passante élevée à toutes les machines hôtes du bloc.

Cluster
Ensemble de blocs interconnectés par une structure de réseau haut débit. Chaque cluster est unique au niveau mondial. Pour les machines A4X, A4, A3 Ultra, A3 Mega et A3 High (8 GPU), un cluster fournit une structure de réseau commune et non bloquante pour vos blocs de capacité d'accélérateur. Dans un cluster, la communication entre les nœuds (trafic est-ouest ) n'est pas bloquante pour l'ensemble des blocs.

GPU en cluster
Catégorie de familles de machines pour les GPU, y compris A4X, A4, A3 Ultra, A3 Mega et A3 High (8 GPU). Les GPU en cluster permettent aux équipes de déployer et de mettre à l'échelle des milliers d'accélérateurs interconnectés en tant que système unique et étroitement couplé à l'aide de structures de mise en réseau spécialisées et d'une maintenance synchronisée. Ils sont idéaux pour les charges de travail qui nécessitent une synchronisation extrême du calcul, de la mémoire et de la mise en réseau à haut débit. Les cas d'utilisation courants incluent le pré-entraînement de modèles de fondation avec des milliers de milliards de paramètres, la mise en service de modèles de pointe et des simulations pour la découverte de médicaments.

Maintenance d'urgence
Parfois appelée maintenance d'urgence. Événement de maintenance non planifié causé par un problème matériel, logiciel ou de sécurité critique. Pour les types de machines d'accélérateur compatibles, la maintenance d'urgence fournit une notification anticipée au lieu d'une interruption immédiate. Cette notification vous donne le temps de vider vos charges de travail et, si vous le souhaitez, de déclencher la réparation avant que le système ne mette fin aux VM.

GPU à usage général
Catégorie de familles de machines GPU, y compris G2, G4, A2, N1+T4 et A3 Edge. Les GPU à usage général permettent aux équipes de déployer et de mettre à l'échelle des accélérateurs NVIDIA en toute autonomie opérationnelle, en contournant la complexité architecturale des clusters de supercalcul coordonnés. Ils sont idéaux pour les charges de travail qui privilégient la haute disponibilité, le provisionnement en libre-service et le scaling indépendant. Les cas d'utilisation courants incluent l'inférence en temps réel, la RAG, le prototypage et l'entraînement de modèles de petite à moyenne taille.

Structure de réseau
Infrastructure réseau haut débit qui fournit une bande passante élevée et une faible latence sur tous les blocs et Google Cloud services d'un cluster. La structure utilise l'architecture du Jupiter Jupiter. Pour optimiser les performances, la structure utilise un réseau défini par logiciel et des commutateurs optiques.

Nœud ou hôtelink
Machine serveur physique unique dans le centre de données. Chaque hôte est associé à des ressources de calcul, telles que des accélérateurs. Le nombre et la configuration de ces ressources de calcul dépendent de la famille de machines. Les instances Compute Engine sont provisionnées sur un hôte physique.

Un domaine NVLink, également appelé sous-bloc, est l'unité de capacité de base pour les machines A4X Max et A4X. Un domaine NVLink se compose de 18 instances A4X Max ou A4X (72 GPU) connectées par un système NVLink à plusieurs nœuds.

Sous-bloc
Groupe d'hôtes et de matériel de connectivité associé qui se trouvent sur un seul bloc physique. Dans le contexte des machines A4X Max et A4X, un sous-bloc est également appelé domaine NVLink.

Superbloc
Regroupement physique de machines interconnectées dans des centres de données. En plaçant des machines dans un superbloc, vous obtenez le débit réseau extrême et la latence inférieure à une milliseconde nécessaires pour exécuter des charges de travail d'entraînement étroitement couplées.

En savoir plus

Les documents suivants fournissent des explications supplémentaires sur les terminologies pertinentes pour les sujets correspondants :