O Hipercomputador de IA é um sistema de supercomputação integrado otimizado para oferecer suporte às suas cargas de trabalho de inteligência artificial (IA) e machine learning (ML). Ele é o portfólio unificado da infraestrutura de IA do Google Cloud Google Cloude oferece um único ponto de entrada para explorar, configurar e implantar hardware otimizado para performance, software aberto e modelos de consumo flexíveis.
O Hipercomputador de IA incorpora design no nível do sistema e práticas recomendadas para aumentar a eficiência em todo o ciclo de vida do desenvolvimento de IA, desde a prototipagem e o desenvolvimento até o treinamento em grande escala e a disponibilização em tempo real.
Arquitetura do sistema
O Hipercomputador de IA integra verticalmente esses três componentes para maximizar bomput—a medida da produtividade real de machine learning:
- Infraestrutura otimizada para performance: oferece aceleradores (GPUs NVIDIA
e Google Cloud TPUs), rede e recursos de armazenamento.
- GPUs: categorizadas por como o sistema processa os eventos do ciclo de vida
e a manutenção:
- GPUs gerais: infraestrutura gerenciada como unidades de computação independentes com manutenção assíncrona.
- GPUs clusterizadas: clusters de alta performance gerenciados como um único sistema fortemente acoplado com manutenção sincronizada.
- TPUs: usam hardware projetado para realizar grandes operações de matriz e têm memória de alta largura de banda (HBM) no chip para modelos e tamanhos de lote maiores. As TPUs podem ser conectadas em grupos chamados frações que escalonar verticalmente suas cargas de trabalho com pouca ou nenhuma alteração no código. Para mais informações sobre a infraestrutura de TPU, consulte a documentação do Cloud TPUs.
- GPUs: categorizadas por como o sistema processa os eventos do ciclo de vida
e a manutenção:
- Software aberto: oferece versões otimizadas de frameworks de machine learning
(PyTorch, JAX e TensorFlow) e plataformas de orquestração. Para implantar e gerenciar seus aceleradores, escolha entre as seguintes opções:
- Google Kubernetes Engine para escalonamento automatizado nativo de contêineres
- Slurm pelo Cluster Director
- Blueprints do Cluster Toolkit
- Opções de consumo: oferece opções de provisionamento flexíveis com base nas necessidades da
carga de trabalho:
- VMs de início flexível, VMs spot e reservas: oferecem opções flexíveis para diferentes cargas de trabalho.
- Dynamic Workload Scheduler: oferece provisionamento atômico para blocos inteiros de nós interconectados para treinamento em grande escala.
Benefícios
- Alta performance e bomput: otimize o agendamento e as camadas de execução para maximizar o bomput, ajudando os aceleradores a gastar mais tempo em computação produtiva e menos tempo em sobrecarga do sistema.
- Confiabilidade integrada: acesse recursos de confiabilidade especializados:
- GPUs clusterizadas: inclui monitoramento automatizado da integridade do hardware e substituição proativa de nós.
- GPUs gerais: usa o reparo automático de Google Cloud nós padrão para manter o tempo de atividade no nível do pod para disponibilizar frotas.
- Armazenamento otimizado: use serviços de armazenamento de alta capacidade, como o Google Cloud Managed Lustre e o Cloud Storage Rapid, para eliminar gargalos de E/S.
Casos de uso
O Hipercomputador de IA atende às necessidades destes casos de uso:
| Caso de uso | Cargas de trabalho de exemplo |
|---|---|
| Cargas de trabalho de IA e ML em grande escala |
|
| Inferência e disponibilização do modelo |
|
| Prototipagem e desenvolvimento |
|
A seguir
- Saiba mais sobre a infraestrutura otimizada para performance do Hipercomputador de IA:
- Analise os modelos de consumo.
- Saiba mais sobre o gerenciamento de clusters.