Ringkasan AI Hypercomputer

AI Hypercomputer adalah sistem superkomputer terintegrasi yang dioptimalkan untuk mendukung workload kecerdasan buatan (AI) dan machine learning (ML) Anda. Sistem ini adalah portofolio terpadu untuk Google Cloudinfrastruktur AI, dan menyediakan satu titik entri untuk menjelajahi, mengonfigurasi, dan men-deploy hardware yang dioptimalkan untuk performa, software terbuka, dan model konsumsi yang fleksibel.

AI Hypercomputer menggabungkan desain tingkat sistem dan praktik terbaik untuk meningkatkan efisiensi di seluruh siklus proses pengembangan AI—mulai dari pembuatan prototipe dan pengembangan hingga pelatihan skala besar dan penayangan real-time.

Arsitektur sistem

AI Hypercomputer mengintegrasikan ketiga komponen ini secara vertikal untuk memaksimalkan goodput—ukuran produktivitas machine learning yang sebenarnya:

  • Infrastruktur yang dioptimalkan untuk performa: menyediakan akselerator (GPU NVIDIA dan Google Cloud TPU), jaringan, dan resource penyimpanan.
    • GPU: dikategorikan berdasarkan cara sistem menangani peristiwa siklus proses dan pemeliharaannya:
      • GPU Umum: infrastruktur yang dikelola sebagai unit komputasi independen dengan pemeliharaan asinkron.
      • GPU yang Dikelompokkan: cluster berperforma tinggi yang dikelola sebagai satu sistem yang terhubung erat dengan pemeliharaan yang disinkronkan.
    • TPU: menggunakan hardware yang dirancang untuk melakukan operasi matriks besar dan memiliki memori bandwidth tinggi (HBM) on-chip untuk model dan ukuran batch yang lebih besar. TPU dapat terhubung dalam grup yang disebut slice yang menskalakan workload Anda dengan sedikit atau tanpa perubahan kode. Untuk mengetahui informasi tentang infrastruktur TPU, lihat dokumentasi Cloud TPU.
  • Software terbuka: menawarkan versi framework machine learning (PyTorch, JAX, dan TensorFlow) dan platform orkestrasi yang dioptimalkan. Untuk men-deploy dan mengelola akselerator, Anda dapat memilih dari opsi berikut:
    • Google Kubernetes Engine untuk penskalaan otomatis native container
    • Slurm melalui Cluster Director
    • Blueprint Cluster Toolkit
  • Opsi konsumsi: menawarkan opsi penyediaan yang fleksibel berdasarkan kebutuhan workload Anda:
    • VM Flex-start, VM Spot, dan Reservasi: memberikan opsi fleksibel untuk workload yang berbeda.
    • Dynamic Workload Scheduler: menyediakan penyediaan atomik untuk seluruh blok node yang saling terhubung untuk pelatihan skala besar.

Manfaat

  • Performa dan goodput tinggi: mengoptimalkan lapisan runtime dan penjadwalan untuk memaksimalkan goodput, sehingga membantu akselerator menghabiskan lebih banyak waktu untuk komputasi produktif dan lebih sedikit waktu untuk overhead sistem.
  • Keandalan terintegrasi: mendapatkan akses ke fitur keandalan khusus:
    • GPU yang Dikelompokkan: mencakup pemantauan kesehatan hardware otomatis dan penggantian node proaktif.
    • GPU Umum: menggunakan perbaikan otomatis Google Cloud node standar untuk mempertahankan waktu aktif tingkat pod untuk fleet penayangan.
  • Penyimpanan yang dioptimalkan: menggunakan layanan penyimpanan dengan throughput tinggi, seperti Google Cloud Managed Lustre dan Cloud Storage Rapid, untuk menghilangkan bottleneck I/O.

Kasus penggunaan

AI Hypercomputer memenuhi kebutuhan kasus penggunaan berikut:

Kasus penggunaan Contoh workload
Workload AI dan ML skala besar
  • Pelatihan terdistribusi untuk AI generatif
  • Inferensi untuk AI generatif
  • Deteksi penipuan
  • Model rekomendasi
Inferensi dan penayangan model
  • Deteksi penipuan secara real time
  • Mesin rekomendasi untuk hasil secara real time
Pembuatan prototipe dan pengembangan
  • Eksperimen skala kecil
  • Pengembangan tahap awal

Langkah berikutnya