용어

AI 하이퍼컴퓨터에는 다음 약관이 적용됩니다.

가속기
머신러닝 워크로드와 같은 특정 작업을 범용 프로세서보다 더 효율적으로 실행하도록 설계된 GPU 또는 TPU와 같은 특수 하드웨어 기기

차단
블록의 모든 호스트 머신에 고대역폭을 제공하는 비차단 고속 네트워크로 상호 연결된 하위 블록 모음입니다.

클러스터
고속 네트워크 패브릭으로 상호 연결된 블록 모음입니다. 각 클러스터는 전역적으로 고유합니다. A4X, A4, A3 Ultra, A3 Mega, A3 High (8 GPU) 머신의 경우 클러스터는 가속기 용량 블록에 공통의 비차단 네트워크 패브릭을 제공합니다. 클러스터 내에서 노드 간 통신 (east-west 트래픽)은 전체 블록 모음에 대해 차단되지 않습니다.

클러스터링된 GPU
A4X, A4, A3 Ultra, A3 Mega, A3 High (GPU 8개)를 비롯한 GPU용 머신 제품군 카테고리입니다. 클러스터링된 GPU를 사용하면 팀에서 특수 네트워킹 패브릭과 동기화된 유지보수를 사용하여 상호 연결된 수천 개의 가속기를 긴밀하게 결합된 단일 시스템으로 배포하고 확장할 수 있습니다. 익스트림 컴퓨팅, 메모리, 고속 네트워킹 동기화가 필요한 워크로드에 적합합니다. 일반적인 사용 사례로는 수조 개의 매개변수가 있는 기본 모델 사전 학습, 최첨단 모델 서빙, 신약 개발 시뮬레이션이 있습니다.

긴급 유지보수
긴급 유지보수라고도 합니다. 심각한 하드웨어, 소프트웨어 또는 보안 문제로 인해 발생한 계획되지 않은 유지관리 이벤트입니다. 지원되는 가속기 머신 유형의 경우 긴급 유지보수로 인해 즉시 중단되는 대신 사전 알림이 제공됩니다. 이 알림을 통해 시스템에서 VM을 종료하기 전에 워크로드를 정상적으로 드레인하고 원하는 경우 복구를 트리거할 수 있습니다.

일반 GPU
G2, G4, A2, N1+T4, A3 Edge를 포함한 GPU 머신 계열 카테고리입니다. 일반 GPU를 사용하면 팀에서 완전한 운영 자율성을 가지고 NVIDIA 액셀러레이터를 배포하고 확장하여 조정된 슈퍼컴퓨팅 클러스터의 아키텍처 복잡성을 우회할 수 있습니다. 고가용성, 셀프 서비스 프로비저닝, 독립적인 확장성을 우선시하는 워크로드에 적합합니다. 일반적인 사용 사례에는 실시간 추론, RAG, 프로토타입 제작, 중소 규모 모델 학습이 있습니다.

네트워크 패브릭
클러스터의 모든 블록과 Google Cloud 서비스에 걸쳐 고대역폭과 짧은 지연 시간을 제공하는 고속 네트워크 인프라입니다. 패브릭은 Jupiter 네트워크의 아키텍처를 사용합니다. 성능을 최적화하기 위해 패브릭은 소프트웨어 정의 네트워크와 광 스위치를 사용합니다.

노드 또는 호스트
데이터 센터의 단일 실제 서버 머신입니다. 각 호스트에는 액셀러레이터와 같은 연결된 컴퓨팅 리소스가 있습니다. 이러한 컴퓨팅 리소스의 수와 구성은 머신 계열에 따라 다릅니다. Compute Engine 인스턴스는 실제 호스트 위에 프로비저닝됩니다.

NVLink 도메인(하위 블록이라고도 함)은 A4X Max 및 A4X 머신의 핵심 용량 단위입니다. NVLink 도메인은 다중 노드 NVLink 시스템으로 연결된 18개의 A4X Max 또는 A4X 인스턴스 (72개의 GPU)로 구성됩니다.

하위 블록
단일 물리적 블록에 있는 호스트 그룹과 연결된 연결 하드웨어입니다. A4X Max 및 A4X 머신과 관련하여 하위 블록을 NVLink 도메인이라고도 합니다.

슈퍼 블록
데이터 센터 내에서 상호 연결된 머신의 물리적 그룹입니다. 슈퍼블록 내에 머신을 배치하면 긴밀하게 결합된 학습 워크로드를 실행하는 데 필요한 극도의 네트워크 처리량과 1밀리초 미만의 지연 시간을 달성할 수 있습니다.

추가 정보

다음 문서에서는 해당 주제와 관련된 용어에 대한 자세한 설명을 제공합니다.