

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Orchestrazione dei cluster con Amazon EKS SageMaker HyperPod
<a name="sagemaker-hyperpod-eks"></a>

SageMaker HyperPod è un SageMaker AI-managed servizio che consente la formazione su larga scala dei modelli di base su cluster di calcolo resilienti e di lunga durata, integrandosi con Amazon EKS per orchestrare le risorse di calcolo. HyperPod Puoi eseguire processi di formazione ininterrotti della durata di settimane o mesi su larga scala utilizzando i cluster Amazon EKS con HyperPod funzionalità di resilienza che controllano la presenza di vari guasti hardware e ripristinano automaticamente i nodi difettosi. 

Le funzionalità principali per gli utenti amministratori del cluster includono quanto segue.
+ Eseguire il provisioning di cluster resilienti HyperPod e collegarli a un piano di controllo EKS
+ Abilitazione della gestione dinamica della capacità, come l’aggiunta di altri nodi, l’aggiornamento del software e l’eliminazione dei cluster
+ Abilitazione dell'accesso alle istanze del cluster direttamente tramite o `kubectl` SSM/SSH
+ Offre funzionalità di [ resilienza](sagemaker-hyperpod-eks-resiliency.md), tra cui controlli sanitari di base, controlli sanitari approfonditi, un agente di monitoraggio dello stato e supporto per la ripresa automatica del lavoro PyTorch 
+ Integrazione con strumenti di osservabilità come [ Amazon CloudWatch Container Insights](https://docs.aws.amazon.com/AmazonCloudWatch/latest/monitoring/ContainerInsights.html), Amazon Managed Service for Prometheus e [ Amazon Managed Grafana ](https://docs.aws.amazon.com/prometheus/latest/userguide/what-is-Amazon-Managed-Service-Prometheus.html) [https://docs.aws.amazon.com/grafana/latest/userguide/what-is-Amazon-Managed-Service-Grafana.html](https://docs.aws.amazon.com/grafana/latest/userguide/what-is-Amazon-Managed-Service-Grafana.html)

Per gli utenti di data scientist, il supporto EKS in consente quanto segue. HyperPod 
+ Esecuzione di carichi di lavoro containerizzati per l'addestramento dei modelli di base sul cluster HyperPod 
+ Esecuzione dell'inferenza sul cluster EKS, sfruttando l'integrazione tra ed EKS HyperPod 
+ Sfruttamento della funzionalità di ripresa automatica del lavoro per [ la formazione Kubeflow () PyTorch PyTorchJob ](https://www.kubeflow.org/docs/components/training/user-guides/pytorch/)

**Nota**  
Amazon EKS consente l'orchestrazione gestita dagli utenti di attività e infrastruttura tramite Amazon EKS Control Plane. SageMaker HyperPod Assicurati che l'accesso degli utenti al cluster tramite l'endpoint Kubernetes API Server segua il principio del privilegio minimo e che l'uscita di rete dal cluster sia protetta. HyperPod   
Per ulteriori informazioni sulla protezione dell’accesso al server API Amazon EKS, consulta [Control network access to cluster API server endpoint](https://docs.aws.amazon.com/eks/latest/userguide/cluster-endpoint.html).  
Per saperne di più sulla protezione dell'accesso alla rete, consulta. HyperPod [Configurazione SageMaker HyperPod con un Amazon VPC personalizzato](sagemaker-hyperpod-prerequisites.md#sagemaker-hyperpod-prerequisites-optional-vpc)

L'architettura di alto livello del supporto di Amazon EKS in HyperPod prevede una mappatura 1 a 1 tra un cluster EKS (piano di controllo) e un HyperPod cluster (nodi di lavoro) all'interno di un VPC, come mostrato nel diagramma seguente.

![Piano di controllo EKS connesso ai HyperPod cluster nodi tramite ENI tra account all'interno di VPC.](https://docs.aws.amazon.com/it_it/sagemaker/latest/dg/images/hyperpod-eks-diagram.png)
