

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Problemi di distribuzione del modello
<a name="sagemaker-hyperpod-model-deployment-ts-deployment-issues"></a>

**Panoramica: ** questa sezione tratta i problemi più comuni che si verificano durante l'implementazione del modello, inclusi gli stati in sospeso, le distribuzioni non riuscite e il monitoraggio dell'avanzamento della distribuzione.

## La distribuzione del modello è bloccata in stato di sospeso
<a name="sagemaker-hyperpod-model-deployment-ts-pending"></a>

Quando si implementa un modello, l'implementazione rimane nello stato «In sospeso» per un periodo prolungato. Ciò indica che l'operatore di inferenza non è in grado di avviare la distribuzione del modello nel cluster. HyperPod 

**Componenti interessati: **

Durante la normale distribuzione, l'operatore di inferenza dovrebbe:
+ Implementare il pod modello
+ Creazione di un sistema di bilanciamento del carico
+ Crea un SageMaker endpoint AI

**Passaggi per la risoluzione dei problemi: **

1. Controlla lo stato del pod dell'operatore di inferenza:

   ```
   kubectl get pods -n hyperpod-inference-system
   ```

   Esempio di output previsto:

   ```
   NAME                                                           READY   STATUS    RESTARTS   AGE
   hyperpod-inference-operator-controller-manager-65c49967f5-894fg   1/1     Running   0         6d13h
   ```

1. Esamina i registri degli operatori di inferenza ed esamina i registri degli operatori per i messaggi di errore:

   ```
   kubectl logs hyperpod-inference-operator-controller-manager-5b5cdd7757-txq8f -n hyperpod-inference-operator-system
   ```

**Cosa cercare: **
+ Messaggi di errore nei log degli operatori
+ Stato del pod operatore
+ Eventuali avvisi o guasti relativi all'installazione

**Nota**  
Un'implementazione corretta dovrebbe superare lo stato «In sospeso» entro un tempo ragionevole. Se i problemi persistono, esamina i registri degli operatori di inferenza per individuare messaggi di errore specifici per determinare la causa principale.

## Risoluzione dei problemi relativi alla distribuzione del modello non riuscita
<a name="sagemaker-hyperpod-model-deployment-ts-failed"></a>

Quando la distribuzione di un modello entra in uno stato «Non riuscito», l'errore può verificarsi in uno dei tre componenti:
+ Distribuzione del pod del modello
+ Creazione del load balancer
+ SageMaker Creazione di endpoint AI

**Passaggi per la risoluzione dei problemi: **

1. Controlla lo stato dell'operatore di inferenza:

   ```
   kubectl get pods -n hyperpod-inference-system
   ```

   Output previsto:

   ```
   NAME                                                           READY   STATUS    RESTARTS   AGE
   hyperpod-inference-operator-controller-manager-65c49967f5-894fg   1/1     Running   0         6d13h
   ```

1. Rivedi i log degli operatori:

   ```
   kubectl logs hyperpod-inference-operator-controller-manager-5b5cdd7757-txq8f -n hyperpod-inference-operator-system
   ```

**Cosa cercare: **

I log degli operatori indicheranno quale componente ha avuto esito negativo:
+ Errori di distribuzione del Model Pod
+ Problemi di creazione del load balancer
+ SageMaker Errori degli endpoint AI

## Verifica dell'avanzamento dell'implementazione del modello
<a name="sagemaker-hyperpod-model-deployment-ts-progress"></a>

Per monitorare l'avanzamento della distribuzione del modello e identificare potenziali problemi, puoi usare i comandi kubectl per controllare lo stato dei vari componenti. Ciò consente di determinare se l'implementazione procede normalmente o ha riscontrato problemi durante le fasi di creazione del pod del modello, della configurazione del load balancer o della configurazione degli endpoint AI. SageMaker 

**Metodo 1: verifica lo stato del modello JumpStart **

```
kubectl describe jumpstartmodel.inference.sagemaker.aws.amazon.com/<model-name> -n <namespace>
```

**Indicatori di stato chiave da monitorare: **

1. Stato dell'implementazione
   + Cerca`Status.State`: Dovrebbe mostrare `DeploymentComplete`
   + Controlla `Status.Deployment Status.Available Replicas`
   + Monitora `Status.Conditions` l'avanzamento dell'implementazione

1. SageMaker Stato degli endpoint AI
   + Verifica`Status.Endpoints.Sagemaker.State`: dovrebbe mostrare `CreationCompleted`
   + Verifica `Status.Endpoints.Sagemaker.Endpoint Arn`

1. Stato del certificato TLS
   + Visualizza dettagli `Status.Tls Certificate`
   + Controlla la scadenza del certificato in `Last Cert Expiry Time`

**Metodo 2: verifica la configurazione dell'endpoint di inferenza **

```
kubectl describe inferenceendpointconfig.inference.sagemaker.aws.amazon.com/<deployment_name> -n <namespace>
```

**Stati di stato comuni: **
+ `DeploymentInProgress`: Fase iniziale di distribuzione
+ `DeploymentComplete`: Implementazione riuscita
+ `Failed`: Distribuzione non riuscita

**Nota**  
Monitora la sezione Eventi per eventuali avvisi o errori. Verifica che il conteggio delle repliche corrisponda alla configurazione prevista. Verifica che siano presenti tutte le condizioni `Status: True` per una distribuzione corretta.