Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Problemi di distribuzione del modello
Panoramica: questa sezione tratta i problemi più comuni che si verificano durante l'implementazione del modello, inclusi gli stati in sospeso, le distribuzioni non riuscite e il monitoraggio dell'avanzamento della distribuzione.
La distribuzione del modello è bloccata in stato di sospeso
Quando si implementa un modello, l'implementazione rimane nello stato «In sospeso» per un periodo prolungato. Ciò indica che l'operatore di inferenza non è in grado di avviare la distribuzione del modello nel cluster. HyperPod
Componenti interessati:
Durante la normale distribuzione, l'operatore di inferenza dovrebbe:
-
Implementare il pod modello
-
Creazione di un sistema di bilanciamento del carico
-
Crea un SageMaker endpoint AI
Passaggi per la risoluzione dei problemi:
-
Controlla lo stato del pod dell'operatore di inferenza:
kubectl get pods -n hyperpod-inference-systemEsempio di output previsto:
NAME READY STATUS RESTARTS AGE hyperpod-inference-operator-controller-manager-65c49967f5-894fg 1/1 Running 0 6d13h -
Esamina i registri degli operatori di inferenza ed esamina i registri degli operatori per i messaggi di errore:
kubectl logs hyperpod-inference-operator-controller-manager-5b5cdd7757-txq8f -n hyperpod-inference-operator-system
Cosa cercare:
-
Messaggi di errore nei log degli operatori
-
Stato del pod operatore
-
Eventuali avvisi o guasti relativi all'installazione
Nota
Un'implementazione corretta dovrebbe superare lo stato «In sospeso» entro un tempo ragionevole. Se i problemi persistono, esamina i registri degli operatori di inferenza per individuare messaggi di errore specifici per determinare la causa principale.
Risoluzione dei problemi relativi alla distribuzione del modello non riuscita
Quando la distribuzione di un modello entra in uno stato «Non riuscito», l'errore può verificarsi in uno dei tre componenti:
-
Distribuzione del pod del modello
-
Creazione del load balancer
-
SageMaker Creazione di endpoint AI
Passaggi per la risoluzione dei problemi:
-
Controlla lo stato dell'operatore di inferenza:
kubectl get pods -n hyperpod-inference-systemOutput previsto:
NAME READY STATUS RESTARTS AGE hyperpod-inference-operator-controller-manager-65c49967f5-894fg 1/1 Running 0 6d13h -
Rivedi i log degli operatori:
kubectl logs hyperpod-inference-operator-controller-manager-5b5cdd7757-txq8f -n hyperpod-inference-operator-system
Cosa cercare:
I log degli operatori indicheranno quale componente ha avuto esito negativo:
-
Errori di distribuzione del Model Pod
-
Problemi di creazione del load balancer
-
SageMaker Errori degli endpoint AI
Verifica dell'avanzamento dell'implementazione del modello
Per monitorare l'avanzamento della distribuzione del modello e identificare potenziali problemi, puoi usare i comandi kubectl per controllare lo stato dei vari componenti. Ciò consente di determinare se l'implementazione procede normalmente o ha riscontrato problemi durante le fasi di creazione del pod del modello, della configurazione del load balancer o della configurazione degli endpoint AI. SageMaker
Metodo 1: verifica lo stato del modello JumpStart
kubectl describe jumpstartmodel.inference.sagemaker.aws.amazon.com/<model-name> -n <namespace>
Indicatori di stato chiave da monitorare:
-
Stato dell'implementazione
-
Cerca
Status.State: Dovrebbe mostrareDeploymentComplete -
Controlla
Status.Deployment Status.Available Replicas -
Monitora
Status.Conditionsl'avanzamento dell'implementazione
-
-
SageMaker Stato degli endpoint AI
-
Verifica
Status.Endpoints.Sagemaker.State: dovrebbe mostrareCreationCompleted -
Verifica
Status.Endpoints.Sagemaker.Endpoint Arn
-
-
Stato del certificato TLS
-
Visualizza dettagli
Status.Tls Certificate -
Controlla la scadenza del certificato in
Last Cert Expiry Time
-
Metodo 2: verifica la configurazione dell'endpoint di inferenza
kubectl describe inferenceendpointconfig.inference.sagemaker.aws.amazon.com/<deployment_name> -n <namespace>
Stati di stato comuni:
-
DeploymentInProgress: Fase iniziale di distribuzione -
DeploymentComplete: Implementazione riuscita -
Failed: Distribuzione non riuscita
Nota
Monitora la sezione Eventi per eventuali avvisi o errori. Verifica che il conteggio delle repliche corrisponda alla configurazione prevista. Verifica che siano presenti tutte le condizioni Status:
True per una distribuzione corretta.