Problemi di distribuzione del modello - Amazon SageMaker AI

View a markdown version of this page

Problemi di distribuzione del modello - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Problemi di distribuzione del modello

Panoramica: questa sezione tratta i problemi più comuni che si verificano durante l'implementazione del modello, inclusi gli stati in sospeso, le distribuzioni non riuscite e il monitoraggio dell'avanzamento della distribuzione.

La distribuzione del modello è bloccata in stato di sospeso

Quando si implementa un modello, l'implementazione rimane nello stato «In sospeso» per un periodo prolungato. Ciò indica che l'operatore di inferenza non è in grado di avviare la distribuzione del modello nel cluster. HyperPod

Componenti interessati:

Durante la normale distribuzione, l'operatore di inferenza dovrebbe:

  • Implementare il pod modello

  • Creazione di un sistema di bilanciamento del carico

  • Crea un SageMaker endpoint AI

Passaggi per la risoluzione dei problemi:

  1. Controlla lo stato del pod dell'operatore di inferenza:

    kubectl get pods -n hyperpod-inference-system

    Esempio di output previsto:

    NAME READY STATUS RESTARTS AGE hyperpod-inference-operator-controller-manager-65c49967f5-894fg 1/1 Running 0 6d13h
  2. Esamina i registri degli operatori di inferenza ed esamina i registri degli operatori per i messaggi di errore:

    kubectl logs hyperpod-inference-operator-controller-manager-5b5cdd7757-txq8f -n hyperpod-inference-operator-system

Cosa cercare:

  • Messaggi di errore nei log degli operatori

  • Stato del pod operatore

  • Eventuali avvisi o guasti relativi all'installazione

Nota

Un'implementazione corretta dovrebbe superare lo stato «In sospeso» entro un tempo ragionevole. Se i problemi persistono, esamina i registri degli operatori di inferenza per individuare messaggi di errore specifici per determinare la causa principale.

Risoluzione dei problemi relativi alla distribuzione del modello non riuscita

Quando la distribuzione di un modello entra in uno stato «Non riuscito», l'errore può verificarsi in uno dei tre componenti:

  • Distribuzione del pod del modello

  • Creazione del load balancer

  • SageMaker Creazione di endpoint AI

Passaggi per la risoluzione dei problemi:

  1. Controlla lo stato dell'operatore di inferenza:

    kubectl get pods -n hyperpod-inference-system

    Output previsto:

    NAME READY STATUS RESTARTS AGE hyperpod-inference-operator-controller-manager-65c49967f5-894fg 1/1 Running 0 6d13h
  2. Rivedi i log degli operatori:

    kubectl logs hyperpod-inference-operator-controller-manager-5b5cdd7757-txq8f -n hyperpod-inference-operator-system

Cosa cercare:

I log degli operatori indicheranno quale componente ha avuto esito negativo:

  • Errori di distribuzione del Model Pod

  • Problemi di creazione del load balancer

  • SageMaker Errori degli endpoint AI

Verifica dell'avanzamento dell'implementazione del modello

Per monitorare l'avanzamento della distribuzione del modello e identificare potenziali problemi, puoi usare i comandi kubectl per controllare lo stato dei vari componenti. Ciò consente di determinare se l'implementazione procede normalmente o ha riscontrato problemi durante le fasi di creazione del pod del modello, della configurazione del load balancer o della configurazione degli endpoint AI. SageMaker

Metodo 1: verifica lo stato del modello JumpStart

kubectl describe jumpstartmodel.inference.sagemaker.aws.amazon.com/<model-name> -n <namespace>

Indicatori di stato chiave da monitorare:

  1. Stato dell'implementazione

    • CercaStatus.State: Dovrebbe mostrare DeploymentComplete

    • Controlla Status.Deployment Status.Available Replicas

    • Monitora Status.Conditions l'avanzamento dell'implementazione

  2. SageMaker Stato degli endpoint AI

    • VerificaStatus.Endpoints.Sagemaker.State: dovrebbe mostrare CreationCompleted

    • Verifica Status.Endpoints.Sagemaker.Endpoint Arn

  3. Stato del certificato TLS

    • Visualizza dettagli Status.Tls Certificate

    • Controlla la scadenza del certificato in Last Cert Expiry Time

Metodo 2: verifica la configurazione dell'endpoint di inferenza

kubectl describe inferenceendpointconfig.inference.sagemaker.aws.amazon.com/<deployment_name> -n <namespace>

Stati di stato comuni:

  • DeploymentInProgress: Fase iniziale di distribuzione

  • DeploymentComplete: Implementazione riuscita

  • Failed: Distribuzione non riuscita

Nota

Monitora la sezione Eventi per eventuali avvisi o errori. Verifica che il conteggio delle repliche corrisponda alla configurazione prevista. Verifica che siano presenti tutte le condizioni Status: True per una distribuzione corretta.