

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Modification de la disponibilité du débogueur
<a name="debugger-availability-change"></a>

**Note**  
Amazon SageMaker Debugger n'est plus ouvert aux nouveaux clients. Les clients existants peuvent continuer à utiliser le service normalement. AWS continue d'investir dans l'amélioration de la sécurité et de la disponibilité de Debugger, mais nous ne prévoyons pas d'introduire de nouvelles fonctionnalités.

## Remplacement d'Amazon SageMaker Debugger
<a name="debugger-replacing"></a>

Suivez ce guide pour passer à des services alternatifs.

## Présentation de
<a name="debugger-migration-overview"></a>

Amazon SageMaker Debugger a fourni une formation sur l'observabilité, le débogage des modèles et le profilage du système en tant que fonctionnalité intégrée. SageMaker Ces fonctionnalités sont désormais mieux exploitées par la combinaison d'Amazon SageMaker AI MLflow, TensorBoard on SageMaker, et d'Amazon CloudWatch pour la formation à l'observabilité, le débogage des modèles et la surveillance des performances du système. Ces outils fournissent des fonctionnalités flexibles qui s'adaptent à votre flux de travail de formation spécifique, qu'il s'agisse de peaufiner des modèles de base, de former des architectures personnalisées ou d'exécuter des charges de travail distribuées.

## Cartographie des capacités
<a name="debugger-capability-mapping"></a>


| Capacité de débogage | Remplacé par | Ce qu'il fournit | 
| --- | --- | --- | 
| Enregistrement des métriques de formation | Débit ML/ TensorBoard | Enregistrez, visualisez et comparez les indicateurs des différentes sessions d'entraînement | 
| Suivi des modèles et des paramètres | MLflow | Suivez les hyperparamètres, les versions de modèles et les artefacts avec une reproductibilité totale | 
| Analyse du gradient, de l'activation et du poids | TensorBoard | Plug-ins d'histogramme et de distribution pour inspecter les composants internes du modèle au cours des étapes de formation | 
| Profilage des ressources du système (CPU, GPU, mémoire, disque) | Amazon CloudWatch | Real-time mesures d'utilisation avec tableaux de bord configurables | 
| Diagnostics d'entraînement automatisés | Amazon CloudWatch Alarmes \+ MLflow | Surveillez toutes les métriques enregistrées, telles que la convergence des pertes, les normes de gradient, l'utilisation des ressources et alertez en cas de dépassement des seuils. La comparaison des exécutions MLflow identifie les régressions entre les expériences | 

## Étape 1 : Suppression de la configuration du débogueur
<a name="debugger-step1-remove"></a>

### Supprimer DebuggerHookConfig de votre estimateur
<a name="debugger-remove-hook-config"></a>

Si votre script d'entraînement ou votre SageMaker estimateur inclut`DebuggerHookConfig`, ou des `rules` configurations Debugger-specific `TensorBoardOutputConfig`, supprimez-les. Cela désactive la capture automatique des tenseurs et l'évaluation des règles.

**Note**  
Si vous utilisez la `Estimator` classe SageMaker Python SDK v2, envisagez également de passer aux nouvelles API de formation du SDK [ SageMaker Python ](https://docs.aws.amazon.com/sagemaker/latest/dg/train-model.html) ou d'`CreateTrainingJob`appeler directement Boto3, car les estimateurs sont une construction héritée.

### Supprimer la sortie du débogueur dans Amazon S3
<a name="debugger-delete-s3-output"></a>

Le débogueur a stocké les données du tenseur et la sortie de profilage dans S3 sous des chemins tels que :

```
s3://<bucket>/<training-job-name>/debug-output/
s3://<bucket>/<training-job-name>/profiler-output/
```

Supprimez ces préfixes si vous n'avez plus besoin des données historiques. Vos journaux de tâches de formation et vos artefacts de modèle dans S3 restent inchangés.

### Supprimer les règles de débogage personnalisées (si elles sont utilisées)
<a name="debugger-delete-custom-rules"></a>

Si vous avez défini des conteneurs de règles personnalisés :
+ Supprimer les images Amazon ECR utilisées pour l'évaluation personnalisée des règles de débogage
+ Supprimer les scripts de définition de règles ou les configurations JSON qui ne sont plus nécessaires

### Supprimer des groupes de CloudWatch journaux (facultatif)
<a name="debugger-delete-cloudwatch-logs"></a>

Le débogueur a créé des groupes de journaux `/aws/sagemaker/TrainingJobs` pour l'évaluation des règles. Supprimez-les si vous n'en avez plus besoin pour réduire les coûts de stockage des journaux.

### Passez en revue les politiques IAM
<a name="debugger-review-iam"></a>

Supprimez les politiques IAM qui accordaient un accès spécifique à l'utilisation du débogueur :
+ `s3:GetObject`/limité `s3:PutObject` aux chemins de sortie du débogueur
+ `logs:PutLogEvents`pour les groupes de Debugger-specific journaux
+ Autorisations pour l'exécution du conteneur de règles du débogueur

Conservez toutes les politiques encore nécessaires pour vos tâches de formation, MLflow ou CloudWatch.

## Étape 2 : Configuration des remplacements
<a name="debugger-step2-configure"></a>

### Intégrez MLflow pour le suivi des expériences
<a name="debugger-integrate-mlflow"></a>

Amazon SageMaker AI propose une fonctionnalité MLflow sans serveur qui évolue de manière dynamique pour prendre en charge les tâches de développement de modèles d'IA sans frais supplémentaires. Consultez le blog [ de lancement](https://aws.amazon.com/blogs/aws/accelerate-ai-development-using-amazon-sagemaker-ai-with-serverless-mlflow/).

Utilisez MLflow pour :
+ Enregistrez les hyperparamètres, les mesures d'entraînement et les artefacts du modèle
+ Comparez les essais côte à côte pour identifier les régressions ou les améliorations
+ Suivez les versions des modèles et leur traçabilité, de l'expérience à la production

**Pour commencer : des expériences d'apprentissage ** [ automatique utilisant Amazon SageMaker AI avec MLflow ](https://docs.aws.amazon.com/sagemaker/latest/dg/mlflow-track-experiments.html) couvrent la configuration, la création d'un serveur de suivi et l'intégration à votre code de formation.

### À utiliser TensorBoard pour l'introspection des modèles
<a name="debugger-use-tensorboard"></a>

TensorBoard dans Amazon SageMaker AI fournit une visibilité approfondie sur les composants internes du modèle pendant la formation :
+ Visualisez les distributions des dégradés et les histogrammes de poids entre les étapes
+ Surveillez les modèles d'activation et le comportement des couches
+ Suivez les métriques scalaires, les images et les visualisations personnalisées

**Quand utiliser TensorBoard vs. MLflow : ** MLflow suit les métriques scalaires et prend en charge la visualisation de base pour la comparaison des exécutions. TensorBoard excelle dans l'introspection de modèles multidimensionnels : histogrammes de gradient, distributions de poids, graphiques informatiques et projections intégrées. Utilisez les deux ensemble : MLflow pour la gestion des expériences, TensorBoard pour les sessions de débogage approfondies.

**Commencez : ** [ TensorBoard dans Amazon SageMaker AI ](https://docs.aws.amazon.com/sagemaker/latest/dg/tensorboard-on-sagemaker.html)

### Utilisez Amazon CloudWatch pour la surveillance du système et les alertes
<a name="debugger-use-cloudwatch"></a>

Amazon collecte CloudWatch les statistiques d'utilisation des ressources pour vos tâches de formation et prend en charge les alarmes configurables :
+ Surveillez l'utilisation du processeur, du GPU, de la mémoire et du disque en temps réel
+ Définissez des alarmes sur n'importe quel indicateur d'entraînement afin de détecter les anomalies (plateaux de pertes, goulots d'étranglement des ressources ou comportement de mesure inattendu)
+ Créez des tableaux de bord combinant les mesures du système et les mesures de formation pour une visibilité unifiée

**Commencez : ** [ Amazon CloudWatch Metrics pour le suivi et l'analyse des offres de formation ](https://docs.aws.amazon.com/sagemaker/latest/dg/training-metrics.html)

## Qu'advient-il de vos données existantes
<a name="debugger-existing-data"></a>
+ **Journaux d'entraînement dans S3 : les résultats de ** vos tâches de formation, les artefacts de votre modèle et les journaux restent accessibles. Ils sont indépendants de Debugger.
+ **Données du tenseur du débogueur : les collections de tenseurs ** historiques stockées par Debugger restent dans S3 aux chemins répertoriés ci-dessus jusqu'à ce que vous les supprimiez. La bibliothèque [`smdebug` cliente ](https://github.com/awslabs/sagemaker-debugger) peut toujours lire ces données à titre de référence.
+ **CloudWatch métriques : les statistiques d'entraînement ** historiques déjà disponibles CloudWatch sont conservées conformément aux paramètres de conservation des [ journaux de votre compte](https://docs.aws.amazon.com/AmazonCloudWatch/latest/logs/Working-with-log-groups-and-streams.html#SettingLogRetention).