

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Frameworks pris en charge, Régions AWS, et les types d'instances
<a name="distributed-data-parallel-support"></a>

Avant d'utiliser la bibliothèque SMDDP ( SageMaker AI Distributed Data Parallelism), vérifiez quels sont les frameworks de machine learning et les types d'instances pris en charge et s'il y a suffisamment de quotas sur votre compte et. AWS Région AWS

## Cadres pris en charge
<a name="distributed-data-parallel-supported-frameworks"></a>

Les tableaux suivants présentent les frameworks d'apprentissage profond et leurs versions pris en charge par SageMaker AI et SMDDP. La bibliothèque SMDDP est disponible dans les conteneurs [ SageMaker AI Framework](https://github.com/aws/deep-learning-containers/blob/master/available_images.md#sagemaker-framework-containers-sm-support-only), intégrée dans les conteneurs [ Docker distribués par la bibliothèque SMP ( SageMaker Model Parallelism) v2](distributed-model-parallel-support-v2.md#distributed-model-parallel-supported-frameworks-v2), ou téléchargeable sous forme de fichier binaire.

**Note**  
Pour vérifier les dernières mises à jour et notes de mises à jour de la bibliothèque SMDDP, consultez les [SageMaker Notes de mise à jour de la bibliothèque de parallélisme des données AI](data-parallel-release-notes.md).

**Topics**
+ [PyTorch](#distributed-data-parallel-supported-frameworks-pytorch)
+ [PyTorch Éclair](#distributed-data-parallel-supported-frameworks-lightning)
+ [Hugging Face Transformers](#distributed-data-parallel-supported-frameworks-transformers)
+ [TensorFlow (obsolète)](#distributed-data-parallel-supported-frameworks-tensorflow)

### PyTorch
<a name="distributed-data-parallel-supported-frameworks-pytorch"></a>


| PyTorch version | Version de la bibliothèque SMDDP | SageMaker Images du conteneur AI Framework préinstallées avec SMDDP | Images Docker SMP préinstallées avec SMDDP | URL du fichier binaire\*\* | 
| --- | --- | --- | --- | --- | 
| v2.3.1 | smdistributed-dataparallel==v2.5.0 | Non disponible | 658645717510.dkr.ecr.{{<us-west-2>}}.amazonaws.com/smdistributed-modelparallel:2.4.1-gpu-py311-cu121 | https://smdataparallel.s3.amazonaws.com/binary/pytorch/2.4.1/cu121/2024-10-09/smdistributed\_dataparallel-2.5.0-cp311-cp311-linux\_x86\_64.whl | 
| v2.3.0 | smdistributed-dataparallel==v2.3.0 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:2.3.0-gpu-py311-cu121-ubuntu20.04-sagemaker | Non disponible actuellement | https://smdataparallel.s3.amazonaws.com/binary/pytorch/2.3.0/cu121/2024-05-23/smdistributed\_dataparallel-2.3.0-cp311-cp311-linux\_x86\_64.whl | 
| v2.2.0 | smdistributed-dataparallel==v2.2.0 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:2.2.0-gpu-py310-cu121-ubuntu20.04-sagemaker | 658645717510.dkr.ecr.{{<region>}}.amazonaws.com/smdistributed-modelparallel:2.2.0-gpu-py310-cu121 | https://smdataparallel.s3.amazonaws.com/binary/pytorch/2.2.0/cu121/2024-03-04/smdistributed\_dataparallel-2.2.0-cp310-cp310-linux\_x86\_64.whl | 
| v2.1.0 | smdistributed-dataparallel==v2.1.0 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:2.1.0-gpu-py310-cu121-ubuntu20.04-sagemaker | 658645717510.dkr.ecr.{{<region>}}.amazonaws.com/smdistributed-modelparallel:2.1.2-gpu-py310-cu121 | https://smdataparallel.s3.amazonaws.com/binary/pytorch/2.1.0/cu121/2024-02-04/smdistributed\_dataparallel-2.1.0-cp310-cp310-linux\_x86\_64.whl | 
| v2.0.1 | smdistributed-dataparallel==v2.0.1 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:2.0.1-gpu-py310-cu118-ubuntu20.04-sagemaker | Non disponible | https://smdataparallel.s3.amazonaws.com/binary/pytorch/2.0.1/cu118/2023-12-07/smdistributed\_dataparallel-2.0.2-cp310-cp310-linux\_x86\_64.whl | 
| v2.0.0 | smdistributed-dataparallel==v1.8.0 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:2.0.0-gpu-py310-cu118-ubuntu20.04-sagemaker | Non disponible | https://smdataparallel.s3.amazonaws.com/binary/pytorch/2.0.0/cu118/2023-03-20/smdistributed\_dataparallel-1.8.0-cp310-cp310-linux\_x86\_64.whl | 
| v1.13.1 | smdistributed-dataparallel==v1.7.0 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:1.13.1-gpu-py39-cu117-ubuntu20.04-sagemaker | Non disponible | https://smdataparallel.s3.amazonaws.com/binary/pytorch/1.13.1/cu117/2023-01-09/smdistributed\_dataparallel-1.7.0-cp39-cp39-linux\_x86\_64.whl | 
| v1.12.1 | smdistributed-dataparallel==v1.6.0 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:1.12.1-gpu-py38-cu113-ubuntu20.04-sagemaker | Non disponible | https://smdataparallel.s3.amazonaws.com/binary/pytorch/1.12.1/cu113/2022-12-05/smdistributed\_dataparallel-1.6.0-cp38-cp38-linux\_x86\_64.whl | 
| v1.12.0 | smdistributed-dataparallel==v1.5.0 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:1.12.0-gpu-py38-cu113-ubuntu20.04-sagemaker | Non disponible | https://smdataparallel.s3.amazonaws.com/binary/pytorch/1.12.0/cu113/2022-07-01/smdistributed\_dataparallel-1.5.0-cp38-cp38-linux\_x86\_64.whl | 
| v1.11.0 | smdistributed-dataparallel==v1.4.1 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:1.11.0-gpu-py38-cu113-ubuntu20.04-sagemaker | Non disponible | https://smdataparallel.s3.amazonaws.com/binary/pytorch/1.11.0/cu113/2022-04-14/smdistributed\_dataparallel-1.4.1-cp38-cp38-linux\_x86\_64.whl | 

\*\* Les URL des fichiers binaires servent à installer la bibliothèque SMDDP dans des conteneurs personnalisés. Pour de plus amples informations, veuillez consulter [Créez votre propre conteneur Docker avec la bibliothèque parallèle de données distribuées SageMaker AI](data-parallel-bring-your-own-container.md).

**Note**  
La bibliothèque SMDDP est disponible Régions AWS là où les conteneurs [ SageMaker AI Framework ](https://github.com/aws/deep-learning-containers/blob/master/available_images.md#sagemaker-framework-containers-sm-support-only) et les images [ SMP Docker ](distributed-model-parallel-support-v2.md) sont en service.

**Note**  
La bibliothèque SMDDP v1.4.0 et versions ultérieures fonctionne comme un backend de parallélisme de données distribué ( PyTorch torch.distributed) (torch.parallel). DistributedDataParallel). Conformément à cette modification, les API [ smdistributed suivantes ](https://sagemaker.readthedocs.io/en/stable/api/sagemaker_train.html) pour le package PyTorch distribué sont devenues obsolètes.  
`smdistributed.dataparallel.torch.distributed` est obsolète Utilisez le package [torch.distributed](https://pytorch.org/docs/stable/distributed.html) à la place.
`smdistributed.dataparallel.torch.parallel.DistributedDataParallel` est obsolète Utilisez le [ torch.nn.parallel. DistributedDataParallel](https://pytorch.org/docs/stable/generated/torch.nn.parallel.DistributedDataParallel.html) API à la place.
Si vous devez utiliser les versions précédentes de la bibliothèque (v1.3.0 ou antérieure), consultez la documentation [ archivée sur le parallélisme des données distribuées SageMaker AI ](https://sagemaker.readthedocs.io/en/stable/api/sagemaker_train.html) dans la documentation du SDK * SageMaker AI Python. *

### PyTorch Éclair
<a name="distributed-data-parallel-supported-frameworks-lightning"></a>

La bibliothèque SMDDP est disponible pour PyTorch Lightning dans les conteneurs SageMaker AI Framework suivants PyTorch et dans les conteneurs SMP Docker.

**PyTorch Lightning v2 **


| PyTorch Version Lightning | PyTorch version | Version de la bibliothèque SMDDP | SageMaker Images du conteneur AI Framework préinstallées avec SMDDP | Images Docker SMP préinstallées avec SMDDP | URL du fichier binaire\*\* | 
| --- | --- | --- | --- | --- | --- | 
| 2.2.5 | 2.3.0 | smdistributed-dataparallel==v2.3.0 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:2.3.0-gpu-py311-cu121-ubuntu20.04-sagemaker | Non disponible actuellement | https://smdataparallel.s3.amazonaws.com/binary/pytorch/2.3.0/cu121/2024-05-23/smdistributed\_dataparallel-2.3.0-cp311-cp311-linux\_x86\_64.whl | 
| 2.2.0 | 2.2.0 | smdistributed-dataparallel==v2.2.0 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:2.2.0-gpu-py310-cu121-ubuntu20.04-sagemaker | 658645717510.dkr.ecr.{{<region>}}.amazonaws.com/smdistributed-modelparallel:2.2.0-gpu-py310-cu121 | https://smdataparallel.s3.amazonaws.com/binary/pytorch/2.2.0/cu121/2024-03-04/smdistributed\_dataparallel-2.2.0-cp310-cp310-linux\_x86\_64.whl | 
| 2.1.2 | 2.1.0 | smdistributed-dataparallel==v2.1.0 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:2.1.0-gpu-py310-cu121-ubuntu20.04-sagemaker | 658645717510.dkr.ecr.{{<region>}}.amazonaws.com/smdistributed-modelparallel:2.1.2-gpu-py310-cu121 | https://smdataparallel.s3.amazonaws.com/binary/pytorch/2.1.0/cu121/2024-02-04/smdistributed\_dataparallel-2.1.0-cp310-cp310-linux\_x86\_64.whl | 
| 2.1.0 | 2.0.1 | smdistributed-dataparallel==v2.0.1 | 763104351884.dkr.ecr.{{<region>}}.amazonaws.com/pytorch-training:2.0.1-gpu-py310-cu118-ubuntu20.04-sagemaker | Non disponible | https://smdataparallel.s3.amazonaws.com/binary/pytorch/2.0.1/cu118/2023-12-07/smdistributed\_dataparallel-2.0.2-cp310-cp310-linux\_x86\_64.whl | 

**PyTorch Lightning v1 **


| PyTorch Version Lightning | PyTorch version | Version de la bibliothèque SMDDP | SageMaker Images du conteneur AI Framework préinstallées avec SMDDP | URL du fichier binaire\*\* | 
| --- | --- | --- | --- | --- | 
| 1.7.2<br />1.7.0<br />1.6.4<br />1.6.3<br />1,5,10 | 1.12.0 | smdistributed-dataparallel==v1.5.0 | 763104351884.dkr.ecr. {{<region>}}. amazon. com/pytorch-entraînement : 1.12.0-gpu-py38-cu113 - ubuntu20.04 - sagemaker | https://smdataparallel.s3.amazonaws.com/binary/pytorch/1.12.0/cu113/2022-07-01/smdistributed\_dataparallel-1.5.0-cp38-cp38-linux\_x86\_64.whl | 

\*\* Les URL des fichiers binaires servent à installer la bibliothèque SMDDP dans des conteneurs personnalisés. Pour de plus amples informations, veuillez consulter [Créez votre propre conteneur Docker avec la bibliothèque parallèle de données distribuées SageMaker AI](data-parallel-bring-your-own-container.md).

**Note**  
PyTorch Lightning et ses bibliothèques d'utilitaires telles que Lightning Bolts ne sont pas préinstallés dans les PyTorch DLC. Lorsque vous créez une SageMaker IA PyTorch ModelTrainer et que vous soumettez une demande de formation à l'[étape 2](https://docs.aws.amazon.com/sagemaker/latest/dg/data-parallel-use-api.html#data-parallel-framework-estimator), vous devez fournir des informations à installer `pytorch-lightning` et `requirements.txt` à insérer `lightning-bolts` dans le conteneur de PyTorch formation sur l' SageMaker IA.  

```
# requirements.txt
pytorch-lightning
lightning-bolts
```
Pour plus d'informations sur la spécification du répertoire source dans lequel placer le `requirements.txt` fichier avec votre script de formation et la soumission d'une tâche, consultez la section [ Utilisation de bibliothèques tierces ](https://sagemaker.readthedocs.io/en/stable/api/sagemaker_train.html) dans la documentation * du SDK * Amazon SageMaker AI Python.

### Hugging Face Transformers
<a name="distributed-data-parallel-supported-frameworks-transformers"></a>

Les conteneurs AWS Deep Learning pour Hugging Face utilisent les conteneurs de SageMaker formation pour PyTorch et TensorFlow comme images de base. Pour consulter les versions et les versions couplées PyTorch de la bibliothèque Hugging Face Transformers, consultez les dernières TensorFlow versions des conteneurs [ Hugging Face ](https://github.com/aws/deep-learning-containers/blob/master/available_images.md#huggingface-training-containers) et les versions [ précédentes des conteneurs Hugging Face. ](https://github.com/aws/deep-learning-containers/blob/master/available_images.md#prior-hugging-face-container-versions)

### TensorFlow (obsolète)
<a name="distributed-data-parallel-supported-frameworks-tensorflow"></a>

**Important**  
La bibliothèque SMDDP n'est plus prise en charge TensorFlow et n'est plus disponible dans les DLC à partir de la TensorFlow version 2.11.0. Le tableau suivant répertorie les DLC précédents pour lesquels la TensorFlow bibliothèque SMDDP est installée.


| TensorFlow version | Version de la bibliothèque SMDDP | 
| --- | --- | 
| 2.9.1, 2.10.1, 2.11.0 |  smdistributed-dataparallel==v1.4.1  | 
| 2.8.3 |  smdistributed-dataparallel==v1.3.0  | 

## Régions AWS
<a name="distributed-data-parallel-availablity-zone"></a>

La bibliothèque SMDDP est disponible partout Régions AWS où les [AWS Deep Learning Containers for SageMaker AI ](https://github.com/aws/deep-learning-containers/blob/master/available_images.md#sagemaker-framework-containers-sm-support-only) et les images [ SMP Docker ](distributed-model-parallel-support-v2.md) sont en service.

## Types d’instance pris en charge
<a name="distributed-data-parallel-supported-instance-types"></a>

La bibliothèque SMDDP requiert l’un des types d’instances suivants.


| Type d’instance | 
| --- | 
| ml.p3dn.24xlarge\* | 
| ml.p4d.24xlarge | 
| ml.p4de.24xlarge | 

**Astuce**  
Pour exécuter correctement la formation distribuée sur les types d' EFA-enabled instances, vous devez activer le trafic entre les instances en configurant le groupe de sécurité de votre VPC afin d'autoriser tout le trafic entrant et sortant à destination et en provenance du groupe de sécurité lui-même. Pour savoir comment configurer les règles des groupes de sécurité, consultez [ Étape 1 : Préparer un groupe de EFA-enabled sécurité ](https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/efa-start.html#efa-start-security) dans le guide * de l'utilisateur * Amazon EC2.

**Important**  
\* La bibliothèque SMDDP a cessé de prendre en charge l’optimisation de ses opérations de communication collective sur les instances P3. Bien que vous puissiez toujours utiliser l’opération collective optimisée `AllReduce` SMDDP sur les instances `ml.p3dn.24xlarge`, il n’y aura plus d’assistance au développement pour améliorer les performances sur ce type d’instance. Notez que l’opération collective optimisée `AllGather` SMDDP n’est disponible que pour les instances P4.

Pour les spécifications des types d’instances, consultez la section **Calcul accéléré** sur la page [Types d’instances Amazon EC2](https://aws.amazon.com/ec2/instance-types/). Pour plus d'informations sur la tarification des instances, consultez la [ page SageMaker Tarification Amazon](https://aws.amazon.com/sagemaker/pricing/).

Si vous avez rencontré un message d'erreur similaire au suivant, suivez les instructions de la section [ Demander une augmentation du quota de service pour les ressources d' SageMaker IA](https://docs.aws.amazon.com/sagemaker/latest/dg/regions-quotas.html#service-limit-increase-request-procedure).

```
ResourceLimitExceeded: An error occurred (ResourceLimitExceeded) when calling
the CreateTrainingJob operation: The account-level service limit 'ml.p3dn.24xlarge
for training job usage' is 0 Instances, with current utilization of 0 Instances
and a request delta of 1 Instances.
Please contact AWS support to request an increase for this limit.
```