

 **このページの改善にご協力ください** 

このユーザーガイドに貢献するには、すべてのページの右側のペインにある「**GitHub でこのページを編集する**」リンクを選択してください。

# Amazon EKS で NVIDIA GPU を管理する
<a name="device-management-nvidia"></a>

NVIDIA GPU は、機械学習トレーニング、推論、ハイパフォーマンスコンピューティングワークロードに広く使用されています。Amazon EKS は、EKS クラスターで NVIDIA GPU デバイスを管理できるように 2 つのメカニズムをサポートしています。*GPU 用 NVIDIA DRA ドライバー*と *NVIDIA Kubernetes デバイスプラグイン*です。

Karpenter、EKS マネージドノードグループ、またはセルフマネージドノードで [[静的キャパシティのプロビジョニング]](https://karpenter.sh/docs/concepts/nodepools/#static-nodepool) を使用する場合は、Kubernetes バージョン 1.34 以降の新しいデプロイに DRA ドライバーを使用することをお勧めします。DRA は、現在 EKS Auto Mode ではサポートされていません。NVIDIA DRA ドライバーを使用すると、GPU を柔軟に割り当てたり、コンテナ間で GPU を共有したりできます。

EKS での DRA 機能の可用性については、EKS の[Kubernetes バージョンのリリースノート](kubernetes-versions-standard.md)を参照してください。EKS で NVIDIA DRA ドライバーとデバイスプラグインを使用する方法の詳細については、[Amazon EKS で NVIDIA DRA ドライバーまたはデバイスプラグインを使用する](device-management-nvidia-dra-device-plugin.md) を参照してください。

## GPU 共有 (MIG & タイムスライシング)
<a name="eks-nvidia-gpu-sharing"></a>

 **マルチインスタンス GPU (MIG)** 

マルチインスタンス GPU (MIG) は、単一の物理 GPU を複数の分離されたインスタンスにパーティション化する NVIDIA GPU のハードウェア機能です。インスタンスの最大数は GPU によって異なります。A100、H100、H200、B200 などのデータセンター GPU は最大 7 個のインスタンスをサポートし、Blackwell ベースの `g7` および `g7e` GPU はより少ないインスタンスをサポートします。各インスタンスには専用メモリ、コンピューティングユニット、メモリ帯域幅があるため、あるインスタンスで実行されるワークロードが別のインスタンスのワークロードに影響を与えることはありません。分離なしでソフトウェアのタイムマルチプレクシングを通じて GPU を共有するタイムスライシングとは異なり、MIG は Pod 間でハードウェアレベルのメモリと障害分離を提供します。

MIG は、マルチテナント推論、予測可能なサービス品質を必要とするワークロード、ハードウェア分離テナンシーのコンプライアンス要件がある環境に最適です。NVIDIA Ampere (A100)、Hopper (H100 と H200)、および Blackwell GPU で使用できます。AWS では、これらは P ファミリーインスタンスタイプと、Blackwell ベースの `g7` および `g7e` インスタンスタイプです。

NVIDIA GPU および EKS で MIG を使用する方法と手順の詳細については、[Amazon EKS の NVIDIA GPU でマルチインスタンス GPU (MIG) を使用する](device-management-nvidia-mig.md) を参照してください。

 **タイムスライシング** 

タイムスライシングでは、NVIDIA デバイスプラグインまたは DRA ドライバーを設定して、GPU ごとに複数のスケジュール可能なスロットをアドバタイズすることで、複数の Pod が単一の物理 NVIDIA GPU を共有できます。Kubernetes スケジューラは同じ GPU に複数の Pod を配置し、GPU の CUDA スケジューラはワークロードをタイムマルチプレックスします。

タイムスライシングは、最もシンプルな GPU 共有戦略です。ソフトウェアのみを使用し、特別なハードウェアを必要とせず、AWS 上のすべての NVIDIA GPU インスタンスタイプで動作します。タイムスライシングでは、GPU を共有する Pod 間でメモリやコンピューティングの分離を行うことはありません。これは、リクエスト間でアイドル状態になる推論サービスや、複数のユーザーが GPU を共有する開発環境など、GPU 使用率が低いワークロードに最適です。ハードウェアレベルのメモリとコンピューティングの分離を必要とするワークロードでは、代わりに MIG を使用します。

NVIDIA GPU と EKS でタイムスライシングを使用する方法と手順については、[Amazon EKS 上の NVIDIA GPU でタイムスライシングを使用する](device-management-nvidia-time-slicing.md) を参照してください。

## トピック
<a name="_topics"></a>
+  [Amazon EKS で NVIDIA DRA ドライバーまたはデバイスプラグインを使用する](device-management-nvidia-dra-device-plugin.md) 
+  [Amazon EKS の NVIDIA GPU でマルチインスタンス GPU (MIG) を使用する](device-management-nvidia-mig.md) 
+  [Amazon EKS 上の NVIDIA GPU でタイムスライシングを使用する](device-management-nvidia-time-slicing.md) 