

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# SageMaker Apache Spark con Amazon AI
<a name="apache-spark"></a>

Amazon SageMaker AI Spark è una libreria Spark open source che ti aiuta a creare pipeline di machine learning (ML) Spark con l'intelligenza artificiale. SageMaker Ciò semplifica l'integrazione delle fasi di Spark ML con le fasi di SageMaker intelligenza artificiale, come l'addestramento e l'hosting dei modelli. Per informazioni su SageMaker AI Spark, consulta il repository [ SageMaker AI Spark. ](https://github.com/aws/sagemaker-spark) GitHub I seguenti argomenti forniscono informazioni per imparare a usare Apache Spark con AI. SageMaker 

La libreria SageMaker AI Spark è disponibile in Python e Scala. Puoi usare SageMaker AI Spark per addestrare modelli in SageMaker intelligenza artificiale utilizzando i frame di `org.apache.spark.sql.DataFrame` dati nei tuoi cluster Spark. Dopo l'addestramento del modello, puoi anche ospitare il modello utilizzando i servizi di hosting SageMaker AI. 

La libreria SageMaker AI Spark fornisce`com.amazonaws.services.sagemaker.sparksdk`, tra le altre, le seguenti classi:
+ `SageMakerEstimator`: estende l'interfaccia `org.apache.spark.ml.Estimator`. È possibile utilizzare questo stimatore per l'addestramento dei modelli in SageMaker AI.
+ `KMeansSageMakerEstimator`, `PCASageMakerEstimator` e `XGBoostSageMakerEstimator`: estendono la classe `SageMakerEstimator`. 
+ `SageMakerModel`: estende la classe `org.apache.spark.ml.Model`. Puoi usarlo `SageMakerModel` per l'hosting di modelli e ottenere inferenze nell' SageMaker IA.

Puoi scaricare il codice sorgente per le librerie Python Spark (PySpark) e Scala dal repository [ SageMaker AI Spark. ](https://github.com/aws/sagemaker-spark) GitHub

Per l'installazione e gli esempi della libreria SageMaker AI Spark, vedi o. [SageMaker Esempi di AI Spark per Scala](apache-spark-example1.md) [Risorse per l'utilizzo di SageMaker AI Spark for Python (), esempi PySpark](apache-spark-additional-examples.md)

Se usi Amazon EMR AWS per gestire i cluster Spark, consulta Apache Spark. [https://aws.amazon.com/emr/features/spark/](https://aws.amazon.com/emr/features/spark/) Per ulteriori informazioni sull'utilizzo di Amazon EMR nell'IA, consulta. SageMaker [Preparazione dei dati con Amazon EMR](studio-notebooks-emr-cluster.md)

**Topics**
+ [Integra la tua applicazione Apache Spark con l'IA SageMaker](#spark-sdk-common-process)
+ [SageMaker Esempi di AI Spark per Scala](apache-spark-example1.md)
+ [Risorse per l'utilizzo di SageMaker AI Spark for Python (), esempi PySpark](apache-spark-additional-examples.md)

## Integra la tua applicazione Apache Spark con l'IA SageMaker
<a name="spark-sdk-common-process"></a>

Di seguito è riportato un riepilogo di alto livello dei passaggi per l'integrazione dell'applicazione Apache Spark con l'IA. SageMaker 

1. Continua con la preelaborazione dei dati utilizzando la libreria Apache Spark con cui hai familiarità. Il set di dati rimane un `DataFrame` nel tuo cluster Spark. Carica i dati in un `DataFrame`. Pre-elaborali in modo da avere una colonna `features` con `org.apache.spark.ml.linalg.Vector` di `Doubles` e una colonna `label` facoltativa con valori di tipo `Double`.

1. Usa lo stimatore nella libreria SageMaker AI Spark per addestrare il tuo modello. Ad esempio, se scegli l'algoritmo k-means fornito dall' SageMaker IA per l'addestramento del modello, chiama il metodo. `KMeansSageMakerEstimator.fit` 

   Come input fornisci il tuo `DataFrame`. Lo strumento di valutazione restituisce un oggetto `SageMakerModel`. 
**Nota**  
`SageMakerModel` estende `org.apache.spark.ml.Model`.

   Il metodo `train` esegue quanto segue: 

   1. Converte l’input `DataFrame` nel formato protobuf. Per farlo, seleziona le colonne `features` e `label` dall’input `DataFrame`. Quindi carica i dati protobuf in un bucket Amazon S3. Il formato protobuf è efficace per l'addestramento dei modelli nell'IA. SageMaker 

   1. Avvia l'addestramento dei modelli nell' SageMaker IA inviando una richiesta SageMaker AI [`CreateTrainingJob`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_CreateTrainingJob.html). Una volta completato l'addestramento del modello, l' SageMaker IA salva gli artefatti del modello in un bucket S3. 

      SageMaker L'IA assume il ruolo IAM che hai specificato per l'addestramento dei modelli per eseguire attività per tuo conto. Ad esempio, utilizza il ruolo per leggere i dati di addestramento da un bucket S3 e scrivere artefatti del modello in un bucket. 

   1. Crea e restituisce un oggetto `SageMakerModel`. Il costruttore esegue le seguenti attività, correlate all'implementazione del modello nell'IA. SageMaker 

      1. Invia una [`CreateModel`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_CreateModel.html) richiesta all' SageMaker IA. 

      1. Invia una [`CreateEndpointConfig`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_CreateEndpointConfig.html) richiesta all' SageMaker IA.

      1. Invia una [`CreateEndpoint`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_CreateEndpoint.html) richiesta all' SageMaker IA, che quindi avvia le risorse specificate e ospita il modello su di esse. 

1. Puoi ottenere inferenze dal tuo modello ospitato in SageMaker AI con. `SageMakerModel.transform` 

   Fornisci un input `DataFrame` con caratteristiche come input. Il metodo `transform` lo converte in un `DataFrame` contenente inferenze. Internamente, il `transform` metodo invia una richiesta all'[`InvokeEndpoint`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_runtime_InvokeEndpoint.html) SageMaker API per ottenere inferenze. Il metodo `transform` collega le inferenze all'input `DataFrame`.