

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# File Manifest Augmented untuk Pekerjaan Pelatihan
<a name="augmented-manifest"></a>

Untuk menyertakan metadata dengan dataset Anda dalam pekerjaan pelatihan, gunakan file manifes tambahan. Saat menggunakan file manifes yang diperbesar, dataset Anda harus disimpan di Amazon Simple Storage Service (Amazon S3), dan Anda harus mengonfigurasi pekerjaan pelatihan Anda untuk menggunakan kumpulan data yang disimpan di sana. Anda menentukan lokasi dan format dataset ini untuk satu atau lebih [`Channel`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_Channel.html). Manifes yang diperbesar hanya dapat mendukung mode input Pipe. Lihat bagian, ** InputMode ** di [`Channel`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_Channel.html) untuk mempelajari lebih lanjut tentang mode input pipa. 

Saat menentukan parameter saluran, Anda menentukan jalur ke file, yang disebut a`S3Uri`. Amazon SageMaker AI menafsirkan URI ini berdasarkan yang ditentukan `S3DataType` dalam [`S3DataSource`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_S3DataSource.html). `AugmentedManifestFile`Opsi mendefinisikan format manifes yang menyertakan metadata dengan data input. Menggunakan file manifes yang diperbesar adalah alternatif untuk pra-pemrosesan ketika Anda telah memberi label data. Untuk pekerjaan pelatihan menggunakan data berlabel, Anda biasanya perlu melakukan praproses dataset untuk menggabungkan data input dengan metadata sebelum pelatihan. Jika dataset pelatihan Anda besar, pra-pemrosesan bisa memakan waktu dan mahal.

## Format File Manifest yang Ditingkatkan
<a name="augmented-manifest-format"></a>

File manifes yang diperbesar harus diformat dalam [ format ](http://jsonlines.org/) JSON Lines. Dalam format JSON Lines, setiap baris dalam file adalah objek JSON lengkap diikuti oleh pemisah baris baru.

Selama pelatihan, SageMaker AI mengurai setiap baris JSON dan mengirimkan beberapa atau semua atributnya ke algoritma pelatihan. Anda menentukan konten atribut mana yang akan dilewati dan urutan untuk meneruskannya dengan `AttributeNames` parameter [`CreateTrainingJob`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_CreateTrainingJob.html) API. `AttributeNames`Parameter adalah daftar nama atribut yang dic SageMaker ari AI di objek JSON untuk digunakan sebagai input pelatihan.

Misalnya, jika Anda mencant `["line", "book"]` umkan untuk`AttributeNames`, data input harus menyertakan nama atribut `line` dan `book` dalam urutan yang ditentukan. Untuk contoh ini, konten file manifes ditambah berikut ini valid:

```
{"author": "Herman Melville", "line": "Call me Ishmael", "book": "Moby Dick"}
{"line": "It was love at first sight.", "author": "Joseph Heller", "book": "Catch-22"}
```

SageMaker AI mengabaikan nama atribut yang tidak terdaftar meskipun mereka mendahului, mengikuti, atau berada di antara atribut yang terdaftar.

Saat menggunakan file manifes yang diperbesar, perhatikan pedoman berikut:
+ Urutan atribut yang tercantum dalam `AttributeNames` parameter menentukan urutan atribut yang diteruskan ke algoritma dalam pekerjaan pelatihan.
+ Yang terdaftar `AttributeNames` dapat menjadi subset dari semua atribut di baris JSON. SageMaker AI mengabaikan atribut yang tidak terdaftar dalam file.
+ Anda dapat menentukan semua jenis data yang diizinkan oleh format JSON`AttributeNames`, termasuk teks, numerik, array data, atau objek.
+ Untuk menyertakan URI S3 sebagai nama atribut, tambahkan akhiran `-ref` ke sana.

Jika nama atribut berisi akhiran`-ref`, nilai atribut harus berupa URI S3 ke file data yang dapat diakses oleh pekerjaan pelatihan. Misalnya, jika `AttributeNames` berisi`["image-ref", "is-a-cat"]`, contoh berikut menunjukkan file manifes tambahan yang valid:

```
{"image-ref": "s3://amzn-s3-demo-bucket/sample01/image1.jpg", "is-a-cat": 1}
{"image-ref": "s3://amzn-s3-demo-bucket/sample02/image2.jpg", "is-a-cat": 0}
```

Dalam kasus baris JSON pertama dari file manifes ini, SageMaker AI mengambil `image1.jpg` file dari `s3://amzn-s3-demo-bucket/sample01/` dan representasi string dari `is-a-cat` atribut `"1"` untuk klasifikasi gambar.

**Tip**  
Untuk membuat file manifes tambahan, gunakan Amazon G SageMaker round Truth dan buat pekerjaan pelabelan. Untuk informasi selengkapnya tentang output dari pekerjaan pelabelan, lihat[Pelabelan data keluaran pekerjaan](sms-data-output.md).

## Gunakan File Manifest Augmented
<a name="augmented-manifest-create"></a>

Bagian berikut menunjukkan cara menggunakan file manifes yang diperbesar dalam pekerjaan SageMaker pelatihan Amazon Anda, baik dengan konsol SageMaker AI atau secara terprogram menggunakan SageMaker Python SDK.

### Gunakan File Manifest Augmented (Konsol)
<a name="augmented-manifest-console"></a>

Untuk menyelesaikan prosedur ini, Anda perlu:
+ URL bucket S3 tempat Anda menyimpan file manifes yang diperbesar.
+ Untuk menyimpan data yang tercantum dalam file manifes ditambah dalam bucket S3.
+ URL bucket S3 tempat Anda ingin menyimpan output pekerjaan.

**Untuk menggunakan file manifes ditambah dalam pekerjaan pelatihan (konsol)**

1. Buka konsol Amazon SageMaker AI di [ https://console.aws.amazon.com/sagemaker/](https://console.aws.amazon.com/sagemaker/).

1. Di panel navigasi, pilih Pel ** atihan**, lalu pilih ** Pekerjaan pelatihan**. 

1. Pilih ** Buat pekerjaan pelatihan**.

1. Berikan nama untuk pekerjaan pelatihan. Nama harus unik dalam Wil AWS ayah dalam AWS akun. Ini dapat memiliki 1 hingga 63 karakter. Karakter yang valid: a-z, A-Z, 0-9, dan.: \+ = @ \_% - (tanda hubung).

1. Pilih algoritma yang ingin Anda gunakan. Untuk informasi tentang algoritma bawaan yang didukung, lihat[Built-in algoritma dan model terlatih di Amazon SageMaker](algos.md). Jika Anda ingin menggunakan algoritma khusus, pastikan itu kompatibel dengan mode Pipe.

1. (Opsional) Untuk konfigurasi Sumber ** ** Daya, terima nilai default atau, untuk mengurangi waktu komputasi, tingkatkan konsumsi sumber daya.

   1. (Opsional) ** Untuk tipe Inst ** ance, pilih jenis instance komputasi ML yang ingin Anda gunakan. Dalam kebanyakan kasus, ** ml.m4. ** xlarge sudah cukup. 

   1. Untuk ** Jumlah contoh**, gunakan default,`1`.

   1. (Opsional) Untuk Volume ** tambahan per instans (GB)**, pilih ukuran volume penyimpanan ML yang ingin Anda sediakan. Dalam kebanyakan kasus, Anda dapat menggunakan default,`1`. Jika Anda menggunakan dataset besar, gunakan ukuran yang lebih besar.

1. Berikan informasi tentang data input untuk dataset pelatihan.

   1. Untuk nama ** saluran**, terima default (**train**) atau masukkan nama yang lebih bermakna, seperti**training-augmented-manifest-file**.

   1. Untuk ** InputMode**, pilih ** Pipa**.

   1. Untuk tipe distribusi data ** S3**, pilih ** FullyReplicated**. Saat berlatih secara bertahap, replikasi penuh menyebabkan setiap instance komputasi ML menggunakan salinan lengkap dari kumpulan data yang diperluas. Untuk algoritma berbasis saraf, seperti[Algoritma Model Topik Saraf (NTM)](ntm.md), pilih. `ShardedByS3Key`

   1. Jika data yang ditentukan dalam file manifes ditambah tidak terkompresi, setel tipe ** Kompresi ** ke Tidak Ada**. ** Jika data dikompresi menggunakan gzip, atur ke ** G ** zip.

   1. (Opsional) Untuk jenis ** Konten**, tentukan jenis MIME yang sesuai. Jenis konten adalah jenis ekstensi surat internet multiguna (MIME) dari data.

   1. Untuk ** Record wrapper**, jika dataset yang ditentukan dalam file manifes ditambah disimpan dalam format Recordio, pilih ** Recordio. ** Jika dataset Anda tidak disimpan sebagai RecordIO-formatted file, pilih Tidak ** Ada**.

   1. Untuk tipe data ** S3**, pilih ** AugmentedManifestFile**.

   1. Untuk lokasi ** S3**, berikan jalur ke bucket tempat Anda menyimpan file manifes yang diperbesar.

   1. Untuk nama ** AugmentedManifestFile atribut**, tentukan nama atribut yang ingin Anda gunakan. Nama atribut harus ada dalam file manifes yang diperbesar, dan peka huruf besar/kecil.

   1. (Opsional) Untuk menambahkan lebih banyak nama atribut, pilih ** Tambah baris ** dan tentukan nama atribut lain untuk setiap atribut.

   1. (Opsional) Untuk menyesuaikan urutan nama atribut, pilih tombol atas atau bawah di sebelah nama. Saat menggunakan file manifes yang diperbesar, urutan nama atribut yang ditentukan penting.

   1. Pilih **Selesai**.

1. Untuk konfigurasi data ** keluaran**, berikan informasi berikut:

   1. Untuk lokasi ** S3**, ketik jalur ke bucket S3 tempat Anda ingin menyimpan data keluaran.

   1. (Opsional) Anda dapat menggunakan kunci enkripsi AWS Key Management Service (AWS KMS) untuk mengenkripsi data keluaran saat diam. Untuk kunci ** enkripsi**, berikan ID kunci atau Nomor Sumber Daya Amazon (ARN). Untuk informasi selengkapnya, lihat K [ KMS-Managed unci Enkripsi](https://docs.aws.amazon.com/AmazonS3/latest/dev/UsingKMSEncryption.html).

1. (Opsional) Untuk ** Tag**, tambahkan satu atau beberapa tag ke pekerjaan pelatihan. *Tag * adalah metadata yang dapat Anda tentukan dan tetapkan ke AWS sumber daya. Dalam hal ini, Anda dapat menggunakan tag untuk membantu mengelola pekerjaan pelatihan Anda. Tag terdiri dari kunci dan nilai, yang Anda tentukan. Misalnya, Anda mungkin ingin membuat tag dengan **Project** sebagai kunci dan nilai yang mengacu pada proyek yang terkait dengan pekerjaan pelatihan, seperti**Home value forecasts**.

1. Pilih ** Buat pekerjaan pelatihan**. SageMaker AI menciptakan dan menjalankan pekerjaan pelatihan.

Setelah pekerjaan pelatihan selesai, SageMaker AI menyimpan artefak model di bucket yang jalurnya Anda berikan untuk jalur keluaran ** S3 ** di ** bidang konfigurasi data ** keluaran. Untuk menerapkan model untuk mendapatkan prediksi, lihat[Terapkan model ke Amazon EC2](ex1-model-deployment.md).

### Gunakan File Manifest Augmented (API)
<a name="augmented-manifest-api"></a>

Berikut ini menunjukkan cara melatih model dengan file manifes yang diperbesar menggunakan pustaka Python tingkat tinggi SageMaker AI:

```
import sagemaker
from sagemaker.train import ModelTrainer
from sagemaker.core.shapes import Channel, DataSource, S3DataSource
from sagemaker.train.configs import Compute, StoppingCondition, OutputDataConfig

# Create a model object set to using "Pipe" mode.
compute = Compute(
    instance_type='ml.p3.2xlarge',
    instance_count=1,
    volume_size_in_gb=50
)

model_trainer = ModelTrainer(
    training_image={{training_image}},
    role=role,
    compute=compute,
    stopping_condition=StoppingCondition(max_runtime_in_seconds=360000),
    training_input_mode='Pipe',
    output_data_config=OutputDataConfig(s3_output_path={{s3_output_location}}),
    sagemaker_session={{session}}
)

# Create a train data channel with S3_data_type as 'AugmentedManifestFile' and attribute names.
train_data = Channel(
    channel_name='train',
    data_source=DataSource(
        s3_data_source=S3DataSource(
            s3_data_type='AugmentedManifestFile',
            s3_uri={{your_augmented_manifest_file}},
            s3_data_distribution_type='FullyReplicated',
            attribute_names=[{{'source-ref'}}, {{'annotations'}}],
        )
    ),
    content_type='application/x-recordio',
    input_mode='Pipe',
    record_wrapper_type='RecordIO'
)

# Train a model.
model_trainer.train(input_data_config=[train_data])
```

Setelah pekerjaan pelatihan selesai, SageMaker AI menyimpan artefak model di bucket yang jalurnya Anda berikan untuk jalur keluaran ** S3 ** di ** bidang konfigurasi data ** keluaran. Untuk menerapkan model untuk mendapatkan prediksi, lihat[Terapkan model ke Amazon EC2](ex1-model-deployment.md).