

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Otomatisasi pelabelan data
<a name="sms-automated-labeling"></a>

**catatan**  
Amazon SageMaker Ground Truth tidak lagi terbuka untuk pelanggan baru. Pelanggan yang sudah ada dapat terus menggunakan layanan seperti biasa. AWS terus berinvestasi dalam peningkatan keamanan dan ketersediaan untuk Ground Truth, tetapi kami tidak berencana untuk memperkenalkan fitur baru.

Jika Anda memilih, Amazon G SageMaker round Truth dapat menggunakan pembelajaran aktif untuk mengotomatiskan pelabelan data input Anda untuk jenis tugas bawaan tertentu. *Pembelajaran aktif * adalah teknik pembelajaran mesin yang mengidentifikasi data yang harus diberi label oleh pekerja Anda. Di Ground Truth, fungsi ini disebut pelabelan data otomatis. Pelabelan data otomatis membantu mengurangi biaya dan waktu yang diperlukan untuk memberi label dataset Anda dibandingkan dengan hanya menggunakan manusia. Saat Anda menggunakan pelabelan otomatis, Anda dikenakan biaya SageMaker pelatihan dan inferensi. 

Kami merekomendasikan penggunaan pelabelan data otomatis pada kumpulan data besar karena jaringan saraf yang digunakan dengan pembelajaran aktif memerlukan sejumlah besar data untuk setiap kumpulan data baru. Biasanya, saat Anda memberikan lebih banyak data, potensi prediksi akurasi tinggi akan meningkat. Data hanya akan diberi label otomatis jika jaringan saraf yang digunakan dalam model pelabelan otomatis dapat mencapai tingkat akurasi tinggi yang dapat diterima. Oleh karena itu, dengan kumpulan data yang lebih besar, ada lebih banyak potensi untuk memberi label data secara otomatis karena jaringan saraf dapat mencapai akurasi yang cukup tinggi untuk pelabelan otomatis. Pelabelan data otomatis paling tepat ketika Anda memiliki ribuan objek data. Jumlah minimum objek yang diizinkan untuk pelabelan data otomatis adalah 1.250, tetapi kami sangat menyarankan untuk menyediakan minimal 5.000 objek.

Pelabelan data otomatis hanya tersedia untuk jenis tugas bawaan Ground Truth berikut: 
+ [Membuat pekerjaan klasifikasi gambar (Label Tunggal)](sms-image-classification.md)
+ [Identifikasi konten gambar menggunakan segmentasi semantik](sms-semantic-segmentation.md)
+ Deteksi objek ([Klasifikasi objek gambar menggunakan kotak pembatas](sms-bounding-box.md))
+ [Mengkategorikan teks dengan klasifikasi teks (Label Tunggal)](sms-text-classification.md)

[Pekerjaan pelabelan streaming ](https://docs.aws.amazon.com/sagemaker/latest/dg/sms-streaming-labeling-job.html) tidak mendukung pelabelan data otomatis.

Untuk mempelajari cara membuat alur kerja pembelajaran aktif khusus menggunakan model Anda sendiri, lihat[Siapkan alur kerja pembelajaran aktif dengan model Anda sendiri](#samurai-automated-labeling-byom).

Kuota data input berlaku untuk pekerjaan pelabelan data otomatis. Lihat [Kuota Input Data](input-data-limits.md) untuk informasi tentang ukuran dataset, ukuran data input, dan batas resolusi.

**catatan**  
Sebelum Anda menggunakan model pelabelan otomatis dalam produksi, Anda perlu menyempurnakan atau mengujinya, atau keduanya. Anda dapat menyempurnakan model (atau membuat dan menyetel model terawasi lain pilihan Anda) pada dataset yang dihasilkan oleh pekerjaan pelabelan Anda untuk mengoptimalkan arsitektur model dan hyperparameter. Jika Anda memutuskan untuk menggunakan model untuk inferensi tanpa menyempurnakannya, kami sangat menyarankan untuk memastikan bahwa Anda mengevaluasi keakuratannya pada subset yang representatif (misalnya, dipilih secara acak) dari kumpulan data berlabel dengan Ground Truth dan sesuai dengan harapan Anda.

## Cara kerjanya
<a name="sms-automated-labeling-how-it-works"></a>

Anda mengaktifkan pelabelan data otomatis saat membuat pekerjaan pelabelan. Beginilah cara kerjanya:

1. Ketika Ground Truth memulai pekerjaan pelabelan data otomatis, ia memilih sampel acak objek data input dan mengirimkannya ke pekerja manusia. Jika lebih dari 10% objek data ini gagal, pekerjaan pelabelan akan gagal. Jika pekerjaan pelabelan gagal, selain meninjau pesan kesalahan Ground Truth return, periksa apakah data input Anda ditampilkan dengan benar di UI pekerja, instruksi jelas, dan bahwa Anda telah memberi pekerja cukup waktu untuk menyelesaikan tugas.

1. Ketika data berlabel dikembalikan, itu digunakan untuk membuat set pelatihan dan set validasi. Ground Truth menggunakan kumpulan data ini untuk melatih dan memvalidasi model yang digunakan untuk pelabelan otomatis.

1. Ground Truth menjalankan tugas transformasi batch, menggunakan model yang divalidasi untuk inferensi pada data validasi. Inferensi batch menghasilkan skor kepercayaan dan metrik kualitas untuk setiap objek dalam data validasi.

1. Komponen pelabelan otomatis akan menggunakan metrik kualitas dan skor kepercayaan ini untuk membuat ambang skor * kepercayaan * yang memastikan label kualitas. 

1. Ground Truth menjalankan pekerjaan transformasi batch pada data tanpa label dalam kumpulan data, menggunakan model yang divalidasi yang sama untuk inferensi. Ini menghasilkan skor kepercayaan untuk setiap objek. 

1. Komponen pelabelan otomatis Ground Truth menentukan apakah skor kepercayaan yang dihasilkan pada langkah 5 untuk setiap objek memenuhi ambang batas yang diperlukan yang ditentukan pada langkah 4. Jika skor kepercayaan memenuhi ambang batas, kualitas pelabelan otomatis yang diharapkan melebihi tingkat akurasi yang diminta dan objek tersebut dianggap berlabel otomatis. 

1. Langkah 6 menghasilkan kumpulan data tanpa label dengan skor kepercayaan. Ground Truth memilih titik data dengan skor kepercayaan rendah dari kumpulan data ini dan mengirimkannya ke pekerja manusia. 

1. Ground Truth menggunakan data berlabel manusia yang ada dan data berlabel tambahan ini dari pekerja manusia untuk memperbarui model.

1. Proses ini diulang sampai kumpulan data diberi label penuh atau sampai kondisi penghentian lain terpenuhi. Misalnya, pelabelan otomatis berhenti jika anggaran anotasi manusia tercapai.

Langkah-langkah sebelumnya terjadi dalam iterasi. Pilih setiap tab dalam tabel berikut untuk melihat contoh proses yang terjadi di setiap iterasi untuk pekerjaan pelabelan otomatis deteksi objek. Jumlah objek data yang digunakan dalam langkah tertentu dalam gambar ini (misalnya, 200) khusus untuk contoh ini. Jika ada kurang dari 5.000 objek untuk diberi label, ukuran set validasi adalah 20% dari seluruh dataset. Jika ada lebih dari 5.000 objek dalam kumpulan data input Anda, ukuran set validasi adalah 10% dari keseluruhan dataset. Anda dapat mengontrol jumlah label manusia yang dikumpulkan per iterasi pembelajaran aktif dengan mengubah nilai [`MaxConcurrentTaskCount`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_HumanTaskConfig.html#sagemaker-Type-HumanTaskConfig-MaxConcurrentTaskCount) saat menggunakan operasi [`CreateLabelingJob`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_CreateLabelingJob.html) API. Nilai ini disetel ke 1.000 saat Anda membuat pekerjaan pelabelan menggunakan konsol. Dalam alur pembelajaran aktif yang diilustrasikan di bawah ** tab Pembelajaran ** Aktif, nilai ini diatur ke 200.

------
#### [ Model Training ]

![Contoh proses pelatihan model.](https://docs.aws.amazon.com/id_id/sagemaker/latest/dg/images/sms/auto-labeling/sagemaker-gt-annotate-data-3.png)


------
#### [ Automated Labeling ]

![Contoh proses pelabelan otomatis.](https://docs.aws.amazon.com/id_id/sagemaker/latest/dg/images/sms/auto-labeling/sagemaker-gt-annotate-data-4.png)


------
#### [ Active Learning ]

![Contoh proses pembelajaran aktif.](https://docs.aws.amazon.com/id_id/sagemaker/latest/dg/images/sms/auto-labeling/sagemaker-gt-annotate-data-5.png)


------

### Akurasi label otomatis
<a name="sms-automated-labeling-accuracy"></a>

Definisi * akurasi * tergantung pada jenis tugas bawaan yang Anda gunakan dengan pelabelan otomatis. Untuk semua jenis tugas, persyaratan akurasi ini ditentukan sebelumnya oleh Ground Truth dan tidak dapat dikonfigurasi secara manual.
+ Untuk klasifikasi gambar dan klasifikasi teks, Ground Truth menggunakan logika untuk menemukan tingkat kepercayaan prediksi label yang sesuai dengan akurasi label setidaknya 95%. Ini berarti Ground Truth mengharapkan keakuratan label otomatis setidaknya 95% jika dibandingkan dengan label yang diberikan oleh pelabel manusia untuk contoh-contoh tersebut.
+ Untuk kotak pembatas, rata-rata Inter [ section Over Union (IOu) yang diharapkan ](https://www.pyimagesearch.com/2016/11/07/intersection-over-union-iou-for-object-detection/) dari gambar berlabel otomatis adalah 0,6. Untuk menemukan IOu rata-rata, Ground Truth menghitung IOu rata-rata dari semua kotak yang diprediksi dan terlewat pada gambar untuk setiap kelas, dan kemudian rata-rata nilai-nilai ini di seluruh kelas.
+ Untuk segmentasi semantik, rata-rata IoU yang diharapkan dari gambar berlabel otomatis adalah 0,7. Untuk menemukan rata-rata IOu, Ground Truth mengambil rata-rata nilai IoU dari semua kelas dalam gambar (tidak termasuk latar belakang).

Pada setiap iterasi Pembelajaran Aktif (langkah 3-6 dalam daftar di atas), ambang kepercayaan ditemukan menggunakan set validasi beranotasi manusia sehingga akurasi yang diharapkan dari objek berlabel otomatis memenuhi persyaratan akurasi tertentu yang telah ditentukan sebelumnya.

## Membuat pekerjaan pelabelan data otomatis (konsol)
<a name="sms-create-automated-labeling-console"></a>

Untuk membuat pekerjaan pelabelan yang menggunakan pelabelan otomatis di konsol SageMaker AI, gunakan prosedur berikut.

**Untuk membuat pekerjaan pelabelan data otomatis (konsol)**

1. Buka ** bagian pekerjaan Pelab ** elan Kebenaran Ground di konsol SageMaker AI:[https://console.aws.amazon.com/sagemaker/groundtruth](https://console.aws.amazon.com/sagemaker/groundtruth).

1. Gunakan [Membuat Pekerjaan Pelabelan (Konsol)](sms-create-labeling-job-console.md) sebagai panduan, lengkapi ** bagian I ** khtis ** ar pekerjaan dan Jenis ** tugas. Perhatikan bahwa pelabelan otomatis tidak didukung untuk jenis tugas khusus.

1. Di bawah ** Pekerja**, pilih jenis tenaga kerja Anda. 

1. Di bagian yang sama, pilih ** Aktifkan pelabelan data otomatis**. 

1. Gunakan [Mengonfigurasi Alat Kotak Bounding](sms-getting-started.md#sms-getting-started-step4) sebagai panduan, buat instruksi pekerja di alat ** {{Task Type}} pelabelan bagian**. Misalnya, jika Anda memilih Segmentasi ** semantik ** sebagai jenis pekerjaan pelabelan, bagian ini disebut alat pelabelan segmentasi ** semantik. **

1. Untuk melihat pratinjau instruksi dan dasbor pekerja Anda, pilih Pr ** atinjau**.

1. Pilih **Buat**. Ini menciptakan dan memulai pekerjaan pelabelan Anda dan proses pelabelan otomatis. 

Anda dapat melihat pekerjaan pelabelan Anda muncul di ** bagian pekerjaan ** pelabelan di konsol SageMaker AI. Data keluaran Anda muncul di bucket Amazon S3 yang Anda tentukan saat membuat pekerjaan pelabelan. Untuk informasi selengkapnya tentang format dan struktur file data keluaran pekerjaan pelabelan Anda, lihat[Pelabelan data keluaran pekerjaan](sms-data-output.md).

## Membuat pekerjaan pelabelan data otomatis (API)
<a name="sms-create-automated-labeling-api"></a>

Untuk membuat pekerjaan pelabelan data otomatis menggunakan SageMaker API, [`LabelingJobAlgorithmsConfig`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_LabelingJobAlgorithmsConfig.html) gunakan parameter [`CreateLabelingJob`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_CreateLabelingJob.html) operasi. Untuk mempelajari cara memulai pekerjaan pelabelan menggunakan `CreateLabelingJob` operasi, lihat[Membuat Pekerjaan Pelabelan (API)](sms-create-labeling-job-api.md).

Tentukan Nama Sumber Daya Amazon (ARN) dari algoritma yang Anda gunakan untuk pelabelan data otomatis dalam [ LabelingJobAlgorithmSpecificationArn ](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_LabelingJobAlgorithmsConfig.html#SageMaker-Type-LabelingJobAlgorithmsConfig-LabelingJobAlgorithmSpecificationArn) parameter. Pilih salah satu dari empat algoritma bawaan Ground Truth yang didukung dengan pelabelan otomatis:
+ [Membuat pekerjaan klasifikasi gambar (Label Tunggal)](sms-image-classification.md)
+ [Identifikasi konten gambar menggunakan segmentasi semantik](sms-semantic-segmentation.md)
+ Deteksi objek ([Klasifikasi objek gambar menggunakan kotak pembatas](sms-bounding-box.md)) 
+ [Mengkategorikan teks dengan klasifikasi teks (Label Tunggal)](sms-text-classification.md)

Ketika pekerjaan pelabelan data otomatis selesai, Ground Truth mengembalikan ARN model yang digunakan untuk pekerjaan pelabelan data otomatis. Gunakan model ini sebagai model awal untuk jenis pekerjaan pelabelan otomatis serupa dengan menyediakan ARN, dalam format string, dalam [ InitialActiveLearningModelArn ](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_LabelingJobAlgorithmsConfig.html#SageMaker-Type-LabelingJobAlgorithmsConfig-InitialActiveLearningModelArn) parameter. Untuk mengambil ARN model, gunakan perintah AWS Command Line Interface (AWS CLI) yang mirip dengan berikut ini. 

```
# Fetch the mARN of the model trained in the final iteration of the previous labeling job.Ground Truth
pretrained_model_arn = sagemaker_client.describe_labeling_job(LabelingJobName={{job_name}})['LabelingJobOutput']['FinalActiveLearningModelArn']
```

Untuk mengenkripsi data pada volume penyimpanan yang dilampirkan ke instance komputasi ML yang digunakan dalam pelabelan otomatis, sertakan kunci AWS Key Management Service (AWS KMS) dalam `VolumeKmsKeyId` parameter. Untuk informasi tentang kunci AWS KMS, lihat [ Apa itu Layanan Manajemen K AWS unci? ](https://docs.aws.amazon.com/kms/latest/developerguide/overview.html)dalam Panduan Pengembang Layanan Manajemen *AWS Utama*.

Untuk contoh yang menggunakan [`CreateLabelingJob`](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_CreateLabelingJob.html) operasi untuk membuat pekerjaan pelabelan data otomatis, lihat contoh ** object\_detection\_tutorial di ** Contoh ** SageMaker AI**, ** bagian Pekerjaan Pelabelan Kebenaran Das ** ar dari instance notebook AI. SageMaker Untuk mempelajari cara membuat dan membuka instance buku catatan, lihat[Membuat instance SageMaker notebook Amazon](howitworks-create-ws.md).

## Instans Amazon EC2 diperlukan untuk pelabelan data otomatis
<a name="sms-auto-labeling-ec2"></a>

Tabel berikut mencantumkan instans Amazon Elastic Compute Cloud (Amazon EC2) yang Anda perlukan untuk menjalankan pelabelan data otomatis untuk pekerjaan pelatihan dan inferensi batch.


| Jenis Pekerjaan Pelabelan Data Otomatis | Jenis Instans Pelatihan | Jenis Instans Inferensi | 
| --- | --- | --- | 
| Klasifikasi gambar | ml.p3.2xbesar\* | ml.c5.xlarge | 
| Deteksi objek (kotak pembatas) | ml.p3.2xbesar\* | ml.c5.4xlarge | 
| Klasifikasi teks | ml.c5.2xlarge | db.m4.xlarge | 
| Segmentasi semantik | ml.p3.2xbesar\* | ml.p3.2xbesar\* | 

\* Di Wilayah Asia Pasifik (Mumbai) (ap-south-1) gunakan ml.p2.8xlarge sebagai gantinya.

 Ground Truth mengelola instans yang Anda gunakan untuk pekerjaan pelabelan data otomatis. Ini membuat, mengonfigurasi, dan mengakhiri instance sesuai kebutuhan untuk melakukan pekerjaan Anda. Instans ini tidak muncul di dasbor instans Amazon EC2 Anda.

## Siapkan alur kerja pembelajaran aktif dengan model Anda sendiri
<a name="samurai-automated-labeling-byom"></a>

Anda dapat membuat alur kerja pembelajaran aktif dengan algoritma Anda sendiri untuk menjalankan pelatihan dan kesimpulan dalam alur kerja tersebut untuk memberi label otomatis pada data Anda. Notebook bring\_your\_own\_model\_for\_sagemaker\_labeling\_workflows\_with\_active\_learning.ipynb menunjukkan ini menggunakan algoritma bawaan AI,. SageMaker [ BlazingText ](https://docs.aws.amazon.com/sagemaker/latest/dg/blazingtext.html) Buku catatan ini menyediakan CloudFormation tumpukan yang dapat Anda gunakan untuk menjalankan alur kerja ini menggunakan AWS Step Functions. Anda dapat menemukan notebook dan file pendukung di [ GitHub repositori ini](https://github.com/awslabs/amazon-sagemaker-examples/tree/master/ground_truth_labeling_jobs/bring_your_own_model_for_sagemaker_labeling_workflows_with_active_learning).