Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Transformasi batch dengan pipeline inferensi
Untuk mendapatkan kesimpulan pada seluruh dataset, Anda menjalankan transformasi batch pada model yang terlatih. Untuk menjalankan kesimpulan pada dataset lengkap, Anda dapat menggunakan model pipeline inferensi yang sama yang dibuat dan diterapkan ke titik akhir untuk pemrosesan real-time dalam pekerjaan transformasi batch. Untuk menjalankan tugas transformasi batch dalam pipeline, Anda mengunduh data input dari Amazon S3 dan mengirimkannya dalam satu atau beberapa permintaan HTTP ke model pipeline inferensi. Untuk contoh yang menunjukkan cara menyiapkan data untuk transformasi batch, lihat “Bagian 2 - Memproses data perumahan mentah menggunakan Scikit Learn” dari Amazon SageMaker Multi-Model Endpoints menggunakan buku catatan sampel Linear Learner.
catatan
Untuk menggunakan gambar Docker kustom dalam pipeline yang menyertakan algoritma bawaan Amazon SageMaker AI, Anda memerlukan kebijakan https://docs.aws.amazon.com/AmazonECR/latest/userguide/what-is-ecr.html Amazon Elastic Container Registry (ECR). Repositori Amazon ECR Anda harus memberikan izin SageMaker AI untuk menarik gambar. Untuk informasi selengkapnya, lihat Memecahkan Masalah Izin Amazon ECR untuk Saluran Saluran Inferensi.
Contoh berikut menunjukkan cara menjalankan tugas transformasi menggunakan Amazon SageMaker Python SDKmodel_name adalah pipeline inferensi yang menggabungkan model SparkML dan XGBoost (dibuat dalam contoh sebelumnya). Lokasi Amazon S3 yang ditentukan oleh input_data_path berisi data input, dalam format CSV, untuk diunduh dan dikirim ke model Spark ML. Setelah pekerjaan transformasi selesai, lokasi Amazon S3 yang ditentukan oleh output_data_path berisi data keluaran yang dikembalikan oleh model XGBoost dalam format CSV.
from sagemaker.transform import TransformJob input_data_path = 's3://{}/{}/{}'.format(default_bucket, 'key', 'file_name') output_data_path = 's3://{}/{}'.format(default_bucket, 'key') transform_job = TransformJob.create( model_name = model_name, transform_input = { 'DataSource': { 'S3DataSource': { 'S3DataType': 'S3Prefix', 'S3Uri': input_data_path } }, 'ContentType': CONTENT_TYPE_CSV, 'SplitType': 'Line' }, transform_output = { 'S3OutputPath': output_data_path, 'Accept': CONTENT_TYPE_CSV, 'AssembleWith': 'Line' }, transform_resources = { 'InstanceType': 'ml.m4.xlarge', 'InstanceCount': 1 }, transform_job_name = 'inference-pipelines-batch', batch_strategy = 'SingleRecord' )