

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# RFT
<a name="customizing-models-rft"></a>

Penguatan Fine-Tuning (RFT) menggunakan pembelajaran penguatan untuk mengoptimalkan perilaku model berdasarkan sinyal hadiah daripada contoh input-output eksplisit. Amazon SageMaker AI mendukung dua varian RFT: RLVR (Reinforcement Learning with Verified Rewards) dan RLAIF (Reinforcement Learning from AI Feedback).

## RLVR
<a name="technique-rlvr"></a>

RLVR menggunakan fungsi hadiah berbasis kode yang secara terprogram memverifikasi apakah output model benar. Paling cocok untuk tugas dengan jawaban yang benar atau salah secara objektif.

### Kapan harus digunakan
<a name="rlvr-when-to-use"></a>
+ Tugas Anda memiliki jawaban yang benar yang dapat diverifikasi (matematika, kode, pertanyaan faktual)
+ Anda dapat menulis fungsi penilaian yang mengevaluasi kebenaran respons
+ Anda ingin meningkatkan akurasi faktual dan mengurangi halusinasi

### Format dataset
<a name="rlvr-dataset-format"></a>

Setiap catatan berisi metadata model prompt dan hadiah. Fungsi hadiah mengevaluasi respons yang dihasilkan model selama pelatihan.

```
{
  "data_source": "openai/gsm8k",
  "prompt": [
    {
      "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".",
      "role": "user"
    }
  ],
  "ability": "math",
  "reward_model": {
    "ground_truth": "72",
    "style": "rule"
  }
}
```

Bidang wajib:
+ `prompt`— array objek pesan dengan `role` dan `content`
+ `reward_model.style`— diatur `"rule"` untuk verifikasi terprogram
+ `reward_model.ground_truth`— jawaban yang benar untuk verifikasi

### Fungsi hadiah yang telah ditetapkan
<a name="rlvr-preset-reward-functions"></a>
+ `gsm8k`— Verifikasi matematika sekolah dasar
+ `prime_code`— Verifikasi kebenaran kode
+ `prime_math`— Verifikasi penalaran matematis

### Hiperparameter RLVR LoRa
<a name="hyperparameters-rlvr-lora-rft"></a>

**catatan**  
Tabel di bawah ini menunjukkan hyperparameter yang tersedia saat Anda menggunakan kustomisasi model [ tanpa server. ](customize-model.md) Hyperparameter lainnya telah ditetapkan oleh Amazon SageMaker AI menggunakan default yang dioptimalkan. Saat Anda menggunakan [ SageMaker Pekerjaan Pelatihan AI ](customizing-models-training-jobs.md) atau [ HyperPod](customizing-models-hyperpod.md), Anda dapat mengakses daftar lengkap hyperparameter yang tersedia di resep. Lihat repositori Resep [ SageMaker AI ](https://github.com/aws/sagemaker-hyperpod-recipes) untuk mendapatkan resep dan mengakses semua hyperparameter.


| Parameter | Tipe | Diperlukan? | Rentang/Nilai | Deskripsi | 
| --- | --- | --- | --- | --- | 
| preset\_reward\_function | string | Diperlukan  | gsm8k, kode\_utama, matematika\_utama | Fungsi hadiah preset untuk verifikasi. | 
| learning\_rate | float | Diperlukan  | 1e-07—1e-03 | Ukuran langkah untuk pembaruan berat. Atur lebih rendah untuk RL (misalnya, 1e-5). | 
| lr\_warmup\_steps\_ratio | float | Diperlukan  | 0—1 | Fraksi langkah untuk pemanasan LR. | 
| max\_epochs | integer | Diperlukan  | 1–100 | Jumlah lintasan melalui dataset. | 
| global\_batch\_size | integer | Diperlukan  | 128, 256, 512, 1024 | Total sampel per langkah pengoptimal. | 
| max\_prompt\_length | integer | Diperlukan  | 512—16384 | Token maksimum untuk porsi cepat. | 
| weight\_decay | float | Diperlukan  | 0,0-1,0 | Koefisien regularisasi L2. | 
| clip\_ratio | float | Diperlukan  | 0,1—1,5 | Parameter kliping GRPO. Membatasi perubahan kebijakan per pembaruan. | 
| kl\_loss\_coef | float | Diperlukan  | 0—0,1 | Bobot penalti divergensi KL. Mencegah penyimpangan kebijakan. | 
| rollout\_n | integer | Diperlukan  | 1, 2, 4, 8, 16, 32 | Tanggapan kandidat per prompt selama peluncuran. | 
| rollout\_temperature | float | Diperlukan  | 0,01—2,0 | Suhu untuk pembuatan peluncuran. | 
| lora\_rank | integer | Diperlukan  | 8, 16, 32, 64, 128 | LoRAperingkat. Dimensi matriks peringkat rendah. | 
| lora\_alpha | integer | Diperlukan  | 16, 32, 64, 128, 256 | LoRAfaktor penskalaan. Timbangan LR yang efektif sebagai alpha/rank. | 
| warmup\_steps | integer | Diperlukan  | -1—100 | Langkah pemanasan absolut (-1 untuk otomatis). | 
| min\_lr | float | Diperlukan  | 0,0-1,0 | LanTAI tingkat pembelajaran minimum. | 
| clip\_ratio\_high | float | Diperlukan  | 0,0-0,5 | Ambang kliping atas. | 
| clip\_ratio\_low | float | Diperlukan  | 0,0-0,5 | Ambang kliping yang lebih rendah. | 
| temperature | float | Diperlukan  | 0,0-2,0 | Suhu pengambilan sampel untuk evaluasi. | 
| use\_kl\_loss | boolean | Diperlukan  | benar, salah | Tambahkan penalti divergensi KL ke kerugian. | 
| train\_val\_split\_ratio | float | Opsional | 0,0-1,0 | Train/validation berpisah. | 

### Hiperparameter RLVR FFT
<a name="hyperparameters-rlvr-fft-rft"></a>

Parameter yang sama dengan RLVR LoRa tanpa `lora_rank` dan. `lora_alpha`

## RLAIF
<a name="technique-rlaif"></a>

RLAIF menggunakan LLM lain sebagai juri untuk mengevaluasi respons model berdasarkan prompt penghargaan bahasa alami. Paling cocok untuk tugas dengan kriteria kualitas subjektif yang sulit untuk dievaluasi secara terprogram.

### Kapan harus digunakan
<a name="rlaif-when-to-use"></a>
+ Kriteria kualitas Anda subjektif (bantuan, keamanan, nada)
+ Anda dapat menggambarkan seperti apa “baik” dalam bahasa alami
+ Anda ingin menskalakan umpan balik di luar apa yang dapat diberikan anotasi manusia

### Format dataset
<a name="rlaif-dataset-format"></a>

Setiap catatan berisi metadata model prompt dan hadiah. Hakim LLM mengevaluasi respons yang dihasilkan model selama pelatihan.

```
{
  "data_source": "WeOpenML/PandaLM",
  "prompt": [
    {
      "role": "user",
      "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..."
    }
  ],
  "ability": "pairwise-judging",
  "reward_model": {
    "style": "llmj",
    "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..."
  }
}
```

Bidang yang wajib diisi:
+ `prompt`— array objek pesan dengan `role` dan `content`
+ `reward_model.style`— diatur ke `"llmj"` untuk LLM-as-judge
+ `reward_model.ground_truth`— penilaian referensi untuk kalibrasi

### Templat hakim
<a name="rlaif-judge-templates"></a>

Templat juri preset berikut disediakan dalam wadah pelatihan. Pilih satu menggunakan `judge_prompt_template` hyperparameter.
+ `cot.jinja`— Chain-of-thought evaluasi
+ `evaluate.jinja`— Evaluasi kualitas umum
+ `faithfulness.jinja`— Kesetiaan terhadap bahan sumber
+ `summarize.jinja`— Kualitas ringkasan
+ `grader.jinja`— Rubric-based penilaian

### Hiperparameter RLAIF LoRa
<a name="hyperparameters-rlaif-lora-rft"></a>

Parameter yang sama dengan RLVR LoRa dengan perbedaan sebagai berikut:


| Parameter | Tipe | Diperlukan? | Rentang/Nilai | Deskripsi | 
| --- | --- | --- | --- | --- | 
| judge\_prompt\_template | string | Opsional | cot.jinja, evaluate.jinja, kesetiaan.jinja, meringkas.jinja, grader.jinja | Template untuk evaluasi hakim LLM. Menggantipreset\_reward\_function. | 

### Hiperparameter RLAIF FFT
<a name="hyperparameters-rlaif-fft-rft"></a>

Parameter yang sama dengan RLAIF LoRa tanpa `lora_rank` dan. `lora_alpha`