

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# RFT
<a name="customizing-models-rft"></a>

Le renforcement Fine-Tuning (RFT) utilise l'apprentissage par renforcement pour optimiser le comportement du modèle en fonction de signaux de récompense plutôt que d'exemples explicites d'entrée-sortie. Amazon SageMaker AI prend en charge deux variantes de RFT : RLVR (apprentissage par renforcement avec récompenses vérifiables) et RLAIF (apprentissage par renforcement à partir de commentaires d'IA).

## RLVR
<a name="technique-rlvr"></a>

Le RLVR utilise une fonction de récompense basée sur un code qui vérifie par programmation si les sorties du modèle sont correctes. Idéal pour les tâches avec des réponses objectivement bonnes ou mauvaises.

### Quand l’utiliser
<a name="rlvr-when-to-use"></a>
+ Votre tâche comporte des réponses correctes vérifiables (mathématiques, code, questions factuelles)
+ Vous pouvez écrire une fonction de notation qui évalue l'exactitude des réponses
+ Vous souhaitez améliorer la précision des faits et réduire les hallucinations

### Format du jeu de données
<a name="rlvr-dataset-format"></a>

Chaque enregistrement contient les métadonnées d'un modèle d'invite et de récompense. La fonction de récompense évalue les réponses générées par le modèle pendant l'entraînement.

```
{
  "data_source": "openai/gsm8k",
  "prompt": [
    {
      "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".",
      "role": "user"
    }
  ],
  "ability": "math",
  "reward_model": {
    "ground_truth": "72",
    "style": "rule"
  }
}
```

Champs obligatoires :
+ `prompt`— tableau d'objets de message avec `role` et `content`
+ `reward_model.style`— réglé sur `"rule"` pour la vérification par programmation
+ `reward_model.ground_truth`— la bonne réponse pour vérification

### Fonctions de récompense prédéfinies
<a name="rlvr-preset-reward-functions"></a>
+ `gsm8k`— Vérification des mathématiques à l'école primaire
+ `prime_code`— Vérification de l'exactitude du code
+ `prime_math`— Vérification du raisonnement mathématique

### Hyperparamètres RLVR LoRa
<a name="hyperparameters-rlvr-lora-rft"></a>

**Note**  
Les tableaux ci-dessous présentent les hyperparamètres disponibles lorsque vous utilisez la personnalisation des modèles [ sans serveur. ](customize-model.md) Les autres hyperparamètres sont prédéfinis par Amazon SageMaker AI à l'aide de valeurs par défaut optimisées. Lorsque vous utilisez [ SageMaker AI Training Jobs ](customizing-models-training-jobs.md) ou [ HyperPod](customizing-models-hyperpod.md), vous pouvez accéder à la liste complète des hyperparamètres disponibles dans les recettes. Consultez le référentiel [ SageMaker AI Recipes ](https://github.com/aws/sagemaker-hyperpod-recipes) pour obtenir une recette et accéder à tous les hyperparamètres.


| Paramètre | Type | Obligatoire ? | Échelle/Valeurs | Description | 
| --- | --- | --- | --- | --- | 
| preset\_reward\_function | chaîne | Obligatoire | gsm8k, prime\_code, prime\_math | Fonction de récompense prédéfinie pour la vérification. | 
| learning\_rate | float | Obligatoire | 1e-07—1e-03 | Taille du pas pour les mises à jour du poids. Réglez le plus bas pour RL (par exemple, 1e-5). | 
| lr\_warmup\_steps\_ratio | float | Obligatoire | 0—1 | Fraction d'étapes pour l'échauffement du LR. | 
| max\_epochs | entier | Obligatoire | 1–100 | Nombre de passages dans l'ensemble de données. | 
| global\_batch\_size | entier | Obligatoire | 128, 256, 512 et 1024 | Nombre total d'échantillons par étape de l'optimiseur. | 
| max\_prompt\_length | entier | Obligatoire | 512—16384 | Nombre maximum de jetons pour une portion rapide. | 
| weight\_decay | float | Obligatoire | 0.0-1.0 | Coefficient de régularisation L2. | 
| clip\_ratio | float | Obligatoire | 0,1 à 1,5 | Paramètre d'écrêtage GRPO. Limite le changement de politique par mise à jour. | 
| kl\_loss\_coef | float | Obligatoire | 0 à 0,1 | Poids de la pénalité de divergence KL. Empêche la dérive des politiques. | 
| rollout\_n | entier | Obligatoire | 1, 2, 4, 8, 16, 32 | Réponses des candidats par invite lors des déploiements. | 
| rollout\_temperature | float | Obligatoire | 0,01 à 2,0 | Température pour la génération du déploiement. | 
| lora\_rank | entier | Obligatoire | 8, 16, 32, 64 et 128 | LoRArang. Dimensionnalité des matrices de bas rang. | 
| lora\_alpha | entier | Obligatoire | 16, 32, 64, 128 et 256 | LoRAfacteur d'échelle. Le LR efficace s'échelonne comme suit alpha/rank : | 
| warmup\_steps | entier | Obligatoire | -1 à 100 | Étapes de préchauffage absolues (-1 pour automatique). | 
| min\_lr | float | Obligatoire | 0.0-1.0 | Taux d'apprentissage plancher minimum. | 
| clip\_ratio\_high | float | Obligatoire | 0,0-0,5 | Seuil d'écrêtage supérieur. | 
| clip\_ratio\_low | float | Obligatoire | 0,0-0,5 | Seuil d'écrêtage inférieur. | 
| temperature | float | Obligatoire | 0,0-2,0 | Température d'échantillonnage pour évaluation. | 
| use\_kl\_loss | boolean | Obligatoire | true, false | Ajoutez une pénalité de divergence KL à la perte. | 
| train\_val\_split\_ratio | float | Facultatif | 0.0-1.0 | Train/validation scission. | 

### Hyperparamètres RLVR FFT
<a name="hyperparameters-rlvr-fft-rft"></a>

Mêmes paramètres que RLVR LoRa sans et. `lora_rank` `lora_alpha`

## RLAIF
<a name="technique-rlaif"></a>

Le RLAIF utilise un autre LLM en tant que juge pour évaluer les réponses modèles en fonction d'une invite de récompense en langage naturel. Idéal pour les tâches dont les critères de qualité sont subjectifs et difficiles à évaluer par programmation.

### Quand l’utiliser
<a name="rlaif-when-to-use"></a>
+ Vos critères de qualité sont subjectifs (serviabilité, sécurité, ton)
+ Vous pouvez décrire à quoi ressemble « bien » en langage naturel
+ Vous souhaitez élargir le feedback au-delà de ce que l'annotation humaine peut fournir

### Format du jeu de données
<a name="rlaif-dataset-format"></a>

Chaque enregistrement contient les métadonnées d'un modèle d'invite et de récompense. Le juge LLM évalue les réponses générées par le modèle pendant la formation.

```
{
  "data_source": "WeOpenML/PandaLM",
  "prompt": [
    {
      "role": "user",
      "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..."
    }
  ],
  "ability": "pairwise-judging",
  "reward_model": {
    "style": "llmj",
    "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..."
  }
}
```

Champs obligatoires :
+ `prompt`— tableau d'objets de message avec `role` et `content`
+ `reward_model.style`— réglé `"llmj"` pour LLM-as-judge
+ `reward_model.ground_truth`— jugement de référence pour l'étalonnage

### Modèles de juges
<a name="rlaif-judge-templates"></a>

Les modèles de juges prédéfinis suivants sont fournis dans le conteneur de formation. Sélectionnez-en un à l'aide de l'`judge_prompt_template`hyperparamètre.
+ `cot.jinja`— Chain-of-thought évaluation
+ `evaluate.jinja`— Évaluation générale de la qualité
+ `faithfulness.jinja`— Fidélité au matériel source
+ `summarize.jinja`— Qualité de la synthèse
+ `grader.jinja`— Rubric-based classement

### Hyperparamètres LoRa RLAIF
<a name="hyperparameters-rlaif-lora-rft"></a>

Mêmes paramètres que RLVR LoRa avec la différence suivante :


| Paramètre | Type | Obligatoire ? | Échelle/Valeurs | Description | 
| --- | --- | --- | --- | --- | 
| judge\_prompt\_template | chaîne | Facultatif | cot.jinja, evaluate.jinja, faithfulness.jinja, summarize.jinja, grader.jinja | Modèle pour l'évaluation des juges LLM. Remplacepreset\_reward\_function. | 

### Hyperparamètres RLAIF FFT
<a name="hyperparameters-rlaif-fft-rft"></a>

Mêmes paramètres que RLAIF LoRa sans et. `lora_rank` `lora_alpha`