

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

# カスタマイズ手法
<a name="customizing-models-techniques"></a>

カスタマイズ手法は、モデルがデータから学習*する方法*を定義します。各手法には異なるデータセット形式が必要で、独自のハイパーパラメータがあります。所有しているデータと達成したい動作に基づいて を選択します。
+ **[SFT](customizing-models-sft.md)** (教師ありファインチューニング) — ラベル付きプロンプトとレスポンスのペアをトレーニングします。モデル固有のスタイル、形式、またはドメインの知識を教えるのに最適です。
+ **[DPO](customizing-models-dpo.md)** (直接設定の最適化) — 優先レスポンスペアと拒否レスポンスペアをトレーニングします。人間の好みに合わせて望ましくない出力を回避するのに最適です。
+ **[RFT](customizing-models-rft.md)** (強化ファインチューニング) — コードベースの検証 (**RLVR**) または LLM 審査員 (**RLAIF**) の報酬シグナルを介して最適化します。事実の精度や主観的な品質を向上させるのに最適です。
+ **[マルチターン強化学習](model-customize-mtrl.md)** (Multi-Turn Reinforcement Learning) — コンテキストが増大する複数ステップのエージェントタスク用にエージェントをトレーニングします。
+ **[継続的なカスタマイズ](customizing-models-continuous.md)** (継続的なカスタマイズ) — 複数の手法を順番に連鎖させます (SFT → DPO → RLVR など）。[LoRA](customizing-models-lora.md) トレーニングタイプが必要です。

各手法は、[LoRA](customizing-models-lora.md) または [FFT](customizing-models-fft.md) トレーニングタイプと組み合わせることができます。どちらを選択するかの詳細については、[トレーニングタイプ](customizing-models-training-types.md)「」を参照してください。