SFT vs DPO vs RFT vs Distillation vs Retrieval
This sheet compares Supervised Fine-Tuning, Direct Preference Optimization, Reinforcement Fine-Tuning, Distillation, Retrieval.
| Criterion | Supervised Fine-Tuning | Direct Preference Optimization | Reinforcement Fine-Tuning | Distillation | Retrieval |
|---|---|---|---|---|---|
| Training signal | Labelled input-output pairs, one ideal completion | Preferred versus non-preferred response pairs | A grader and reward signal | A larger model's outputs | None; documents supplied at inference |
The verdict, the full comparison, 6 rules and 1 traps are part of AI-300 access. Unlock AI-300.