SFT vs DPO vs RFT vs Distillation vs Retrieval

This sheet compares Supervised Fine-Tuning, Direct Preference Optimization, Reinforcement Fine-Tuning, Distillation, Retrieval.

CriterionSupervised Fine-TuningDirect Preference OptimizationReinforcement Fine-TuningDistillationRetrieval
Training signalLabelled input-output pairs, one ideal completionPreferred versus non-preferred response pairsA grader and reward signalA larger model's outputsNone; documents supplied at inference

The verdict, the full comparison, 6 rules and 1 traps are part of AI-300 access. Unlock AI-300.