Alignment & Post-Training
SFT, reward modelling, DPO/IPO/KTO/ORPO, model merging, and evaluating an aligned model.
—
0 known
0 to review
Loading deck…
Space to flipSpace flip · ← → move · K known · R review · S shuffle