14:54
2026-07-14
discuss.huggingface.co
artificial-intelligence
DPO Training ruins my model’s conversational coherence
A developer reports that DPO training using Hugging Face's DPOTrainer on a fine-tuned T5 model causes the model to generate repetitive outputs (e.g., 'a a a a a a') and degrade conversational coherenc…