00:00
2026-09-03
huggingface.co
machine-learning
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
Fine-tuning LiquidAI's LFM2.5-350M model with Group Relative Policy Optimization (GRPO) using the TRL library improved its IFStruct benchmark score from 22.6% to 29.7% in just 100 training steps, acco…