ByteDance adapts GRPO for enhanced post-training model capabilities
ByteDance's Seed team, working with University of Hong Kong researchers, adapted DeepSeek's Group Relative Policy Optimization (GRPO) technique into a visual-generation framework called DanceGRPO, rep…