GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization
Researchers introduced GRASP (Group-Relative Anonymization via Self-refinement Policy-optimization), a method that uses Group Relative Policy Optimization to train a small on-device language model for…