04:00
2026-08-10
arxiv.org
artificial-intelligence
GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization
Researchers introduced GRASP (Group-Relative Anonymization via Self-refinement Policy-optimization), a method that uses Group Relative Policy Optimization to train a small on-device language model forβ¦