Making Open-Source Text LLM Watermarks Durable Against Merging
Researchers have developed Merge-Adversarial Training, the first method to make open-source LLM watermarks durable against model merging, achieving up to +51 percentage points true positive rate at 1% false positive rate…