cd/entity/Two-stage On-Policy Distillation· home entities Two-stage On-Policy Distillation
grep -l @two-stage on-policy distillation /news/*.json | wc -l → 1

Two-stage On-Policy Distillation

mentions 1 type Person feed RSS

// recent coverage 1 mentions

04:00
2026-09-12
arxiv.org
large-language-models

KuaiRP Series Role-playing Models Technical Report

Researchers introduced the KuaiRP series of role-playing models in a technical report, using a multi-stage training pipeline to inject deep domain knowledge without losing general agent capabilities. …

// co-occurs with top 2 entities
// topics top 4 topics