04:00
2026-09-10
machinebrief.com
machine-learning
Noisy-Space Policy Gradient for Diffusion Policies in Offline Reinforcement Learning
Researchers introduced a noisy-space action-value (Q-)function and a noisy-space policy gradient (NSPG) that trains diffusion policies for offline reinforcement learning without backpropagating througβ¦