{"slug": "iadd-improving-alignment-and-diversity-in-diffusion-policy-optimization", "title": "iADD: Improving Alignment and Diversity in Diffusion Policy Optimization", "summary": "Researchers propose iADD, a method for reinforcement-learning post-training of diffusion models that aims to improve alignment with reward functions without sacrificing output diversity, addressing a limitation of Denoising Diffusion Policy Optimization (DDPO). DDPO optimizes a reverse diffusion process under a reward function, but the paper states current reward-optimization approaches achieve this at the cost of diversity and quality. The work targets the trade-off between reward alignment and sample diversity in diffusion policy optimization.", "body_md": "Reinforcement learning based post training of diffusion models, such as Denoising Diffusion Policy Optimization (DDPO), optimizes a reverse diffusion process under a reward function. However, current approaches to reward optimizations do so at the cost of diversity and quality. In this paper, we pro", "url": "https://wpnews.pro/news/iadd-improving-alignment-and-diversity-in-diffusion-policy-optimization", "canonical_source": "https://aiflash.com/news/132142/", "published_at": "2026-10-06 16:30:07+00:00", "updated_at": "2026-10-06 16:49:33.231334+00:00", "lang": "en", "topics": ["machine-learning", "generative-ai", "ai-research", "artificial-intelligence"], "entities": ["iADD", "Denoising Diffusion Policy Optimization", "DDPO"], "also_reported_by": [], "alternates": {"html": "https://wpnews.pro/news/iadd-improving-alignment-and-diversity-in-diffusion-policy-optimization", "markdown": "https://wpnews.pro/news/iadd-improving-alignment-and-diversity-in-diffusion-policy-optimization.md", "text": "https://wpnews.pro/news/iadd-improving-alignment-and-diversity-in-diffusion-policy-optimization.txt", "jsonld": "https://wpnews.pro/news/iadd-improving-alignment-and-diversity-in-diffusion-policy-optimization.jsonld"}}