04:00
2026-09-25
arxiv.org
artificial-intelligence
DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs
Researchers introduced Dual-Entropy Enhanced Policy Optimization (DEEPO), a dual-stage reinforcement learning method that reduces hallucination in multimodal large language models by combining semantiβ¦