{"slug": "ufo-chain-of-evaluation-for-omni-condition-alignment-in-multi-modal-image", "title": "UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation", "summary": "Researchers introduced UFO, a unified framework for omni-condition alignment evaluation in multi-modal image generation, claiming it is the first to assess all modal conditions simultaneously rather than in isolation. UFO uses an Atomized Chain-of-Evaluation paradigm that decomposes alignment into fine-grained Atomic Evaluation Units (AEUs) sorted into modality-relevance classes and verified via general or dedicated functional calls. The authors report UFO achieves the highest correlation with human evaluation preferences, an average improvement of 15.25%, and also present UFO-Bench, a benchmark for evaluating customization models under interactions of textual and visual conditions.", "body_md": "arXiv:2609.12397v1 Announce Type: new \nAbstract: Multi-modal image generation, particularly subject-driven customization, has garnered growing attention in recent years. Despite the rapid advancement of generative models, their evaluation remains largely lagging. Existing methods, whether embedding-based or Multi-modal Large Language Model (MLLM)-based, evaluate alignment with each modal condition in isolation, which contradicts the simultaneous condition alignment objective of multi-modal image generation, leading to poor consistency with human judgments. To address this challenge, we propose UFO, the first unified framework for omni-condition alignment simultaneous evaluation. Specifically, UFO introduces a novel Atomized Chain-of-Evaluation paradigm, \\emph{i.e.}, it first decomposes omni-condition alignment into a sequential chain of fine-grained, disentangled Atomic Evaluation Units (AEUs), categorizes them into distinct modality-relevance classes, and then employs general or dedicated functional calls for accurate verification of different AEU types. Experimental results demonstrate that UFO achieves the highest correlation with human evaluation preferences, delivering an average improvement of 15.25\\%. Furthermore, we present UFO-Bench, a dedicated benchmark designed to holistically evaluate the performance of existing customization models under the diverse mutual interactions of textual and visual conditions.", "url": "https://wpnews.pro/news/ufo-chain-of-evaluation-for-omni-condition-alignment-in-multi-modal-image", "canonical_source": "https://arxiv.org/abs/2609.12397", "published_at": "2026-09-14 04:00:00+00:00", "updated_at": "2026-09-14 04:27:29.461500+00:00", "lang": "en", "topics": ["generative-ai", "computer-vision", "ai-research", "large-language-models", "ai-products"], "entities": ["UFO", "UFO-Bench", "Atomized Chain-of-Evaluation", "Atomic Evaluation Units", "arXiv"], "alternates": {"html": "https://wpnews.pro/news/ufo-chain-of-evaluation-for-omni-condition-alignment-in-multi-modal-image", "markdown": "https://wpnews.pro/news/ufo-chain-of-evaluation-for-omni-condition-alignment-in-multi-modal-image.md", "text": "https://wpnews.pro/news/ufo-chain-of-evaluation-for-omni-condition-alignment-in-multi-modal-image.txt", "jsonld": "https://wpnews.pro/news/ufo-chain-of-evaluation-for-omni-condition-alignment-in-multi-modal-image.jsonld"}}