UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Wang, Dianyi, Ma, Chaofan, Han, Feng, Wu, Size, Song, Wei, Wang, Yibin, Zhang, Zhixiong, Wang, Tianhang, Wang, Siyuan, Wei, Zhongyu, Wang, Jiaqi
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866918346937597952
author Wang, Dianyi
Ma, Chaofan
Han, Feng
Wu, Size
Song, Wei
Wang, Yibin
Zhang, Zhixiong
Wang, Tianhang
Wang, Siyuan
Wei, Zhongyu
Wang, Jiaqi
author_facet Wang, Dianyi
Ma, Chaofan
Han, Feng
Wu, Size
Song, Wei
Wang, Yibin
Zhang, Zhixiong
Wang, Tianhang
Wang, Siyuan
Wei, Zhongyu
Wang, Jiaqi
contents Unified multimodal models often struggle with complex synthesis tasks that demand deep reasoning, and typically treat text-to-image generation and image editing as isolated capabilities rather than interconnected reasoning steps. To address this, we propose UniReason, a unified framework that harmonizes these two tasks through two complementary reasoning paradigms. We incorporate world knowledge-enhanced textual reasoning into generation to infer implicit knowledge, and leverage editing capabilities for fine-grained editing-like visual refinement to further correct visual errors via self-reflection. This approach unifies generation and editing within a shared architecture, mirroring the human cognitive process of planning followed by refinement. We support this framework by systematically constructing a large-scale reasoning-centric dataset (~300k samples) covering five major knowledge domains (e.g., cultural commonsense, physics, etc.) for textual reasoning, alongside an agent-generated corpus for visual refinement. Extensive experiments demonstrate that UniReason achieves advanced performance on reasoning-intensive benchmarks such as WISE, KrisBench and UniREditBench, while maintaining superior general synthesis capabilities.
format Preprint
id arxiv_https___arxiv_org_abs_2602_02437
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing
Wang, Dianyi
Ma, Chaofan
Han, Feng
Wu, Size
Song, Wei
Wang, Yibin
Zhang, Zhixiong
Wang, Tianhang
Wang, Siyuan
Wei, Zhongyu
Wang, Jiaqi
Computer Vision and Pattern Recognition
Artificial Intelligence
Unified multimodal models often struggle with complex synthesis tasks that demand deep reasoning, and typically treat text-to-image generation and image editing as isolated capabilities rather than interconnected reasoning steps. To address this, we propose UniReason, a unified framework that harmonizes these two tasks through two complementary reasoning paradigms. We incorporate world knowledge-enhanced textual reasoning into generation to infer implicit knowledge, and leverage editing capabilities for fine-grained editing-like visual refinement to further correct visual errors via self-reflection. This approach unifies generation and editing within a shared architecture, mirroring the human cognitive process of planning followed by refinement. We support this framework by systematically constructing a large-scale reasoning-centric dataset (~300k samples) covering five major knowledge domains (e.g., cultural commonsense, physics, etc.) for textual reasoning, alongside an agent-generated corpus for visual refinement. Extensive experiments demonstrate that UniReason achieves advanced performance on reasoning-intensive benchmarks such as WISE, KrisBench and UniREditBench, while maintaining superior general synthesis capabilities.
title UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing
topic Computer Vision and Pattern Recognition
Artificial Intelligence
url https://arxiv.org/abs/2602.02437