CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hao, Xiangzhao, Zhang, Zefeng, Zhang, Zhenyu, Yu, Linhao, Chen, Yao, Zhang, Yiqian, Guo, Haiyun, Wang, Shuohuan, Sun, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models
par: Pan, Jiadong, et autres
Publié: (2026)
par: Pan, Jiadong, et autres
Publié: (2026)
COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence
par: Zhang, Zefeng, et autres
Publié: (2025)
par: Zhang, Zefeng, et autres
Publié: (2025)
TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
par: Hao, Xiangzhao, et autres
Publié: (2026)
par: Hao, Xiangzhao, et autres
Publié: (2026)
ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval
par: Yang, Tianyu, et autres
Publié: (2026)
par: Yang, Tianyu, et autres
Publié: (2026)
UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval
par: Guo, Hongyu, et autres
Publié: (2025)
par: Guo, Hongyu, et autres
Publié: (2025)
WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval
par: Wang, Tianyue, et autres
Publié: (2026)
par: Wang, Tianyue, et autres
Publié: (2026)
Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
par: Zhao, Shanshan, et autres
Publié: (2025)
par: Zhao, Shanshan, et autres
Publié: (2025)
PLUME: Latent Reasoning Based Universal Multimodal Embedding
par: He, Chenwei, et autres
Publié: (2026)
par: He, Chenwei, et autres
Publié: (2026)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
par: Xie, Wulin, et autres
Publié: (2025)
par: Xie, Wulin, et autres
Publié: (2025)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
Planning with Unified Multimodal Models
par: Sun, Yihao, et autres
Publié: (2025)
par: Sun, Yihao, et autres
Publié: (2025)
Unified Reward Model for Multimodal Understanding and Generation
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
par: Yao, Xincheng, et autres
Publié: (2026)
par: Yao, Xincheng, et autres
Publié: (2026)
Native Audio-Visual Alignment for Generation
par: Ji, Longbin, et autres
Publié: (2026)
par: Ji, Longbin, et autres
Publié: (2026)
ToLo: A Two-Stage, Training-Free Layout-To-Image Generation Framework For High-Overlap Layouts
par: Huang, Linhao, et autres
Publié: (2025)
par: Huang, Linhao, et autres
Publié: (2025)
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
par: Sun, Nan, et autres
Publié: (2025)
par: Sun, Nan, et autres
Publié: (2025)
Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning
par: Chen, Mingrui, et autres
Publié: (2025)
par: Chen, Mingrui, et autres
Publié: (2025)
Referring Expression Instance Retrieval and A Strong End-to-End Baseline
par: Hao, Xiangzhao, et autres
Publié: (2025)
par: Hao, Xiangzhao, et autres
Publié: (2025)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
par: Sun, Jianwen, et autres
Publié: (2025)
par: Sun, Jianwen, et autres
Publié: (2025)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
par: Ma, Lichen, et autres
Publié: (2026)
par: Ma, Lichen, et autres
Publié: (2026)
Omni-View: Unlocking How Generation Facilitates Understanding in Unified 3D Model based on Multiview images
par: Hu, JiaKui, et autres
Publié: (2025)
par: Hu, JiaKui, et autres
Publié: (2025)
Hierarchical Gaussian Mixture Normalizing Flow Modeling for Unified Anomaly Detection
par: Yao, Xincheng, et autres
Publié: (2024)
par: Yao, Xincheng, et autres
Publié: (2024)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
par: Qu, Liao, et autres
Publié: (2024)
par: Qu, Liao, et autres
Publié: (2024)
GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors
par: Yu, Haodong, et autres
Publié: (2026)
par: Yu, Haodong, et autres
Publié: (2026)
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
par: He, Zefeng, et autres
Publié: (2025)
par: He, Zefeng, et autres
Publié: (2025)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
par: Zou, Jialv, et autres
Publié: (2025)
par: Zou, Jialv, et autres
Publié: (2025)
Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation
par: Zhang, Jihai, et autres
Publié: (2025)
par: Zhang, Jihai, et autres
Publié: (2025)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
par: Liu, Zeyu, et autres
Publié: (2026)
par: Liu, Zeyu, et autres
Publié: (2026)
JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
par: Song, Lin, et autres
Publié: (2026)
par: Song, Lin, et autres
Publié: (2026)
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
par: Yu, Linhao, et autres
Publié: (2025)
par: Yu, Linhao, et autres
Publié: (2025)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
par: Wu, Size, et autres
Publié: (2025)
par: Wu, Size, et autres
Publié: (2025)
Can Multimodal Large Language Models Understand Spatial Relations?
par: Liu, Jingping, et autres
Publié: (2025)
par: Liu, Jingping, et autres
Publié: (2025)
MMGen: Unified Multi-modal Image Generation and Understanding in One Go
par: Wang, Jiepeng, et autres
Publié: (2025)
par: Wang, Jiepeng, et autres
Publié: (2025)
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
par: Wang, Yuran, et autres
Publié: (2025)
par: Wang, Yuran, et autres
Publié: (2025)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
par: Xu, Pengcheng, et autres
Publié: (2026)
par: Xu, Pengcheng, et autres
Publié: (2026)
Unified Personalized Understanding, Generating and Editing
par: Zhong, Yu, et autres
Publié: (2026)
par: Zhong, Yu, et autres
Publié: (2026)
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
par: Song, Yuxin, et autres
Publié: (2025)
par: Song, Yuxin, et autres
Publié: (2025)
HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
par: Wang, Xiang, et autres
Publié: (2025)
par: Wang, Xiang, et autres
Publié: (2025)
Documents similaires
-
Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models
par: Pan, Jiadong, et autres
Publié: (2026) -
COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence
par: Zhang, Zefeng, et autres
Publié: (2025) -
TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
par: Hao, Xiangzhao, et autres
Publié: (2026) -
ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval
par: Yang, Tianyu, et autres
Publié: (2026) -
UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval
par: Guo, Hongyu, et autres
Publié: (2025)