Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Yibo, Wu, Tao, Jiang, Rui, Lu, Yehao, Cai, Chaoxiang, Qin, Zequn, Li, Xi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
par: Wu, Tao, et autres
Publié: (2025)
par: Wu, Tao, et autres
Publié: (2025)
Long-Tailed Distribution-Aware Router For Mixture-of-Experts in Large Vision-Language Model
par: Cai, Chaoxiang, et autres
Publié: (2025)
par: Cai, Chaoxiang, et autres
Publié: (2025)
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
CamI2V: Camera-Controlled Image-to-Video Diffusion Model
par: Zheng, Guangcong, et autres
Publié: (2024)
par: Zheng, Guangcong, et autres
Publié: (2024)
Free-Lunch Color-Texture Disentanglement for Stylized Image Generation
par: Qin, Jiang, et autres
Publié: (2025)
par: Qin, Jiang, et autres
Publié: (2025)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
par: Jiao, Yang, et autres
Publié: (2025)
par: Jiao, Yang, et autres
Publié: (2025)
Energy-Calibrated VAE with Test Time Free Lunch
par: Luo, Yihong, et autres
Publié: (2023)
par: Luo, Yihong, et autres
Publié: (2023)
UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
par: Tian, Rui, et autres
Publié: (2025)
par: Tian, Rui, et autres
Publié: (2025)
FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers
par: Zhang, Yanbing, et autres
Publié: (2025)
par: Zhang, Yanbing, et autres
Publié: (2025)
Free Lunch for Generating Effective Outlier Supervision
par: Pei, Sen, et autres
Publié: (2023)
par: Pei, Sen, et autres
Publié: (2023)
SNR-Edit: Structure-Aware Noise Rectification for Inversion-Free Flow-Based Editing
par: Jiang, Lifan, et autres
Publié: (2026)
par: Jiang, Lifan, et autres
Publié: (2026)
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
par: Wu, Size, et autres
Publié: (2025)
par: Wu, Size, et autres
Publié: (2025)
InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation
par: Wang, Haofan, et autres
Publié: (2024)
par: Wang, Haofan, et autres
Publié: (2024)
Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation
par: Lyu, Yuanhuiyi, et autres
Publié: (2025)
par: Lyu, Yuanhuiyi, et autres
Publié: (2025)
Sparse-to-Dense: A Free Lunch for Lossless Acceleration of Video Understanding in LLMs
par: Zhang, Xuan, et autres
Publié: (2025)
par: Zhang, Xuan, et autres
Publié: (2025)
MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation
par: Shen, Tao, et autres
Publié: (2025)
par: Shen, Tao, et autres
Publié: (2025)
Dynamic-DINO: Fine-Grained Mixture of Experts Tuning for Real-time Open-Vocabulary Object Detection
par: Lu, Yehao, et autres
Publié: (2025)
par: Lu, Yehao, et autres
Publié: (2025)
OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation
par: Wu, Size, et autres
Publié: (2025)
par: Wu, Size, et autres
Publié: (2025)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
par: Han, Mingfei, et autres
Publié: (2025)
par: Han, Mingfei, et autres
Publié: (2025)
Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
par: Cai, Xu, et autres
Publié: (2025)
par: Cai, Xu, et autres
Publié: (2025)
Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models
par: Pan, Jiadong, et autres
Publié: (2026)
par: Pan, Jiadong, et autres
Publié: (2026)
RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
par: Qu, Liao, et autres
Publié: (2024)
par: Qu, Liao, et autres
Publié: (2024)
FreeInv: Free Lunch for Improving DDIM Inversion
par: Bao, Yuxiang, et autres
Publié: (2025)
par: Bao, Yuxiang, et autres
Publié: (2025)
Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models
par: Dang, Yunkai, et autres
Publié: (2026)
par: Dang, Yunkai, et autres
Publié: (2026)
Leveraging Semantic Attribute Binding for Free-Lunch Color Control in Diffusion Models
par: Laria, Héctor, et autres
Publié: (2025)
par: Laria, Héctor, et autres
Publié: (2025)
CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
par: Qiu, Haonan, et autres
Publié: (2025)
par: Qiu, Haonan, et autres
Publié: (2025)
Switch EMA: A Free Lunch for Better Flatness and Sharpness
par: Li, Siyuan, et autres
Publié: (2024)
par: Li, Siyuan, et autres
Publié: (2024)
CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion
par: Xi, Dianbing, et autres
Publié: (2025)
par: Xi, Dianbing, et autres
Publié: (2025)
Examining the Commitments and Difficulties Inherent in Multimodal Foundation Models for Street View Imagery
par: Yang, Zhenyuan, et autres
Publié: (2024)
par: Yang, Zhenyuan, et autres
Publié: (2024)
HeightFormer: Explicit Height Modeling without Extra Data for Camera-only 3D Object Detection in Bird's Eye View
par: Wu, Yiming, et autres
Publié: (2023)
par: Wu, Yiming, et autres
Publié: (2023)
FreeCond: Free Lunch in the Input Conditions of Text-Guided Inpainting
par: Hsiao, Teng-Fang, et autres
Publié: (2024)
par: Hsiao, Teng-Fang, et autres
Publié: (2024)
Unified Reward Model for Multimodal Understanding and Generation
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
Tuning-Free Noise Rectification for High Fidelity Image-to-Video Generation
par: Li, Weijie, et autres
Publié: (2024)
par: Li, Weijie, et autres
Publié: (2024)
Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
par: Lu, Yanzuo, et autres
Publié: (2025)
par: Lu, Yanzuo, et autres
Publié: (2025)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction
par: Tian, Jiahao, et autres
Publié: (2026)
par: Tian, Jiahao, et autres
Publié: (2026)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
All Patches Matter, More Patches Better: Enhance AI-Generated Image Detection via Panoptic Patch Learning
par: Yang, Zheng, et autres
Publié: (2025)
par: Yang, Zheng, et autres
Publié: (2025)
Documents similaires
-
MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
par: Wu, Tao, et autres
Publié: (2025) -
Long-Tailed Distribution-Aware Router For Mixture-of-Experts in Large Vision-Language Model
par: Cai, Chaoxiang, et autres
Publié: (2025) -
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
par: Wang, Zehan, et autres
Publié: (2024) -
CamI2V: Camera-Controlled Image-to-Video Diffusion Model
par: Zheng, Guangcong, et autres
Publié: (2024) -
Free-Lunch Color-Texture Disentanglement for Stylized Image Generation
par: Qin, Jiang, et autres
Publié: (2025)