Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Tong, Yujun, Chang, Dongliang, Yin, Zijin, Liu, Xintong, Fang, Yuanchen, Ma, Zhanyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding
di: Chen, Junhan, et al.
Pubblicazione: (2026)
di: Chen, Junhan, et al.
Pubblicazione: (2026)
Controllable-Continuous Color Editing in Diffusion Model via Color Mapping
di: Yang, Yuqi, et al.
Pubblicazione: (2025)
di: Yang, Yuqi, et al.
Pubblicazione: (2025)
Multimodal Conditional Information Bottleneck for Generalizable AI-Generated Image Detection
di: Qin, Haotian, et al.
Pubblicazione: (2025)
di: Qin, Haotian, et al.
Pubblicazione: (2025)
Benchmarking Segmentation Models with Mask-Preserved Attribute Editing
di: Yin, Zijin, et al.
Pubblicazione: (2024)
di: Yin, Zijin, et al.
Pubblicazione: (2024)
IncreFA: Breaking the Static Wall of Generative Model Attribution
di: Qin, Haotian, et al.
Pubblicazione: (2026)
di: Qin, Haotian, et al.
Pubblicazione: (2026)
Towards Privacy-Preserving Fine-Grained Visual Classification via Hierarchical Learning from Label Proportions
di: Chang, Jinyi, et al.
Pubblicazione: (2025)
di: Chang, Jinyi, et al.
Pubblicazione: (2025)
MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation
di: Yang, Ling, et al.
Pubblicazione: (2023)
di: Yang, Ling, et al.
Pubblicazione: (2023)
Recolour What Matters: Region-Aware Colour Editing via Token-Level Diffusion
di: Yang, Yuqi, et al.
Pubblicazione: (2026)
di: Yang, Yuqi, et al.
Pubblicazione: (2026)
Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing
di: Yin, Zijin, et al.
Pubblicazione: (2026)
di: Yin, Zijin, et al.
Pubblicazione: (2026)
Polyp-E: Benchmarking the Robustness of Deep Segmentation Models via Polyp Editing
di: Wei, Runpu, et al.
Pubblicazione: (2024)
di: Wei, Runpu, et al.
Pubblicazione: (2024)
ConMo: Controllable Motion Disentanglement and Recomposition for Zero-Shot Motion Transfer
di: Gao, Jiayi, et al.
Pubblicazione: (2025)
di: Gao, Jiayi, et al.
Pubblicazione: (2025)
PGP-SAM: Prototype-Guided Prompt Learning for Efficient Few-Shot Medical Image Segmentation
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation
di: Wang, Zhanyu, et al.
Pubblicazione: (2023)
di: Wang, Zhanyu, et al.
Pubblicazione: (2023)
MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding
di: Zhao, Sirui, et al.
Pubblicazione: (2025)
di: Zhao, Sirui, et al.
Pubblicazione: (2025)
Generative Visual Chain-of-Thought for Image Editing
di: Yin, Zijin, et al.
Pubblicazione: (2026)
di: Yin, Zijin, et al.
Pubblicazione: (2026)
Can Multimodal Large Language Models Truly Understand Small Objects?
di: Han, Fujun, et al.
Pubblicazione: (2026)
di: Han, Fujun, et al.
Pubblicazione: (2026)
Toward Generalizable Forgery Detection and Reasoning
di: Gao, Yueying, et al.
Pubblicazione: (2025)
di: Gao, Yueying, et al.
Pubblicazione: (2025)
VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model
di: Zhuang, Xianwei, et al.
Pubblicazione: (2025)
di: Zhuang, Xianwei, et al.
Pubblicazione: (2025)
Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding
di: Liang, Yongyuan, et al.
Pubblicazione: (2025)
di: Liang, Yongyuan, et al.
Pubblicazione: (2025)
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025)
di: Liu, Jingping, et al.
Pubblicazione: (2025)
FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning
di: Hu, Zhuozhao, et al.
Pubblicazione: (2025)
di: Hu, Zhuozhao, et al.
Pubblicazione: (2025)
Vidi: Large Multimodal Models for Video Understanding and Editing
di: Vidi Team, et al.
Pubblicazione: (2025)
di: Vidi Team, et al.
Pubblicazione: (2025)
AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
di: Zhou, Ziyin, et al.
Pubblicazione: (2025)
di: Zhou, Ziyin, et al.
Pubblicazione: (2025)
I-Max: Maximize the Resolution Potential of Pre-trained Rectified Flow Transformers with Projected Flow
di: Du, Ruoyi, et al.
Pubblicazione: (2024)
di: Du, Ruoyi, et al.
Pubblicazione: (2024)
GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving
di: Xing, Zebin, et al.
Pubblicazione: (2025)
di: Xing, Zebin, et al.
Pubblicazione: (2025)
Evaluating Attribute Comprehension in Large Vision-Language Models
di: Zhang, Haiwen, et al.
Pubblicazione: (2024)
di: Zhang, Haiwen, et al.
Pubblicazione: (2024)
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
di: Zhang, Huichao, et al.
Pubblicazione: (2026)
di: Zhang, Huichao, et al.
Pubblicazione: (2026)
HermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and Generation
di: Yang, Ling, et al.
Pubblicazione: (2025)
di: Yang, Ling, et al.
Pubblicazione: (2025)
JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation
di: Ma, Yiyang, et al.
Pubblicazione: (2024)
di: Ma, Yiyang, et al.
Pubblicazione: (2024)
AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models
di: Zhou, Zijin, et al.
Pubblicazione: (2026)
di: Zhou, Zijin, et al.
Pubblicazione: (2026)
Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation
di: Li, Shufan, et al.
Pubblicazione: (2025)
di: Li, Shufan, et al.
Pubblicazione: (2025)
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
di: Guo, Yuchen, et al.
Pubblicazione: (2026)
di: Guo, Yuchen, et al.
Pubblicazione: (2026)
MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
di: Chen, Jian, et al.
Pubblicazione: (2025)
di: Chen, Jian, et al.
Pubblicazione: (2025)
Contextual AD Narration with Interleaved Multimodal Sequence
di: Wang, Hanlin, et al.
Pubblicazione: (2024)
di: Wang, Hanlin, et al.
Pubblicazione: (2024)
Vidi2.5: Large Multimodal Models for Video Understanding and Creation
di: Vidi Team, et al.
Pubblicazione: (2025)
di: Vidi Team, et al.
Pubblicazione: (2025)
CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation
di: Wang, Xinran, et al.
Pubblicazione: (2025)
di: Wang, Xinran, et al.
Pubblicazione: (2025)
SpecGen: Neural Spectral BRDF Generation via Spectral-Spatial Tri-plane Aggregation
di: Jin, Zhenyu, et al.
Pubblicazione: (2025)
di: Jin, Zhenyu, et al.
Pubblicazione: (2025)
OmniEraser: Remove Objects and Their Effects in Images with Paired Video-Frame Data
di: Wei, Runpu, et al.
Pubblicazione: (2025)
di: Wei, Runpu, et al.
Pubblicazione: (2025)
Orientation Matters: Making 3D Generative Models Orientation-Aligned
di: Lu, Yichong, et al.
Pubblicazione: (2025)
di: Lu, Yichong, et al.
Pubblicazione: (2025)
LaViDa: A Large Diffusion Language Model for Multimodal Understanding
di: Li, Shufan, et al.
Pubblicazione: (2025)
di: Li, Shufan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding
di: Chen, Junhan, et al.
Pubblicazione: (2026) -
Controllable-Continuous Color Editing in Diffusion Model via Color Mapping
di: Yang, Yuqi, et al.
Pubblicazione: (2025) -
Multimodal Conditional Information Bottleneck for Generalizable AI-Generated Image Detection
di: Qin, Haotian, et al.
Pubblicazione: (2025) -
Benchmarking Segmentation Models with Mask-Preserved Attribute Editing
di: Yin, Zijin, et al.
Pubblicazione: (2024) -
IncreFA: Breaking the Static Wall of Generative Model Attribution
di: Qin, Haotian, et al.
Pubblicazione: (2026)