ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Runhui, Wang, Chunwei, Yang, Junwei, Lu, Guansong, Yuan, Yunlong, Han, Jianhua, Hou, Lu, Zhang, Wei, Hong, Lanqing, Zhao, Hengshuang, Xu, Hang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance
di: Wang, Chunwei, et al.
Pubblicazione: (2024)
di: Wang, Chunwei, et al.
Pubblicazione: (2024)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
di: Huang, Runhui, et al.
Pubblicazione: (2024)
di: Huang, Runhui, et al.
Pubblicazione: (2024)
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
di: Liu, Zhe, et al.
Pubblicazione: (2025)
di: Liu, Zhe, et al.
Pubblicazione: (2025)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
di: Chen, Zisheng, et al.
Pubblicazione: (2025)
di: Chen, Zisheng, et al.
Pubblicazione: (2025)
LayerDiff: Exploring Text-guided Multi-layered Composable Image Synthesis via Layer-Collaborative Diffusion Model
di: Huang, Runhui, et al.
Pubblicazione: (2024)
di: Huang, Runhui, et al.
Pubblicazione: (2024)
UNIT: Unifying Image and Text Recognition in One Vision Encoder
di: Zhu, Yi, et al.
Pubblicazione: (2024)
di: Zhu, Yi, et al.
Pubblicazione: (2024)
Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data
di: Wang, Haonan, et al.
Pubblicazione: (2023)
di: Wang, Haonan, et al.
Pubblicazione: (2023)
Brick-Diffusion: Generating Long Videos with Brick-to-Wall Denoising
di: Yuan, Yunlong, et al.
Pubblicazione: (2025)
di: Yuan, Yunlong, et al.
Pubblicazione: (2025)
Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
di: Nie, Ming, et al.
Pubblicazione: (2026)
di: Nie, Ming, et al.
Pubblicazione: (2026)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
di: Song, Wei, et al.
Pubblicazione: (2025)
di: Song, Wei, et al.
Pubblicazione: (2025)
AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
di: Huang, Runhui, et al.
Pubblicazione: (2026)
di: Huang, Runhui, et al.
Pubblicazione: (2026)
FreqPrior: Improving Video Diffusion Models with Frequency Filtering Gaussian Noise
di: Yuan, Yunlong, et al.
Pubblicazione: (2025)
di: Yuan, Yunlong, et al.
Pubblicazione: (2025)
RealignDiff: Boosting Text-to-Image Diffusion Model with Coarse-to-fine Semantic Re-alignment
di: Jiang, Zutao, et al.
Pubblicazione: (2023)
di: Jiang, Zutao, et al.
Pubblicazione: (2023)
From Summary to Action: Enhancing Large Language Models for Complex Tasks with Open World APIs
di: Liu, Yulong, et al.
Pubblicazione: (2024)
di: Liu, Yulong, et al.
Pubblicazione: (2024)
PanGu-Draw: Advancing Resource-Efficient Text-to-Image Synthesis with Time-Decoupled Training and Reusable Coop-Diffusion
di: Lu, Guansong, et al.
Pubblicazione: (2023)
di: Lu, Guansong, et al.
Pubblicazione: (2023)
Efficient Multi-modal Large Language Models via Visual Token Grouping
di: Huang, Minbin, et al.
Pubblicazione: (2024)
di: Huang, Minbin, et al.
Pubblicazione: (2024)
PaMi-VDPO: Mitigating Video Hallucinations by Prompt-Aware Multi-Instance Video Preference Learning
di: Ding, Xinpeng, et al.
Pubblicazione: (2025)
di: Ding, Xinpeng, et al.
Pubblicazione: (2025)
SaDiT: Efficient Protein Backbone Design via Latent Structural Tokenization and Diffusion Transformers
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
Implicit Concept Removal of Diffusion Models
di: Liu, Zhili, et al.
Pubblicazione: (2023)
di: Liu, Zhili, et al.
Pubblicazione: (2023)
FocalClick-XL: Towards Unified and High-quality Interactive Segmentation
di: Chen, Xi, et al.
Pubblicazione: (2025)
di: Chen, Xi, et al.
Pubblicazione: (2025)
EDEN: Enhanced Diffusion for High-quality Large-motion Video Frame Interpolation
di: Zhang, Zihao, et al.
Pubblicazione: (2025)
di: Zhang, Zihao, et al.
Pubblicazione: (2025)
Revisiting MLLM Token Technology through the Lens of Classical Visual Coding
di: Liu, Jinming, et al.
Pubblicazione: (2025)
di: Liu, Jinming, et al.
Pubblicazione: (2025)
HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
InstructX: Towards Unified Visual Editing with MLLM Guidance
di: Mou, Chong, et al.
Pubblicazione: (2025)
di: Mou, Chong, et al.
Pubblicazione: (2025)
PUMA: Empowering Unified MLLM with Multi-granular Visual Generation
di: Fang, Rongyao, et al.
Pubblicazione: (2024)
di: Fang, Rongyao, et al.
Pubblicazione: (2024)
Task-customized Masked AutoEncoder via Mixture of Cluster-conditional Experts
di: Liu, Zhili, et al.
Pubblicazione: (2024)
di: Liu, Zhili, et al.
Pubblicazione: (2024)
MedVeriSeg: Teaching MLLM-Based Medical Segmentation Models to Verify Query Validity Without Extra Training
di: Lu, Ziqian, et al.
Pubblicazione: (2026)
di: Lu, Ziqian, et al.
Pubblicazione: (2026)
Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM
di: Chi, Donghwan, et al.
Pubblicazione: (2025)
di: Chi, Donghwan, et al.
Pubblicazione: (2025)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
di: Xiang, Kun, et al.
Pubblicazione: (2024)
di: Xiang, Kun, et al.
Pubblicazione: (2024)
Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
di: Li, Long, et al.
Pubblicazione: (2025)
di: Li, Long, et al.
Pubblicazione: (2025)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
di: Nie, Yunshuang, et al.
Pubblicazione: (2026)
di: Nie, Yunshuang, et al.
Pubblicazione: (2026)
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
di: Yu, Hanxun, et al.
Pubblicazione: (2026)
di: Yu, Hanxun, et al.
Pubblicazione: (2026)
Boosting Chart-to-Code Generation in MLLM via Dual Preference-Guided Refinement
di: Zhang, Zhihan, et al.
Pubblicazione: (2025)
di: Zhang, Zhihan, et al.
Pubblicazione: (2025)
EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions
di: Chen, Kai, et al.
Pubblicazione: (2024)
di: Chen, Kai, et al.
Pubblicazione: (2024)
Can Atomic Step Decomposition Enhance the Self-structured Reasoning of Multimodal Large Models?
di: Xiang, Kun, et al.
Pubblicazione: (2025)
di: Xiang, Kun, et al.
Pubblicazione: (2025)
Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
Seg-VAR: Image Segmentation with Visual Autoregressive Modeling
di: Zheng, Rongkun, et al.
Pubblicazione: (2025)
di: Zheng, Rongkun, et al.
Pubblicazione: (2025)
Exploring MLLM-Diffusion Information Transfer with MetaCanvas
di: Lin, Han, et al.
Pubblicazione: (2025)
di: Lin, Han, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance
di: Wang, Chunwei, et al.
Pubblicazione: (2024) -
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
di: Huang, Runhui, et al.
Pubblicazione: (2024) -
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
di: Liu, Zhe, et al.
Pubblicazione: (2025) -
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
di: Chen, Zisheng, et al.
Pubblicazione: (2025) -
LayerDiff: Exploring Text-guided Multi-layered Composable Image Synthesis via Layer-Collaborative Diffusion Model
di: Huang, Runhui, et al.
Pubblicazione: (2024)