Understanding and Harnessing Sparsity in Unified Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Shwai, Deng, Chaorui, Li, Ang, Yan, Shen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rethinking Pruning for Vision-Language Models: Strategies for Effective Sparsity and Performance Restoration
di: He, Shwai, et al.
Pubblicazione: (2024)
di: He, Shwai, et al.
Pubblicazione: (2024)
UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding
di: Xu, Chenkai, et al.
Pubblicazione: (2025)
di: Xu, Chenkai, et al.
Pubblicazione: (2025)
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
di: Zhang, Huichao, et al.
Pubblicazione: (2026)
di: Zhang, Huichao, et al.
Pubblicazione: (2026)
UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?
di: Wen, Zimo, et al.
Pubblicazione: (2026)
di: Wen, Zimo, et al.
Pubblicazione: (2026)
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
di: Li, Yi, et al.
Pubblicazione: (2025)
di: Li, Yi, et al.
Pubblicazione: (2025)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
di: Fan, Yingqi, et al.
Pubblicazione: (2026)
di: Fan, Yingqi, et al.
Pubblicazione: (2026)
Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
di: LASA Team, et al.
Pubblicazione: (2025)
di: LASA Team, et al.
Pubblicazione: (2025)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding
di: Jiang, Yibo, et al.
Pubblicazione: (2026)
di: Jiang, Yibo, et al.
Pubblicazione: (2026)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding
di: Liang, Yongyuan, et al.
Pubblicazione: (2025)
di: Liang, Yongyuan, et al.
Pubblicazione: (2025)
UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models
di: Li, Jinke, et al.
Pubblicazione: (2025)
di: Li, Jinke, et al.
Pubblicazione: (2025)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
di: Qu, Liao, et al.
Pubblicazione: (2024)
di: Qu, Liao, et al.
Pubblicazione: (2024)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
di: Hong, Jixiang, et al.
Pubblicazione: (2025)
di: Hong, Jixiang, et al.
Pubblicazione: (2025)
Lance: Unified Multimodal Modeling by Multi-Task Synergy
di: Fu, Fengyi, et al.
Pubblicazione: (2026)
di: Fu, Fengyi, et al.
Pubblicazione: (2026)
Semantic Generative Tuning for Unified Multimodal Models
di: Yu, Songsong, et al.
Pubblicazione: (2026)
di: Yu, Songsong, et al.
Pubblicazione: (2026)
Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
di: Chen, Xiaokang, et al.
Pubblicazione: (2025)
di: Chen, Xiaokang, et al.
Pubblicazione: (2025)
UniPTS: A Unified Framework for Proficient Post-Training Sparsity
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
di: Fang, Chengyu, et al.
Pubblicazione: (2026)
di: Fang, Chengyu, et al.
Pubblicazione: (2026)
Unified Modeling Enhanced Multimodal Learning for Precision Neuro-Oncology
di: Yi, Huahui, et al.
Pubblicazione: (2024)
di: Yi, Huahui, et al.
Pubblicazione: (2024)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
di: Sun, Jianwen, et al.
Pubblicazione: (2025)
di: Sun, Jianwen, et al.
Pubblicazione: (2025)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
di: Jiao, Yang, et al.
Pubblicazione: (2025)
di: Jiao, Yang, et al.
Pubblicazione: (2025)
Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
di: Ye, Sen, et al.
Pubblicazione: (2026)
di: Ye, Sen, et al.
Pubblicazione: (2026)
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
di: Li, Yinghui, et al.
Pubblicazione: (2026)
di: Li, Yinghui, et al.
Pubblicazione: (2026)
COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework
di: Dong, Xin, et al.
Pubblicazione: (2024)
di: Dong, Xin, et al.
Pubblicazione: (2024)
Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights
di: Tian, Juanxi, et al.
Pubblicazione: (2025)
di: Tian, Juanxi, et al.
Pubblicazione: (2025)
Text-VQA Aug: Pipelined Harnessing of Large Multimodal Models for Automated Synthesis
di: Joshi, Soham, et al.
Pubblicazione: (2025)
di: Joshi, Soham, et al.
Pubblicazione: (2025)
Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation
di: Zhang, Jihai, et al.
Pubblicazione: (2025)
di: Zhang, Jihai, et al.
Pubblicazione: (2025)
RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding
di: Xu, Linrui, et al.
Pubblicazione: (2024)
di: Xu, Linrui, et al.
Pubblicazione: (2024)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
di: Song, Shezheng, et al.
Pubblicazione: (2024)
di: Song, Shezheng, et al.
Pubblicazione: (2024)
Harnessing Shared Relations via Multimodal Mixup Contrastive Learning for Multimodal Classification
di: Kumar, Raja, et al.
Pubblicazione: (2024)
di: Kumar, Raja, et al.
Pubblicazione: (2024)
Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
di: Wu, Chengyue, et al.
Pubblicazione: (2024)
di: Wu, Chengyue, et al.
Pubblicazione: (2024)
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
di: Zhuang, Shaobin, et al.
Pubblicazione: (2026)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2026)
Harnessing PDF Data for Improving Japanese Large Multimodal Models
di: Baek, Jeonghun, et al.
Pubblicazione: (2025)
di: Baek, Jeonghun, et al.
Pubblicazione: (2025)
Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
EventVL: Understand Event Streams via Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025)
di: Li, Pengteng, et al.
Pubblicazione: (2025)
IAD-Unify: A Region-Grounded Unified Model for Industrial Anomaly Segmentation, Understanding, and Generation
di: Zheng, Haoyu, et al.
Pubblicazione: (2026)
di: Zheng, Haoyu, et al.
Pubblicazione: (2026)
Enhancing Multimodal Unified Representations for Cross Modal Generalization
di: Huang, Hai, et al.
Pubblicazione: (2024)
di: Huang, Hai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Rethinking Pruning for Vision-Language Models: Strategies for Effective Sparsity and Performance Restoration
di: He, Shwai, et al.
Pubblicazione: (2024) -
UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding
di: Xu, Chenkai, et al.
Pubblicazione: (2025) -
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
di: Zhang, Huichao, et al.
Pubblicazione: (2026) -
UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?
di: Wen, Zimo, et al.
Pubblicazione: (2026) -
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
di: Li, Yi, et al.
Pubblicazione: (2025)