Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhong, Yi, Qin, Haotong, Zhang, Xindong, Zhang, Lei, Sun, Guolei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
di: Qin, Guangshuo, et al.
Pubblicazione: (2026)
di: Qin, Guangshuo, et al.
Pubblicazione: (2026)
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
di: Li, Shiyao, et al.
Pubblicazione: (2024)
di: Li, Shiyao, et al.
Pubblicazione: (2024)
Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients
di: Xiang, Ziwei, et al.
Pubblicazione: (2026)
di: Xiang, Ziwei, et al.
Pubblicazione: (2026)
Post-Training Quantization for Video Matting
di: Zhu, Tianrui, et al.
Pubblicazione: (2025)
di: Zhu, Tianrui, et al.
Pubblicazione: (2025)
Progressive Fine-to-Coarse Reconstruction for Accurate Low-Bit Post-Training Quantization in Vision Transformers
di: Ding, Rui, et al.
Pubblicazione: (2024)
di: Ding, Rui, et al.
Pubblicazione: (2024)
When Bits Break Recourse: Counterfactual-Faithful Quantization
di: Yahyati, Chaymae, et al.
Pubblicazione: (2026)
di: Yahyati, Chaymae, et al.
Pubblicazione: (2026)
Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
Q$^2$: Quantization-Aware Gradient Balancing and Attention Alignment for Low-Bit Quantization
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
Q-SAM2: Accurate Quantization for Segment Anything Model 2
di: Farronato, Nicola, et al.
Pubblicazione: (2025)
di: Farronato, Nicola, et al.
Pubblicazione: (2025)
Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization
di: Jia, Chenwei, et al.
Pubblicazione: (2026)
di: Jia, Chenwei, et al.
Pubblicazione: (2026)
Reclaiming Residual Knowledge: A Novel Paradigm to Low-Bit Quantization
di: Luo, Róisín, et al.
Pubblicazione: (2024)
di: Luo, Róisín, et al.
Pubblicazione: (2024)
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
di: Zheng, Xingyu, et al.
Pubblicazione: (2025)
di: Zheng, Xingyu, et al.
Pubblicazione: (2025)
LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models
di: Bhatnagar, Shubhang, et al.
Pubblicazione: (2025)
di: Bhatnagar, Shubhang, et al.
Pubblicazione: (2025)
AdaSVD: Adaptive Singular Value Decomposition for Large Language Models
di: Li, Zhiteng, et al.
Pubblicazione: (2025)
di: Li, Zhiteng, et al.
Pubblicazione: (2025)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
di: Zhong, Chen, et al.
Pubblicazione: (2026)
di: Zhong, Chen, et al.
Pubblicazione: (2026)
Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
MimiQ: Low-Bit Data-Free Quantization of Vision Transformers with Encouraging Inter-Head Attention Similarity
di: Choi, Kanghyun, et al.
Pubblicazione: (2024)
di: Choi, Kanghyun, et al.
Pubblicazione: (2024)
LL-ICM: Image Compression for Low-level Machine Vision via Large Vision-Language Model
di: Xue, Yuan, et al.
Pubblicazione: (2024)
di: Xue, Yuan, et al.
Pubblicazione: (2024)
A-VL: Adaptive Attention for Large Vision-Language Models
di: Zhang, Junyang, et al.
Pubblicazione: (2024)
di: Zhang, Junyang, et al.
Pubblicazione: (2024)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
di: Yan, Bei, et al.
Pubblicazione: (2024)
di: Yan, Bei, et al.
Pubblicazione: (2024)
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
di: Shen, Guanxi
Pubblicazione: (2025)
di: Shen, Guanxi
Pubblicazione: (2025)
Adversarial Defense in Vision-Language Models: An Overview
di: Fu, Xiaowei, et al.
Pubblicazione: (2026)
di: Fu, Xiaowei, et al.
Pubblicazione: (2026)
Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models
di: Huo, Fushuo, et al.
Pubblicazione: (2024)
di: Huo, Fushuo, et al.
Pubblicazione: (2024)
Large Vision-Language Models as Emotion Recognizers in Context Awareness
di: Lei, Yuxuan, et al.
Pubblicazione: (2024)
di: Lei, Yuxuan, et al.
Pubblicazione: (2024)
Towards Joint Quantization and Token Pruning of Vision-Language Models
di: Li, Xinqing, et al.
Pubblicazione: (2026)
di: Li, Xinqing, et al.
Pubblicazione: (2026)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
di: Zhong, Weihong, et al.
Pubblicazione: (2024)
di: Zhong, Weihong, et al.
Pubblicazione: (2024)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
di: Zhao, Ruosen, et al.
Pubblicazione: (2025)
di: Zhao, Ruosen, et al.
Pubblicazione: (2025)
Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models
di: Zhou, Zijie, et al.
Pubblicazione: (2026)
di: Zhou, Zijie, et al.
Pubblicazione: (2026)
Collaborative Few-Step Distillation and Low-Bit Quantization for Wan2.2 Dual-Expert Video Diffusion Models
di: Du, Jinyang, et al.
Pubblicazione: (2026)
di: Du, Jinyang, et al.
Pubblicazione: (2026)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
di: Kim, Eunki, et al.
Pubblicazione: (2025)
di: Kim, Eunki, et al.
Pubblicazione: (2025)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
MammothModa: Multi-Modal Large Language Model
di: She, Qi, et al.
Pubblicazione: (2024)
di: She, Qi, et al.
Pubblicazione: (2024)
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
di: Peng, Wei, et al.
Pubblicazione: (2025)
di: Peng, Wei, et al.
Pubblicazione: (2025)
Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
Rethinking Token Reduction for Large Vision-Language Models
di: Wang, Yi, et al.
Pubblicazione: (2026)
di: Wang, Yi, et al.
Pubblicazione: (2026)
Generalized Large-Scale Data Condensation via Various Backbone and Statistical Matching
di: Shao, Shitong, et al.
Pubblicazione: (2023)
di: Shao, Shitong, et al.
Pubblicazione: (2023)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
di: Xiu, Kedong, et al.
Pubblicazione: (2025)
di: Xiu, Kedong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
di: Qin, Guangshuo, et al.
Pubblicazione: (2026) -
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
di: Li, Shiyao, et al.
Pubblicazione: (2024) -
Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients
di: Xiang, Ziwei, et al.
Pubblicazione: (2026) -
Post-Training Quantization for Video Matting
di: Zhu, Tianrui, et al.
Pubblicazione: (2025) -
Progressive Fine-to-Coarse Reconstruction for Accurate Low-Bit Post-Training Quantization in Vision Transformers
di: Ding, Rui, et al.
Pubblicazione: (2024)