MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yu, JiangYong, Zhou, Sifan, Yang, Dawei, Wang, Shuo, Li, Shuoyu, Hu, Xing, Xu, Chen, Xu, Zukang, Shu, Changyong, Yuan, Zhihang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
von: Hu, Xing, et al.
Veröffentlicht: (2025)
von: Hu, Xing, et al.
Veröffentlicht: (2025)
MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance
von: Hu, Xing, et al.
Veröffentlicht: (2025)
von: Hu, Xing, et al.
Veröffentlicht: (2025)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
von: Hu, Xing, et al.
Veröffentlicht: (2024)
von: Hu, Xing, et al.
Veröffentlicht: (2024)
RWKVQuant: Quantizing the RWKV Family with Proxy Guided Hybrid of Scalar and Vector Quantization
von: Xu, Chen, et al.
Veröffentlicht: (2025)
von: Xu, Chen, et al.
Veröffentlicht: (2025)
RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
von: Xu, Zukang, et al.
Veröffentlicht: (2025)
von: Xu, Zukang, et al.
Veröffentlicht: (2025)
TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization
von: Xu, Zukang, et al.
Veröffentlicht: (2026)
von: Xu, Zukang, et al.
Veröffentlicht: (2026)
PCDVQ: Enhancing Vector Quantization for Large Language Models via Polar Coordinate Decoupling
von: Yue, Yuxuan, et al.
Veröffentlicht: (2025)
von: Yue, Yuxuan, et al.
Veröffentlicht: (2025)
MambaQuant: Quantizing the Mamba Family with Variance Aligned Rotation Methods
von: Xu, Zukang, et al.
Veröffentlicht: (2025)
von: Xu, Zukang, et al.
Veröffentlicht: (2025)
KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models
von: Xu, Zukang, et al.
Veröffentlicht: (2026)
von: Xu, Zukang, et al.
Veröffentlicht: (2026)
MGVQ: Synergizing Multi-dimensional Sensitivity-Aware and Gradient-Hessian Fusion for Vector Quantization
von: Wang, Zhong, et al.
Veröffentlicht: (2026)
von: Wang, Zhong, et al.
Veröffentlicht: (2026)
MoBiE: Efficient Inference of Mixture of Binary Experts under Post-Training Quantization
von: Zhao, Zhixiong, et al.
Veröffentlicht: (2026)
von: Zhao, Zhixiong, et al.
Veröffentlicht: (2026)
BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs
von: Zhao, Zhixiong, et al.
Veröffentlicht: (2026)
von: Zhao, Zhixiong, et al.
Veröffentlicht: (2026)
FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection
von: Yu, Jiangyong, et al.
Veröffentlicht: (2025)
von: Yu, Jiangyong, et al.
Veröffentlicht: (2025)
FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection
von: Yu, Jiangyong, et al.
Veröffentlicht: (2025)
von: Yu, Jiangyong, et al.
Veröffentlicht: (2025)
GSQ-Tuning: Group-Shared Exponents Integer in Fully Quantized Training for LLMs On-Device Fine-tuning
von: Zhou, Sifan, et al.
Veröffentlicht: (2025)
von: Zhou, Sifan, et al.
Veröffentlicht: (2025)
SAES-SVD: Self-Adaptive Suppression of Accumulated and Local Errors for SVD-based LLM Compression
von: Hu, Xing, et al.
Veröffentlicht: (2026)
von: Hu, Xing, et al.
Veröffentlicht: (2026)
Information Entropy Guided Height-aware Histogram for Quantization-friendly Pillar Feature Encoder
von: Zhou, Sifan, et al.
Veröffentlicht: (2024)
von: Zhou, Sifan, et al.
Veröffentlicht: (2024)
WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More
von: Yue, Yuxuan, et al.
Veröffentlicht: (2024)
von: Yue, Yuxuan, et al.
Veröffentlicht: (2024)
MVCTrack: Boosting 3D Point Cloud Tracking via Multimodal-Guided Virtual Cues
von: Hu, Zhaofeng, et al.
Veröffentlicht: (2024)
von: Hu, Zhaofeng, et al.
Veröffentlicht: (2024)
DLLMQuant: Quantizing Diffusion-based Large Language Models
von: Xu, Chen, et al.
Veröffentlicht: (2025)
von: Xu, Chen, et al.
Veröffentlicht: (2025)
SSVQ: Unleashing the Potential of Vector Quantization with Sign-Splitting
von: Li, Shuaiting, et al.
Veröffentlicht: (2025)
von: Li, Shuaiting, et al.
Veröffentlicht: (2025)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
von: Lin, Zhihang, et al.
Veröffentlicht: (2024)
von: Lin, Zhihang, et al.
Veröffentlicht: (2024)
GQSA: Group Quantization and Sparsity for Accelerating Large Language Model Inference
von: Zeng, Chao, et al.
Veröffentlicht: (2024)
von: Zeng, Chao, et al.
Veröffentlicht: (2024)
PillarTrack:Boosting Pillar Representation for Transformer-based 3D Single Object Tracking on Point Clouds
von: Xu, Weisheng, et al.
Veröffentlicht: (2024)
von: Xu, Weisheng, et al.
Veröffentlicht: (2024)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
von: Hu, Lulu, et al.
Veröffentlicht: (2026)
von: Hu, Lulu, et al.
Veröffentlicht: (2026)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
von: Li, Hengzhuang, et al.
Veröffentlicht: (2025)
von: Li, Hengzhuang, et al.
Veröffentlicht: (2025)
GSRender: Deduplicated Occupancy Prediction via Weakly Supervised 3D Gaussian Splatting
von: Sun, Qianpu, et al.
Veröffentlicht: (2024)
von: Sun, Qianpu, et al.
Veröffentlicht: (2024)
MoEntwine: Unleashing the Potential of Wafer-scale Chips for Large-scale Expert Parallel Inference
von: Tang, Xinru, et al.
Veröffentlicht: (2025)
von: Tang, Xinru, et al.
Veröffentlicht: (2025)
SKVQ: Sliding-window Key and Value Cache Quantization for Large Language Models
von: Duanmu, Haojie, et al.
Veröffentlicht: (2024)
von: Duanmu, Haojie, et al.
Veröffentlicht: (2024)
ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models
von: Zeng, Chao, et al.
Veröffentlicht: (2024)
von: Zeng, Chao, et al.
Veröffentlicht: (2024)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
von: Ye, Zhipeng, et al.
Veröffentlicht: (2026)
von: Ye, Zhipeng, et al.
Veröffentlicht: (2026)
Unleashing the Potential of Text-attributed Graphs: Automatic Relation Decomposition via Large Language Models
von: Seo, Hyunjin, et al.
Veröffentlicht: (2024)
von: Seo, Hyunjin, et al.
Veröffentlicht: (2024)
NLI:Non-uniform Linear Interpolation Approximation of Nonlinear Operations for Efficient LLMs Inference
von: Yu, Jiangyong, et al.
Veröffentlicht: (2026)
von: Yu, Jiangyong, et al.
Veröffentlicht: (2026)
Unleashing the Potentials of Likelihood Composition for Multi-modal Language Models
von: Zhao, Shitian, et al.
Veröffentlicht: (2024)
von: Zhao, Shitian, et al.
Veröffentlicht: (2024)
Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment
von: Xie, Xing, et al.
Veröffentlicht: (2025)
von: Xie, Xing, et al.
Veröffentlicht: (2025)
Quant.npu: Enabling Efficient Mobile NPU Inference for on-device LLMs via Fully Static Quantization
von: Zhang, Jinghe, et al.
Veröffentlicht: (2026)
von: Zhang, Jinghe, et al.
Veröffentlicht: (2026)
Unleashing the Potential of Big Ideas in Language Education: What and How?
von: Rui Yuan, et al.
Veröffentlicht: (2024)
von: Rui Yuan, et al.
Veröffentlicht: (2024)
InfMasking: Unleashing Synergistic Information by Contrastive Multimodal Interactions
von: Wen, Liangjian, et al.
Veröffentlicht: (2025)
von: Wen, Liangjian, et al.
Veröffentlicht: (2025)
6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models
von: Su, Rundong, et al.
Veröffentlicht: (2026)
von: Su, Rundong, et al.
Veröffentlicht: (2026)
Speculative Decoding Reimagined for Multimodal Large Language Models
von: Lin, Luxi, et al.
Veröffentlicht: (2025)
von: Lin, Luxi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
von: Hu, Xing, et al.
Veröffentlicht: (2025) -
MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance
von: Hu, Xing, et al.
Veröffentlicht: (2025) -
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
von: Hu, Xing, et al.
Veröffentlicht: (2024) -
RWKVQuant: Quantizing the RWKV Family with Proxy Guided Hybrid of Scalar and Vector Quantization
von: Xu, Chen, et al.
Veröffentlicht: (2025) -
RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
von: Xu, Zukang, et al.
Veröffentlicht: (2025)