FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Haicheng, Yu, Zhemeng, Spadaro, Gabriele, Ju, Chen, Quétu, Victor, Xiao, Shuai, Tartaglione, Enzo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Till the Layers Collapse: Compressing a Deep Neural Network through the Lenses of Batch Normalization Layers
par: Liao, Zhu, et autres
Publié: (2024)
par: Liao, Zhu, et autres
Publié: (2024)
Memory-Optimized Once-For-All Network
par: Girard, Maxime, et autres
Publié: (2024)
par: Girard, Maxime, et autres
Publié: (2024)
Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Large Models
par: Ju, Chen, et autres
Publié: (2024)
par: Ju, Chen, et autres
Publié: (2024)
RAVE: Rate-Adaptive Visual Encoding for 3D Gaussian Splatting
par: Tran, Hoang-Nhat, et autres
Publié: (2025)
par: Tran, Hoang-Nhat, et autres
Publié: (2025)
Domain Adaptation for Learned Image Compression with Supervised Adapters
par: Presta, Alberto, et autres
Publié: (2024)
par: Presta, Alberto, et autres
Publié: (2024)
WiGNet: Windowed Vision Graph Neural Network
par: Spadaro, Gabriele, et autres
Publié: (2024)
par: Spadaro, Gabriele, et autres
Publié: (2024)
Nix and Fix: Targeting 1000x Compression of 3D Gaussian Splatting with Diffusion Models
par: Eteke, Cem, et autres
Publié: (2026)
par: Eteke, Cem, et autres
Publié: (2026)
GABIC: Graph-based Attention Block for Image Compression
par: Spadaro, Gabriele, et autres
Publié: (2024)
par: Spadaro, Gabriele, et autres
Publié: (2024)
ELMGS: Enhancing memory and computation scaLability through coMpression for 3D Gaussian Splatting
par: Ali, Muhammad Salman, et autres
Publié: (2024)
par: Ali, Muhammad Salman, et autres
Publié: (2024)
Capsule Networks Do Not Need to Model Everything
par: Renzulli, Riccardo, et autres
Publié: (2022)
par: Renzulli, Riccardo, et autres
Publié: (2022)
DSD$^2$: Can We Dodge Sparse Double Descent and Compress the Neural Network Worry-Free?
par: Quétu, Victor, et autres
Publié: (2023)
par: Quétu, Victor, et autres
Publié: (2023)
Denoising Diffusion Probabilistic Model for Point Cloud Compression at Low Bit-Rates
par: Spadaro, Gabriele, et autres
Publié: (2025)
par: Spadaro, Gabriele, et autres
Publié: (2025)
Boost Your NeRF: A Model-Agnostic Mixture of Experts Framework for High Quality and Efficient Rendering
par: Di Sario, Francesco, et autres
Publié: (2024)
par: Di Sario, Francesco, et autres
Publié: (2024)
Enhancing Plasticity for First Session Adaptation Continual Learning
par: Marouf, Imad Eddine, et autres
Publié: (2023)
par: Marouf, Imad Eddine, et autres
Publié: (2023)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
par: Chow, Wei, et autres
Publié: (2024)
par: Chow, Wei, et autres
Publié: (2024)
Efficient Large Multi-modal Models via Visual Context Compression
par: Chen, Jieneng, et autres
Publié: (2024)
par: Chen, Jieneng, et autres
Publié: (2024)
Efficient Adaptation of Deep Neural Networks for Semantic Segmentation in Space Applications
par: Olivi, Leonardo, et autres
Publié: (2025)
par: Olivi, Leonardo, et autres
Publié: (2025)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
par: Li, Haodong, et autres
Publié: (2024)
par: Li, Haodong, et autres
Publié: (2024)
STanH : Parametric Quantization for Variable Rate Learned Image Compression
par: Presta, Alberto, et autres
Publié: (2024)
par: Presta, Alberto, et autres
Publié: (2024)
Empowering Segmentation Ability to Multi-modal Large Language Models
par: Yang, Yuqi, et autres
Publié: (2024)
par: Yang, Yuqi, et autres
Publié: (2024)
Contrast-Unity for Partially-Supervised Temporal Sentence Grounding
par: Wang, Haicheng, et autres
Publié: (2025)
par: Wang, Haicheng, et autres
Publié: (2025)
Efficient Progressive Image Compression with Variance-aware Masking
par: Presta, Alberto, et autres
Publié: (2024)
par: Presta, Alberto, et autres
Publié: (2024)
Trimming the Fat: Efficient Compression of 3D Gaussian Splats through Pruning
par: Ali, Muhammad Salman, et autres
Publié: (2024)
par: Ali, Muhammad Salman, et autres
Publié: (2024)
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
par: Wang, Haicheng, et autres
Publié: (2026)
par: Wang, Haicheng, et autres
Publié: (2026)
Adapting Multi-modal Large Language Model to Concept Drift From Pre-training Onwards
par: Yang, Xiaoyu, et autres
Publié: (2024)
par: Yang, Xiaoyu, et autres
Publié: (2024)
Efficient Multi-modal Large Language Models via Visual Token Grouping
par: Huang, Minbin, et autres
Publié: (2024)
par: Huang, Minbin, et autres
Publié: (2024)
Unsupervised Learning of Unbiased Visual Representations
par: Barbano, Carlo Alberto, et autres
Publié: (2022)
par: Barbano, Carlo Alberto, et autres
Publié: (2022)
Point Cloud as a Foreign Language for Multi-modal Large Language Model
par: Paul, Sneha, et autres
Publié: (2026)
par: Paul, Sneha, et autres
Publié: (2026)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
par: Huang, Wencan, et autres
Publié: (2025)
par: Huang, Wencan, et autres
Publié: (2025)
Weighted Ensemble Models Are Strong Continual Learners
par: Marouf, Imad Eddine, et autres
Publié: (2023)
par: Marouf, Imad Eddine, et autres
Publié: (2023)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
GoDe: Gaussians on Demand for Progressive Level of Detail and Scalable Compression
par: Di Sario, Francesco, et autres
Publié: (2025)
par: Di Sario, Francesco, et autres
Publié: (2025)
LLMRA: Multi-modal Large Language Model based Restoration Assistant
par: Jin, Xiaoyu, et autres
Publié: (2024)
par: Jin, Xiaoyu, et autres
Publié: (2024)
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
par: Jeon, Byungwoo, et autres
Publié: (2026)
par: Jeon, Byungwoo, et autres
Publié: (2026)
Understanding Information Storage and Transfer in Multi-modal Large Language Models
par: Basu, Samyadeep, et autres
Publié: (2024)
par: Basu, Samyadeep, et autres
Publié: (2024)
How I Met Your Bias: Investigating Bias Amplification in Diffusion Models
par: Roos, Nathan, et autres
Publié: (2025)
par: Roos, Nathan, et autres
Publié: (2025)
LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models
par: Liao, Pan, et autres
Publié: (2026)
par: Liao, Pan, et autres
Publié: (2026)
KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing
par: Jiang, Siyu, et autres
Publié: (2026)
par: Jiang, Siyu, et autres
Publié: (2026)
Distilling Multi-modal Large Language Models for Autonomous Driving
par: Hegde, Deepti, et autres
Publié: (2025)
par: Hegde, Deepti, et autres
Publié: (2025)
Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training
par: Wang, Haicheng, et autres
Publié: (2024)
par: Wang, Haicheng, et autres
Publié: (2024)
Documents similaires
-
Till the Layers Collapse: Compressing a Deep Neural Network through the Lenses of Batch Normalization Layers
par: Liao, Zhu, et autres
Publié: (2024) -
Memory-Optimized Once-For-All Network
par: Girard, Maxime, et autres
Publié: (2024) -
Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Large Models
par: Ju, Chen, et autres
Publié: (2024) -
RAVE: Rate-Adaptive Visual Encoding for 3D Gaussian Splatting
par: Tran, Hoang-Nhat, et autres
Publié: (2025) -
Domain Adaptation for Learned Image Compression with Supervised Adapters
par: Presta, Alberto, et autres
Publié: (2024)