CASP: Compression of Large Multimodal Models Based on Attention Sparsity
Fuente:
arXiv
Guardado en:
| Autores principales: | Gholami, Mohsen, Akbari, Mohammad, Cannons, Kevin, Zhang, Yong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CPPO: Contrastive Perception Policy Optimization for VLM Agents
por: Rezaei, Ahmad, et al.
Publicado: (2026)
por: Rezaei, Ahmad, et al.
Publicado: (2026)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
por: Gholami, Mohsen, et al.
Publicado: (2025)
por: Gholami, Mohsen, et al.
Publicado: (2025)
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models
por: Alvar, Saeed Ranjbar, et al.
Publicado: (2025)
por: Alvar, Saeed Ranjbar, et al.
Publicado: (2025)
CASP: Few-Shot Class-Incremental Learning with CLS Token Attention Steering Prompts
por: Huang, Shuai, et al.
Publicado: (2026)
por: Huang, Shuai, et al.
Publicado: (2026)
Beyond Overall Accuracy: Pose- and Occlusion-driven Fairness Analysis in Pedestrian Detection for Autonomous Driving
por: Khoshkdahan, Mohammad, et al.
Publicado: (2025)
por: Khoshkdahan, Mohammad, et al.
Publicado: (2025)
State-Space Hierarchical Compression with Gated Attention and Learnable Sampling for Hour-Long Video Understanding in Large Multimodal Models
por: Kim, Geewook, et al.
Publicado: (2025)
por: Kim, Geewook, et al.
Publicado: (2025)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
por: Zheng, Pengcheng, et al.
Publicado: (2026)
por: Zheng, Pengcheng, et al.
Publicado: (2026)
A Survey of Token Compression for Efficient Multimodal Large Language Models
por: Shao, Kele, et al.
Publicado: (2025)
por: Shao, Kele, et al.
Publicado: (2025)
Towards Secure and Usable 3D Assets: A Novel Framework for Automatic Visible Watermarking
por: Singh, Gursimran, et al.
Publicado: (2024)
por: Singh, Gursimran, et al.
Publicado: (2024)
Can Multimodal Large Language Models be Guided to Improve Industrial Anomaly Detection?
por: Chen, Zhiling, et al.
Publicado: (2025)
por: Chen, Zhiling, et al.
Publicado: (2025)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
por: Peng, Tianfan, et al.
Publicado: (2025)
por: Peng, Tianfan, et al.
Publicado: (2025)
Y-CA-Net: A Convolutional Attention Based Network for Volumetric Medical Image Segmentation
por: Sharif, Muhammad Hamza, et al.
Publicado: (2024)
por: Sharif, Muhammad Hamza, et al.
Publicado: (2024)
Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering
por: Luo, Jiayi, et al.
Publicado: (2026)
por: Luo, Jiayi, et al.
Publicado: (2026)
Once for Both: Single Stage of Importance and Sparsity Search for Vision Transformer Compression
por: Ye, Hancheng, et al.
Publicado: (2024)
por: Ye, Hancheng, et al.
Publicado: (2024)
Understanding and Harnessing Sparsity in Unified Multimodal Models
por: He, Shwai, et al.
Publicado: (2025)
por: He, Shwai, et al.
Publicado: (2025)
Sparsity Meets Similarity: Leveraging Long-Tail Distribution for Dynamic Optimized Token Representation in Multimodal Large Language Models
por: Yu, Gaotong, et al.
Publicado: (2024)
por: Yu, Gaotong, et al.
Publicado: (2024)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
por: Tan, Xudong, et al.
Publicado: (2025)
por: Tan, Xudong, et al.
Publicado: (2025)
LaWa: Using Latent Space for In-Generation Image Watermarking
por: Rezaei, Ahmad, et al.
Publicado: (2024)
por: Rezaei, Ahmad, et al.
Publicado: (2024)
SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
por: Fang, Tongcheng, et al.
Publicado: (2026)
por: Fang, Tongcheng, et al.
Publicado: (2026)
LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models
por: Hu, Qingqiao, et al.
Publicado: (2025)
por: Hu, Qingqiao, et al.
Publicado: (2025)
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
por: Huang, Mouxiao, et al.
Publicado: (2025)
por: Huang, Mouxiao, et al.
Publicado: (2025)
Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention
por: Qiao, Bingtian, et al.
Publicado: (2026)
por: Qiao, Bingtian, et al.
Publicado: (2026)
DiTFastAttn: Attention Compression for Diffusion Transformer Models
por: Yuan, Zhihang, et al.
Publicado: (2024)
por: Yuan, Zhihang, et al.
Publicado: (2024)
Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models
por: Deniz, Omer Faruk, et al.
Publicado: (2026)
por: Deniz, Omer Faruk, et al.
Publicado: (2026)
Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion
por: Xue, Yu, et al.
Publicado: (2026)
por: Xue, Yu, et al.
Publicado: (2026)
Linear Attention Modeling for Learned Image Compression
por: Feng, Donghui, et al.
Publicado: (2025)
por: Feng, Donghui, et al.
Publicado: (2025)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
por: Sinha, Sanchit, et al.
Publicado: (2026)
por: Sinha, Sanchit, et al.
Publicado: (2026)
VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning
por: Xu, Hengbo, et al.
Publicado: (2026)
por: Xu, Hengbo, et al.
Publicado: (2026)
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
por: Lei, Lei, et al.
Publicado: (2025)
por: Lei, Lei, et al.
Publicado: (2025)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
por: Tong, Bo, et al.
Publicado: (2024)
por: Tong, Bo, et al.
Publicado: (2024)
Learnable Sparsity for Vision Generative Models
por: Zhang, Yang, et al.
Publicado: (2024)
por: Zhang, Yang, et al.
Publicado: (2024)
Fast and Controllable Post-training Sparsity: Learning Optimal Sparsity Allocation with Global Constraint in Minutes
por: Gong, Ruihao, et al.
Publicado: (2024)
por: Gong, Ruihao, et al.
Publicado: (2024)
Blind Source Separation Based on Sparsity
por: Li, Zhongxuan
Publicado: (2025)
por: Li, Zhongxuan
Publicado: (2025)
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
por: Fan, Yingqi, et al.
Publicado: (2026)
por: Fan, Yingqi, et al.
Publicado: (2026)
SINR: Sparsity Driven Compressed Implicit Neural Representations
por: Jayasundara, Dhananjaya, et al.
Publicado: (2025)
por: Jayasundara, Dhananjaya, et al.
Publicado: (2025)
Compact Attention: Exploiting Structured Spatio-Temporal Sparsity for Fast Video Generation
por: Li, Qirui, et al.
Publicado: (2025)
por: Li, Qirui, et al.
Publicado: (2025)
Social-MAE: A Transformer-Based Multimodal Autoencoder for Face and Voice
por: Bohy, Hugo, et al.
Publicado: (2025)
por: Bohy, Hugo, et al.
Publicado: (2025)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
por: Liu, Juntao, et al.
Publicado: (2025)
por: Liu, Juntao, et al.
Publicado: (2025)
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
por: Hu, Lianyu, et al.
Publicado: (2025)
por: Hu, Lianyu, et al.
Publicado: (2025)
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
por: Yao, Linli, et al.
Publicado: (2024)
por: Yao, Linli, et al.
Publicado: (2024)
Ejemplares similares
-
CPPO: Contrastive Perception Policy Optimization for VLM Agents
por: Rezaei, Ahmad, et al.
Publicado: (2026) -
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
por: Gholami, Mohsen, et al.
Publicado: (2025) -
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models
por: Alvar, Saeed Ranjbar, et al.
Publicado: (2025) -
CASP: Few-Shot Class-Incremental Learning with CLS Token Attention Steering Prompts
por: Huang, Shuai, et al.
Publicado: (2026) -
Beyond Overall Accuracy: Pose- and Occlusion-driven Fairness Analysis in Pedestrian Detection for Autonomous Driving
por: Khoshkdahan, Mohammad, et al.
Publicado: (2025)