CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Dang, Yunkai, Jiang, Yizhu, Jiang, Yifan, Fan, Qi, Shi, Yinghuan, Li, Wenbin, Gao, Yang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models
by: Dang, Yunkai, et al.
Published: (2026)
by: Dang, Yunkai, et al.
Published: (2026)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
by: Dang, Yunkai, et al.
Published: (2025)
by: Dang, Yunkai, et al.
Published: (2025)
Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning
by: Yang, Jiacheng, et al.
Published: (2026)
by: Yang, Jiacheng, et al.
Published: (2026)
WeakMedSAM: Weakly-Supervised Medical Image Segmentation via SAM with Sub-Class Exploration and Prompt Affinity Mining
by: Wang, Haoran, et al.
Published: (2025)
by: Wang, Haoran, et al.
Published: (2025)
SETA: Semantic-Aware Token Augmentation for Domain Generalization
by: Guo, Jintao, et al.
Published: (2024)
by: Guo, Jintao, et al.
Published: (2024)
START: A Generalized State Space Model with Saliency-Driven Token-Aware Transformation
by: Guo, Jintao, et al.
Published: (2024)
by: Guo, Jintao, et al.
Published: (2024)
Text and Image Are Mutually Beneficial: Enhancing Training-Free Few-Shot Classification with CLIP
by: Li, Yayuan, et al.
Published: (2024)
by: Li, Yayuan, et al.
Published: (2024)
UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing
by: Dang, Yunkai, et al.
Published: (2026)
by: Dang, Yunkai, et al.
Published: (2026)
An Adaptor for Triggering Semi-Supervised Learning to Out-of-Box Serve Deep Image Clustering
by: Duan, Yue, et al.
Published: (2025)
by: Duan, Yue, et al.
Published: (2025)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
by: Lee, Jaewoo, et al.
Published: (2025)
by: Lee, Jaewoo, et al.
Published: (2025)
Learning Generalizable Models via Disentangling Spurious and Enhancing Potential Correlations
by: Wang, Na, et al.
Published: (2024)
by: Wang, Na, et al.
Published: (2024)
Learn to Preserve and Diversify: Parameter-Efficient Group with Orthogonal Regularization for Domain Generalization
by: Hu, Jiajun, et al.
Published: (2024)
by: Hu, Jiajun, et al.
Published: (2024)
Spatial and Frequency Domain Adaptive Fusion Network for Image Deblurring
by: Gao, Hu, et al.
Published: (2025)
by: Gao, Hu, et al.
Published: (2025)
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
by: Lyu, Yibo, et al.
Published: (2025)
by: Lyu, Yibo, et al.
Published: (2025)
Color and Texture Dual Pipeline Lightweight Style Transfer
by: Jiang, ShiQi
Published: (2023)
by: Jiang, ShiQi
Published: (2023)
Topology-Aware Layer Pruning for Large Vision-Language Models
by: Zheng, Pengcheng, et al.
Published: (2026)
by: Zheng, Pengcheng, et al.
Published: (2026)
NormAUG: Normalization-guided Augmentation for Domain Generalization
by: Qi, Lei, et al.
Published: (2023)
by: Qi, Lei, et al.
Published: (2023)
MultiMatch: Multi-task Learning for Semi-supervised Domain Generalization
by: Qi, Lei, et al.
Published: (2022)
by: Qi, Lei, et al.
Published: (2022)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
by: Wang, Yahong, et al.
Published: (2026)
by: Wang, Yahong, et al.
Published: (2026)
A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs
by: Dang, Yunkai, et al.
Published: (2025)
by: Dang, Yunkai, et al.
Published: (2025)
Diffusion-Based Data Augmentation for Image Recognition: A Systematic Analysis and Evaluation
by: Li, Zekun, et al.
Published: (2026)
by: Li, Zekun, et al.
Published: (2026)
Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition
by: Cong, Kaixuan, et al.
Published: (2025)
by: Cong, Kaixuan, et al.
Published: (2025)
CLASP: Adaptive Spectral Clustering for Unsupervised Per-Image Segmentation
by: Curie, Max, et al.
Published: (2025)
by: Curie, Max, et al.
Published: (2025)
Balancing Multi-Target Semi-Supervised Medical Image Segmentation with Collaborative Generalist and Specialists
by: Wang, You, et al.
Published: (2025)
by: Wang, You, et al.
Published: (2025)
The Devil is in the Statistics: Mitigating and Exploiting Statistics Difference for Generalizable Semi-supervised Medical Image Segmentation
by: Qiu, Muyang, et al.
Published: (2024)
by: Qiu, Muyang, et al.
Published: (2024)
Stitching, Fine-tuning, Re-training: A SAM-enabled Framework for Semi-supervised 3D Medical Image Segmentation
by: Li, Shumeng, et al.
Published: (2024)
by: Li, Shumeng, et al.
Published: (2024)
Unleashing the Power of Intermediate Domains for Mixed Domain Semi-Supervised Medical Image Segmentation
by: Ma, Qinghe, et al.
Published: (2025)
by: Ma, Qinghe, et al.
Published: (2025)
Diversity-enhanced Collaborative Mamba for Semi-supervised Medical Image Segmentation
by: Li, Shumeng, et al.
Published: (2025)
by: Li, Shumeng, et al.
Published: (2025)
Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors
by: Yang, Chengxu, et al.
Published: (2026)
by: Yang, Chengxu, et al.
Published: (2026)
Generalizable Metric Network for Cross-domain Person Re-identification
by: Qi, Lei, et al.
Published: (2023)
by: Qi, Lei, et al.
Published: (2023)
Patch-aware Batch Normalization for Improving Cross-domain Robustness
by: Qi, Lei, et al.
Published: (2023)
by: Qi, Lei, et al.
Published: (2023)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
by: Zhang, Hao, et al.
Published: (2025)
by: Zhang, Hao, et al.
Published: (2025)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
by: Wen, Zichen, et al.
Published: (2025)
by: Wen, Zichen, et al.
Published: (2025)
A Novel Cross-Perturbation for Single Domain Generalization
by: Zhao, Dongjia, et al.
Published: (2023)
by: Zhao, Dongjia, et al.
Published: (2023)
Adaptive Weighted Parameter Fusion with CLIP for Class-Incremental Learning
by: Guo, Juncen, et al.
Published: (2025)
by: Guo, Juncen, et al.
Published: (2025)
Constructing and Exploring Intermediate Domains in Mixed Domain Semi-supervised Medical Image Segmentation
by: Ma, Qinghe, et al.
Published: (2024)
by: Ma, Qinghe, et al.
Published: (2024)
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
by: Madinei, Parsa, et al.
Published: (2025)
by: Madinei, Parsa, et al.
Published: (2025)
Decomposing and Composing: Towards Efficient Vision-Language Continual Learning via Rank-1 Expert Pool in a Single LoRA
by: Fa, Zhan, et al.
Published: (2026)
by: Fa, Zhan, et al.
Published: (2026)
Mamba-Sea: A Mamba-based Framework with Global-to-Local Sequence Augmentation for Generalizable Medical Image Segmentation
by: Cheng, Zihan, et al.
Published: (2025)
by: Cheng, Zihan, et al.
Published: (2025)
Towards Perfection: Building Inter-component Mutual Correction for Retinex-based Low-light Image Enhancement
by: Cao, Luyang, et al.
Published: (2025)
by: Cao, Luyang, et al.
Published: (2025)
Similar Items
-
Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models
by: Dang, Yunkai, et al.
Published: (2026) -
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
by: Dang, Yunkai, et al.
Published: (2025) -
Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning
by: Yang, Jiacheng, et al.
Published: (2026) -
WeakMedSAM: Weakly-Supervised Medical Image Segmentation via SAM with Sub-Class Exploration and Prompt Affinity Mining
by: Wang, Haoran, et al.
Published: (2025) -
SETA: Semantic-Aware Token Augmentation for Domain Generalization
by: Guo, Jintao, et al.
Published: (2024)