ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Parikh, Dhruv, Fan, Haoyang, Kannan, Rajgopal, Prasanna, Viktor |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Graphs Help Vision SSMs See Better?
par: Parikh, Dhruv, et autres
Publié: (2026)
par: Parikh, Dhruv, et autres
Publié: (2026)
Latent Denoising Improves Visual Alignment in Large Multimodal Models
par: Parikh, Dhruv, et autres
Publié: (2026)
par: Parikh, Dhruv, et autres
Publié: (2026)
ClusterViG: Efficient Globally Aware Vision GNNs via Image Partitioning
par: Parikh, Dhruv, et autres
Publié: (2025)
par: Parikh, Dhruv, et autres
Publié: (2025)
ImageHD: Energy-Efficient On-Device Continual Learning of Visual Representations via Hyperdimensional Computing
par: Arockiaraj, Jebacyril, et autres
Publié: (2026)
par: Arockiaraj, Jebacyril, et autres
Publié: (2026)
VTR: An Optimized Vision Transformer for SAR ATR Acceleration on FPGA
par: Wickramasinghe, Sachini, et autres
Publié: (2024)
par: Wickramasinghe, Sachini, et autres
Publié: (2024)
Accelerating ViT Inference on FPGA through Static and Dynamic Pruning
par: Parikh, Dhruv, et autres
Publié: (2024)
par: Parikh, Dhruv, et autres
Publié: (2024)
GraphLeap: Decoupling Graph Construction and Convolution for Vision GNN Acceleration on FPGA
par: Ramachandran, Anvitha, et autres
Publié: (2026)
par: Ramachandran, Anvitha, et autres
Publié: (2026)
Uncertainty-Aware SAR ATR: Defending Against Adversarial Attacks via Bayesian Neural Networks
par: Ye, Tian, et autres
Publié: (2024)
par: Ye, Tian, et autres
Publié: (2024)
Adversarial Training in Low-Label Regimes with Margin-Based Interpolation
par: Ye, Tian, et autres
Publié: (2024)
par: Ye, Tian, et autres
Publié: (2024)
Studying the Effects of Self-Attention on SAR Automatic Target Recognition
par: Fein-Ashley, Jacob, et autres
Publié: (2024)
par: Fein-Ashley, Jacob, et autres
Publié: (2024)
GCV-Turbo: End-to-end Acceleration of GNN-based Computer Vision Tasks on FPGA
par: Zhang, Bingyi, et autres
Publié: (2024)
par: Zhang, Bingyi, et autres
Publié: (2024)
FACTUAL: A Novel Framework for Contrastive Learning Based Robust SAR Image Classification
par: Wang, Xu, et autres
Publié: (2024)
par: Wang, Xu, et autres
Publié: (2024)
Primitive-Driven Acceleration of Hyperdimensional Computing for Real-Time Image Classification
par: Parikh, Dhruv, et autres
Publié: (2026)
par: Parikh, Dhruv, et autres
Publié: (2026)
A Single Graph Convolution Is All You Need: Efficient Grayscale Image Classification
par: Fein-Ashley, Jacob, et autres
Publié: (2024)
par: Fein-Ashley, Jacob, et autres
Publié: (2024)
PAHD: Perception-Action based Human Decision Making using Explainable Graph Neural Networks on SAR Images
par: Wijeratne, Sasindu, et autres
Publié: (2024)
par: Wijeratne, Sasindu, et autres
Publié: (2024)
Hallucination Begins Where Saliency Drops
par: Zhang, Xiaofeng, et autres
Publié: (2026)
par: Zhang, Xiaofeng, et autres
Publié: (2026)
Benchmarking Deep Learning Classifiers for SAR Automatic Target Recognition
par: Fein-Ashley, Jacob, et autres
Publié: (2023)
par: Fein-Ashley, Jacob, et autres
Publié: (2023)
Range and Bird's Eye View Fused Cross-Modal Visual Place Recognition
par: Peng, Jianyi, et autres
Publié: (2025)
par: Peng, Jianyi, et autres
Publié: (2025)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
par: Liu, Ting, et autres
Publié: (2024)
par: Liu, Ting, et autres
Publié: (2024)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2025)
par: Li, Xu, et autres
Publié: (2025)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
par: Trinh, Quoc-Huy, et autres
Publié: (2026)
par: Trinh, Quoc-Huy, et autres
Publié: (2026)
VST++: Efficient and Stronger Visual Saliency Transformer
par: Liu, Nian, et autres
Publié: (2023)
par: Liu, Nian, et autres
Publié: (2023)
EVLM: An Efficient Vision-Language Model for Visual Understanding
par: Chen, Kaibing, et autres
Publié: (2024)
par: Chen, Kaibing, et autres
Publié: (2024)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
par: Chen, Junjie, et autres
Publié: (2025)
par: Chen, Junjie, et autres
Publié: (2025)
Cross-Modal Attention Guided Unlearning in Vision-Language Models
par: Bhaila, Karuna, et autres
Publié: (2025)
par: Bhaila, Karuna, et autres
Publié: (2025)
Semantic-Preserving Cross-Style Visual Reasoning for Robust Multi-Modal Understanding in Large Vision-Language Models
par: Nakayama, Aya, et autres
Publié: (2025)
par: Nakayama, Aya, et autres
Publié: (2025)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
par: Xing, Long, et autres
Publié: (2024)
par: Xing, Long, et autres
Publié: (2024)
Cross-Modal Retrieval for Motion and Text via DropTriple Loss
par: Yan, Sheng, et autres
Publié: (2023)
par: Yan, Sheng, et autres
Publié: (2023)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
par: Wang, Chenyu, et autres
Publié: (2026)
par: Wang, Chenyu, et autres
Publié: (2026)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
par: Xiang, Sike, et autres
Publié: (2025)
par: Xiang, Sike, et autres
Publié: (2025)
Cross-Modal Adapter: Parameter-Efficient Transfer Learning Approach for Vision-Language Models
par: Yang, Juncheng, et autres
Publié: (2024)
par: Yang, Juncheng, et autres
Publié: (2024)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
par: Zhou, Lijie
Publié: (2026)
par: Zhou, Lijie
Publié: (2026)
Spherical Vision Transformers for Audio-Visual Saliency Prediction in 360-Degree Videos
par: Cokelek, Mert, et autres
Publié: (2025)
par: Cokelek, Mert, et autres
Publié: (2025)
Quantifying Cross-Modality Memorization in Vision-Language Models
par: Wen, Yuxin, et autres
Publié: (2025)
par: Wen, Yuxin, et autres
Publié: (2025)
DiSa: Directional Saliency-Aware Prompt Learning for Generalizable Vision-Language Models
par: Talemi, Niloufar Alipour, et autres
Publié: (2025)
par: Talemi, Niloufar Alipour, et autres
Publié: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2025)
par: Jiang, Lei, et autres
Publié: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
Documents similaires
-
Can Graphs Help Vision SSMs See Better?
par: Parikh, Dhruv, et autres
Publié: (2026) -
Latent Denoising Improves Visual Alignment in Large Multimodal Models
par: Parikh, Dhruv, et autres
Publié: (2026) -
ClusterViG: Efficient Globally Aware Vision GNNs via Image Partitioning
par: Parikh, Dhruv, et autres
Publié: (2025) -
ImageHD: Energy-Efficient On-Device Continual Learning of Visual Representations via Hyperdimensional Computing
par: Arockiaraj, Jebacyril, et autres
Publié: (2026) -
VTR: An Optimized Vision Transformer for SAR ATR Acceleration on FPGA
par: Wickramasinghe, Sachini, et autres
Publié: (2024)