Similarity-Aware Token Pruning: Your VLM but Faster
Fuente:
arXiv
Saved in:
| Main Authors: | Jeddi, Ahmadreza, Baghbanzadeh, Negin, Dolatabadi, Elham, Taati, Babak |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
by: Jeddi, Ahmadreza, et al.
Published: (2026)
by: Jeddi, Ahmadreza, et al.
Published: (2026)
Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning
by: Baghbanzadeh, Negin, et al.
Published: (2025)
by: Baghbanzadeh, Negin, et al.
Published: (2025)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
by: Bagrov, Natan, et al.
Published: (2025)
by: Bagrov, Natan, et al.
Published: (2025)
PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs
by: Jeddi, Ahmadreza, et al.
Published: (2025)
by: Jeddi, Ahmadreza, et al.
Published: (2025)
FastHMR: Accelerating Human Mesh Recovery via Token and Layer Merging with Diffusion Decoding
by: Mehraban, Soroush, et al.
Published: (2025)
by: Mehraban, Soroush, et al.
Published: (2025)
LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation
by: Jeddi, Ahmadreza, et al.
Published: (2026)
by: Jeddi, Ahmadreza, et al.
Published: (2026)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
by: Ma, Kexin, et al.
Published: (2026)
by: Ma, Kexin, et al.
Published: (2026)
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
by: Wu, Zhenkai, et al.
Published: (2025)
by: Wu, Zhenkai, et al.
Published: (2025)
PACT: Pruning and Clustering-Based Token Reduction for Faster Visual Language Models
by: Dhouib, Mohamed, et al.
Published: (2025)
by: Dhouib, Mohamed, et al.
Published: (2025)
Advancing Medical Representation Learning Through High-Quality Data
by: Baghbanzadeh, Negin, et al.
Published: (2025)
by: Baghbanzadeh, Negin, et al.
Published: (2025)
Consistency-Guided Asynchronous Contrastive Tuning for Few-Shot Class-Incremental Tuning of Foundation Models
by: Roy, Shuvendu, et al.
Published: (2024)
by: Roy, Shuvendu, et al.
Published: (2024)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
by: Li, Geng, et al.
Published: (2026)
by: Li, Geng, et al.
Published: (2026)
STARS: Self-supervised Tuning for 3D Action Recognition in Skeleton Sequences
by: Mehraban, Soroush, et al.
Published: (2024)
by: Mehraban, Soroush, et al.
Published: (2024)
Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning
by: Huang, Yihong, et al.
Published: (2026)
by: Huang, Yihong, et al.
Published: (2026)
CAT Pruning: Cluster-Aware Token Pruning For Text-to-Image Diffusion Models
by: Cheng, Xinle, et al.
Published: (2025)
by: Cheng, Xinle, et al.
Published: (2025)
PickStyle: Video-to-Video Style Transfer with Context-Style Adapters
by: Mehraban, Soroush, et al.
Published: (2025)
by: Mehraban, Soroush, et al.
Published: (2025)
LIFT: Latent Implicit Functions for Task- and Data-Agnostic Encoding
by: Kazerouni, Amirhossein, et al.
Published: (2025)
by: Kazerouni, Amirhossein, et al.
Published: (2025)
A Shared Encoder Approach to Multimodal Representation Learning
by: Roy, Shuvendu, et al.
Published: (2025)
by: Roy, Shuvendu, et al.
Published: (2025)
SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers
by: Rajabi, Javad, et al.
Published: (2026)
by: Rajabi, Javad, et al.
Published: (2026)
CATP: Confidence-Aware Token Pruning for Camouflaged Object Detection
by: Gao, Yuhan, et al.
Published: (2026)
by: Gao, Yuhan, et al.
Published: (2026)
Make Your ViT-based Multi-view 3D Detectors Faster via Token Compression
by: Zhang, Dingyuan, et al.
Published: (2024)
by: Zhang, Dingyuan, et al.
Published: (2024)
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
by: Zhang, Qizhe, et al.
Published: (2025)
by: Zhang, Qizhe, et al.
Published: (2025)
Leveraging Clinical Text and Class Conditioning for 3D Prostate MRI Generation
by: Grabke, Emerson P., et al.
Published: (2025)
by: Grabke, Emerson P., et al.
Published: (2025)
Mitigating 3D Prostate Biparametric MRI Data Scarcity through Domain Adaptation using Locally-Trained Latent Diffusion Models for Prostate Cancer Detection
by: Grabke, Emerson P., et al.
Published: (2025)
by: Grabke, Emerson P., et al.
Published: (2025)
Pain in 3D: Generating Controllable Synthetic Faces for Automated Pain Assessment
by: Lin, Xin Lei, et al.
Published: (2025)
by: Lin, Xin Lei, et al.
Published: (2025)
Context-Aware Token Pruning and Discriminative Selective Attention for Transformer Tracking
by: Kugarajeevan, Janani, et al.
Published: (2025)
by: Kugarajeevan, Janani, et al.
Published: (2025)
HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models
by: Zhu, Qihui, et al.
Published: (2026)
by: Zhu, Qihui, et al.
Published: (2026)
DocVLM: Make Your VLM an Efficient Reader
by: Nacson, Mor Shpigel, et al.
Published: (2024)
by: Nacson, Mor Shpigel, et al.
Published: (2024)
Rethinking Token Reduction for Diffusion Models via Output-Similarity-Awareness
by: Lee, Hangyeol, et al.
Published: (2026)
by: Lee, Hangyeol, et al.
Published: (2026)
QGen: On the Ability to Generalize in Quantization Aware Training
by: AskariHemmat, MohammadHossein, et al.
Published: (2024)
by: AskariHemmat, MohammadHossein, et al.
Published: (2024)
TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference
by: Hu, Junshan, et al.
Published: (2025)
by: Hu, Junshan, et al.
Published: (2025)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
by: Ji, Yicheng, et al.
Published: (2025)
by: Ji, Yicheng, et al.
Published: (2025)
SUM: Saliency Unification through Mamba for Visual Attention Modeling
by: Hosseini, Alireza, et al.
Published: (2024)
by: Hosseini, Alireza, et al.
Published: (2024)
Training Noise Token Pruning
by: Rao, Mingxing, et al.
Published: (2024)
by: Rao, Mingxing, et al.
Published: (2024)
Faster or Stronger: Towards Flexible Visual Place Recognition via Weighted Aggregation and Token Pruning
by: Zeng, Zichao, et al.
Published: (2026)
by: Zeng, Zichao, et al.
Published: (2026)
STAF: Sinusoidal Trainable Activation Functions for Implicit Neural Representation
by: Morsali, Alireza, et al.
Published: (2025)
by: Morsali, Alireza, et al.
Published: (2025)
Benchmarking Skeleton-based Motion Encoder Models for Clinical Applications: Estimating Parkinson's Disease Severity in Walking Sequences
by: Adeli, Vida, et al.
Published: (2024)
by: Adeli, Vida, et al.
Published: (2024)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
by: Liu, Jizhihui, et al.
Published: (2025)
by: Liu, Jizhihui, et al.
Published: (2025)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
by: Huang, Xiaohu, et al.
Published: (2024)
by: Huang, Xiaohu, et al.
Published: (2024)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
by: Sun, Zhichao, et al.
Published: (2026)
by: Sun, Zhichao, et al.
Published: (2026)
Similar Items
-
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
by: Jeddi, Ahmadreza, et al.
Published: (2026) -
Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning
by: Baghbanzadeh, Negin, et al.
Published: (2025) -
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
by: Bagrov, Natan, et al.
Published: (2025) -
PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs
by: Jeddi, Ahmadreza, et al.
Published: (2025) -
FastHMR: Accelerating Human Mesh Recovery via Token and Layer Merging with Diffusion Decoding
by: Mehraban, Soroush, et al.
Published: (2025)