Exploring Token Pruning in Vision State Space Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhan, Zheng, Kong, Zhenglun, Gong, Yifan, Wu, Yushu, Meng, Zichong, Zheng, Hangyu, Shen, Xuan, Ioannidis, Stratis, Niu, Wei, Zhao, Pu, Wang, Yanzhi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Rethinking Token Reduction for State Space Models
por: Zhan, Zheng, et al.
Publicado: (2024)
por: Zhan, Zheng, et al.
Publicado: (2024)
Fast and Memory-Efficient Video Diffusion Using Streamlined Inference
por: Zhan, Zheng, et al.
Publicado: (2024)
por: Zhan, Zheng, et al.
Publicado: (2024)
Enabling Flexible Multi-LLM Integration for Scalable Knowledge Aggregation
por: Kong, Zhenglun, et al.
Publicado: (2025)
por: Kong, Zhenglun, et al.
Publicado: (2025)
Search for Efficient Large Language Models
por: Shen, Xuan, et al.
Publicado: (2024)
por: Shen, Xuan, et al.
Publicado: (2024)
Pruning Foundation Models for High Accuracy without Retraining
por: Zhao, Pu, et al.
Publicado: (2024)
por: Zhao, Pu, et al.
Publicado: (2024)
DiffClass: Diffusion-Based Class Incremental Learning
por: Meng, Zichong, et al.
Publicado: (2024)
por: Meng, Zichong, et al.
Publicado: (2024)
OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation
por: Zhao, Lin, et al.
Publicado: (2026)
por: Zhao, Lin, et al.
Publicado: (2026)
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
por: Liu, Jun, et al.
Publicado: (2024)
por: Liu, Jun, et al.
Publicado: (2024)
Lotus: learning-based online thermal and latency variation management for two-stage detectors on edge devices
por: Gong, Yifan, et al.
Publicado: (2024)
por: Gong, Yifan, et al.
Publicado: (2024)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
por: Zeng, Fanhu, et al.
Publicado: (2025)
por: Zeng, Fanhu, et al.
Publicado: (2025)
Spectral Survival Analysis
por: Shi, Chengzhi, et al.
Publicado: (2025)
por: Shi, Chengzhi, et al.
Publicado: (2025)
ACE: Exploring Activation Cosine Similarity and Variance for Accurate and Calibration-Efficient LLM Pruning
por: Mi, Zhendong, et al.
Publicado: (2025)
por: Mi, Zhendong, et al.
Publicado: (2025)
Squat: Quant Small Language Models on the Edge
por: Shen, Xuan, et al.
Publicado: (2024)
por: Shen, Xuan, et al.
Publicado: (2024)
TSLA: A Task-Specific Learning Adaptation for Semantic Segmentation on Autonomous Vehicles Platform
por: Liu, Jun, et al.
Publicado: (2025)
por: Liu, Jun, et al.
Publicado: (2025)
InstructGIE: Towards Generalizable Image Editing
por: Meng, Zichong, et al.
Publicado: (2024)
por: Meng, Zichong, et al.
Publicado: (2024)
Routing Mamba: Scaling State Space Models with Mixture-of-Experts Projection
por: Zhan, Zheng, et al.
Publicado: (2025)
por: Zhan, Zheng, et al.
Publicado: (2025)
RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
por: Liu, Jun, et al.
Publicado: (2025)
por: Liu, Jun, et al.
Publicado: (2025)
Submodular Maximization via Taylor Series Approximation
por: Özcan, Gözde, et al.
Publicado: (2021)
por: Özcan, Gözde, et al.
Publicado: (2021)
Learning Set Functions with Implicit Differentiation
por: Özcan, Gözde, et al.
Publicado: (2024)
por: Özcan, Gözde, et al.
Publicado: (2024)
AyE-Edge: Automated Deployment Space Search Empowering Accuracy yet Efficient Real-Time Object Detection on the Edge
por: Wu, Chao, et al.
Publicado: (2024)
por: Wu, Chao, et al.
Publicado: (2024)
Rényi Entropy: A New Token Pruning Metric for Vision Transformers
por: Su, Wei-Yuan, et al.
Publicado: (2026)
por: Su, Wei-Yuan, et al.
Publicado: (2026)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
por: Shen, Xuan, et al.
Publicado: (2023)
por: Shen, Xuan, et al.
Publicado: (2023)
Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality
por: Kong, Zhenglun, et al.
Publicado: (2025)
por: Kong, Zhenglun, et al.
Publicado: (2025)
When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making
por: Liu, Jun, et al.
Publicado: (2026)
por: Liu, Jun, et al.
Publicado: (2026)
Can the root cluster remain largest forever in random recursive tree percolation?
por: Zheng, Yushu
Publicado: (2026)
por: Zheng, Yushu
Publicado: (2026)
Online Two-Stage Submodular Maximization
por: Nikolaou, Iasonas, et al.
Publicado: (2025)
por: Nikolaou, Iasonas, et al.
Publicado: (2025)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
por: Liu, Jizhihui, et al.
Publicado: (2025)
por: Liu, Jizhihui, et al.
Publicado: (2025)
ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
por: Zhang, Pu, et al.
Publicado: (2025)
por: Zhang, Pu, et al.
Publicado: (2025)
Vision SmolMamba: Spike-Guided Token Pruning for Energy-Efficient Spiking State-Space Vision Models
por: Bai, Dewei, et al.
Publicado: (2026)
por: Bai, Dewei, et al.
Publicado: (2026)
Structured Agent Distillation for Large Language Model
por: Liu, Jun, et al.
Publicado: (2025)
por: Liu, Jun, et al.
Publicado: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025)
por: Li, Guangyuan, et al.
Publicado: (2025)
Reinforcement Learning-based Token Pruning in Vision Transformers: A Markov Game Approach
por: Lu, Chenglong, et al.
Publicado: (2025)
por: Lu, Chenglong, et al.
Publicado: (2025)
CROP: Contextual Region-Oriented Visual Token Pruning
por: Guo, Jiawei, et al.
Publicado: (2025)
por: Guo, Jiawei, et al.
Publicado: (2025)
LightCache: Memory-Efficient, Training-Free Acceleration for Video Generation
por: Xiao, Yang, et al.
Publicado: (2025)
por: Xiao, Yang, et al.
Publicado: (2025)
ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models
por: Li, Xu, et al.
Publicado: (2026)
por: Li, Xu, et al.
Publicado: (2026)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
por: Lee, Jaewoo, et al.
Publicado: (2025)
por: Lee, Jaewoo, et al.
Publicado: (2025)
DraftAttention: Fast Video Diffusion via Low-Resolution Attention Guidance
por: Shen, Xuan, et al.
Publicado: (2025)
por: Shen, Xuan, et al.
Publicado: (2025)
Dependency-aware Maximum Likelihood Estimation for Active Learning
por: Kalkanli, Beyza, et al.
Publicado: (2025)
por: Kalkanli, Beyza, et al.
Publicado: (2025)
Numerical Pruning for Efficient Autoregressive Models
por: Shen, Xuan, et al.
Publicado: (2024)
por: Shen, Xuan, et al.
Publicado: (2024)
Taming Diffusion for Dataset Distillation with High Representativeness
por: Zhao, Lin, et al.
Publicado: (2025)
por: Zhao, Lin, et al.
Publicado: (2025)
Ejemplares similares
-
Rethinking Token Reduction for State Space Models
por: Zhan, Zheng, et al.
Publicado: (2024) -
Fast and Memory-Efficient Video Diffusion Using Streamlined Inference
por: Zhan, Zheng, et al.
Publicado: (2024) -
Enabling Flexible Multi-LLM Integration for Scalable Knowledge Aggregation
por: Kong, Zhenglun, et al.
Publicado: (2025) -
Search for Efficient Large Language Models
por: Shen, Xuan, et al.
Publicado: (2024) -
Pruning Foundation Models for High Accuracy without Retraining
por: Zhao, Pu, et al.
Publicado: (2024)