TCP-SSM: Efficient Vision State Space Models with Token-Conditioned Poles
Fuente:
arXiv
Guardado en:
| Autores principales: | Shoouri, Sara, Taba, Morteza Tavakoli, Kim, Hun-Seok |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Adaptive LiDAR Scanning: Harnessing Temporal Cues for Efficient 3D Object Detection via Multi-Modal Fusion
por: Shoouri, Sara, et al.
Publicado: (2025)
por: Shoouri, Sara, et al.
Publicado: (2025)
SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces
por: Oshima, Yuta, et al.
Publicado: (2024)
por: Oshima, Yuta, et al.
Publicado: (2024)
UST-SSM: Unified Spatio-Temporal State Space Models for Point Cloud Video Modeling
por: Li, Peiming, et al.
Publicado: (2025)
por: Li, Peiming, et al.
Publicado: (2025)
Cortical-SSM: A Deep State Space Model for EEG and ECoG Motor Imagery Decoding
por: Suzuki, Shuntaro, et al.
Publicado: (2025)
por: Suzuki, Shuntaro, et al.
Publicado: (2025)
Exploring Token Pruning in Vision State Space Models
por: Zhan, Zheng, et al.
Publicado: (2024)
por: Zhan, Zheng, et al.
Publicado: (2024)
QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models
por: Chi, Tien-Yu, et al.
Publicado: (2025)
por: Chi, Tien-Yu, et al.
Publicado: (2025)
Frequency-Aware Token Reduction for Efficient Vision Transformer
por: Lee, Dong-Jae, et al.
Publicado: (2025)
por: Lee, Dong-Jae, et al.
Publicado: (2025)
Can Vision-Language Models Understand Construction Workers? An Exploratory Study
por: Bui, Hieu, et al.
Publicado: (2026)
por: Bui, Hieu, et al.
Publicado: (2026)
Deformba: Vision State Space Model with Adaptive State Fusion
por: Ke, Hongyu, et al.
Publicado: (2026)
por: Ke, Hongyu, et al.
Publicado: (2026)
Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models
por: Apedo, Yvon, et al.
Publicado: (2026)
por: Apedo, Yvon, et al.
Publicado: (2026)
Surface Vision Mamba: Leveraging Bidirectional State Space Model for Efficient Spherical Manifold Representation
por: He, Rongzhao, et al.
Publicado: (2025)
por: He, Rongzhao, et al.
Publicado: (2025)
SF-Mamba: Rethinking State Space Model for Vision
por: Yoshimura, Masakazu, et al.
Publicado: (2026)
por: Yoshimura, Masakazu, et al.
Publicado: (2026)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
por: He, Jialuo, et al.
Publicado: (2026)
por: He, Jialuo, et al.
Publicado: (2026)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
por: He, Yefei, et al.
Publicado: (2024)
por: He, Yefei, et al.
Publicado: (2024)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
por: Li, Ao, et al.
Publicado: (2025)
por: Li, Ao, et al.
Publicado: (2025)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
por: Kim, Sohee, et al.
Publicado: (2025)
por: Kim, Sohee, et al.
Publicado: (2025)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
por: Meng, Yu, et al.
Publicado: (2025)
por: Meng, Yu, et al.
Publicado: (2025)
Gather-Scatter Mamba: Accelerating Propagation with Efficient State Space Model
por: Ko, Hyun-kyu, et al.
Publicado: (2025)
por: Ko, Hyun-kyu, et al.
Publicado: (2025)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
por: Lee, Dong-Jae, et al.
Publicado: (2026)
por: Lee, Dong-Jae, et al.
Publicado: (2026)
MambaMixer: Efficient Selective State Space Models with Dual Token and Channel Selection
por: Behrouz, Ali, et al.
Publicado: (2024)
por: Behrouz, Ali, et al.
Publicado: (2024)
Topological Alignment of Shared Vision-Language Embedding Space
por: You, Junwon, et al.
Publicado: (2025)
por: You, Junwon, et al.
Publicado: (2025)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025)
por: Li, Guangyuan, et al.
Publicado: (2025)
Differentiable Learning of Generalized Structured Matrices for Efficient Deep Neural Networks
por: Lee, Changwoo, et al.
Publicado: (2023)
por: Lee, Changwoo, et al.
Publicado: (2023)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
por: Qian, Chen, et al.
Publicado: (2026)
por: Qian, Chen, et al.
Publicado: (2026)
Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
por: Yang, Zhiyuan, et al.
Publicado: (2026)
por: Yang, Zhiyuan, et al.
Publicado: (2026)
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
por: Wen, Yuxin, et al.
Publicado: (2024)
por: Wen, Yuxin, et al.
Publicado: (2024)
Faster Parameter-Efficient Tuning with Token Redundancy Reduction
por: Kim, Kwonyoung, et al.
Publicado: (2025)
por: Kim, Kwonyoung, et al.
Publicado: (2025)
Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers
por: Lee, Dong Hoon, et al.
Publicado: (2024)
por: Lee, Dong Hoon, et al.
Publicado: (2024)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
por: Li, Jianjian, et al.
Publicado: (2025)
por: Li, Jianjian, et al.
Publicado: (2025)
HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models
por: Arif, Kazi Hasan Ibn, et al.
Publicado: (2024)
por: Arif, Kazi Hasan Ibn, et al.
Publicado: (2024)
CoDA: Exploring Chain-of-Distribution Attacks and Post-Hoc Token-Space Repair for Medical Vision-Language Models
por: Chen, Xiang, et al.
Publicado: (2026)
por: Chen, Xiang, et al.
Publicado: (2026)
A Separable Self-attention Inspired by the State Space Model for Computer Vision
por: Zhang, Juntao, et al.
Publicado: (2025)
por: Zhang, Juntao, et al.
Publicado: (2025)
Rethinking Token Reduction for Large Vision-Language Models
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space
por: Lim, Sohwi, et al.
Publicado: (2026)
por: Lim, Sohwi, et al.
Publicado: (2026)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
por: Xu, Xuwei, et al.
Publicado: (2023)
por: Xu, Xuwei, et al.
Publicado: (2023)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
por: Tang, Hao, et al.
Publicado: (2025)
por: Tang, Hao, et al.
Publicado: (2025)
Spectral Vision Transformer for Efficient Tokenization with Limited Data
por: Roberts, Alexandra G., et al.
Publicado: (2026)
por: Roberts, Alexandra G., et al.
Publicado: (2026)
MambaLoc: Efficient Camera Localisation via State Space Model
por: Wang, Jialu, et al.
Publicado: (2024)
por: Wang, Jialu, et al.
Publicado: (2024)
SAMamba: Adaptive State Space Modeling with Hierarchical Vision for Infrared Small Target Detection
por: Xu, Wenhao, et al.
Publicado: (2025)
por: Xu, Wenhao, et al.
Publicado: (2025)
Ejemplares similares
-
Adaptive LiDAR Scanning: Harnessing Temporal Cues for Efficient 3D Object Detection via Multi-Modal Fusion
por: Shoouri, Sara, et al.
Publicado: (2025) -
SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces
por: Oshima, Yuta, et al.
Publicado: (2024) -
UST-SSM: Unified Spatio-Temporal State Space Models for Point Cloud Video Modeling
por: Li, Peiming, et al.
Publicado: (2025) -
Cortical-SSM: A Deep State Space Model for EEG and ECoG Motor Imagery Decoding
por: Suzuki, Shuntaro, et al.
Publicado: (2025) -
Exploring Token Pruning in Vision State Space Models
por: Zhan, Zheng, et al.
Publicado: (2024)