Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders
Fuente:
arXiv
Guardado en:
| Autores principales: | Kuo, Shang-Jui Ray, Cascante-Bonilla, Paola |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
por: Pantazopoulos, Georgios, et al.
Publicado: (2024)
por: Pantazopoulos, Georgios, et al.
Publicado: (2024)
Activation Quantization of Vision Encoders Needs Prefixing Registers
por: Kim, Seunghyeon, et al.
Publicado: (2025)
por: Kim, Seunghyeon, et al.
Publicado: (2025)
Localizing Memorization in SSL Vision Encoders
por: Wang, Wenhao, et al.
Publicado: (2024)
por: Wang, Wenhao, et al.
Publicado: (2024)
Breast Cancer VLMs: Clinically Practical Vision-Language Train-Inference Models
por: Zheng, Shunjie-Fabian, et al.
Publicado: (2025)
por: Zheng, Shunjie-Fabian, et al.
Publicado: (2025)
Do Vision and Language Encoders Represent the World Similarly?
por: Maniparambil, Mayug, et al.
Publicado: (2024)
por: Maniparambil, Mayug, et al.
Publicado: (2024)
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
por: Jiang, Yitong, et al.
Publicado: (2026)
por: Jiang, Yitong, et al.
Publicado: (2026)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
por: Tekin, Selim Furkan, et al.
Publicado: (2026)
por: Tekin, Selim Furkan, et al.
Publicado: (2026)
Do We Need Large VLMs for Spotting Soccer Actions?
por: Chakraborty, Ritabrata, et al.
Publicado: (2025)
por: Chakraborty, Ritabrata, et al.
Publicado: (2025)
From Understanding to Engagement: Personalized pharmacy Video Clips via Vision Language Models (VLMs)
por: Mishra, Suyash, et al.
Publicado: (2026)
por: Mishra, Suyash, et al.
Publicado: (2026)
Split Adaptation for Pre-trained Vision Transformers
por: Wang, Lixu, et al.
Publicado: (2025)
por: Wang, Lixu, et al.
Publicado: (2025)
Multimodal Autoregressive Pre-training of Large Vision Encoders
por: Fini, Enrico, et al.
Publicado: (2024)
por: Fini, Enrico, et al.
Publicado: (2024)
PerFormer: A Permutation Based Vision Transformer for Remaining Useful Life Prediction
por: Fan, Zhengyang, et al.
Publicado: (2025)
por: Fan, Zhengyang, et al.
Publicado: (2025)
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
por: Zhu, Lianghui, et al.
Publicado: (2024)
por: Zhu, Lianghui, et al.
Publicado: (2024)
MambaOut: Do We Really Need Mamba for Vision?
por: Yu, Weihao, et al.
Publicado: (2024)
por: Yu, Weihao, et al.
Publicado: (2024)
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
por: Panos, Aristeidis, et al.
Publicado: (2024)
por: Panos, Aristeidis, et al.
Publicado: (2024)
Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference
por: Miranda, Imanol, et al.
Publicado: (2026)
por: Miranda, Imanol, et al.
Publicado: (2026)
Exploring Token Pruning in Vision State Space Models
por: Zhan, Zheng, et al.
Publicado: (2024)
por: Zhan, Zheng, et al.
Publicado: (2024)
Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking
por: Taraday, Mitchell Keren, et al.
Publicado: (2025)
por: Taraday, Mitchell Keren, et al.
Publicado: (2025)
IO Transformer: Evaluating SwinV2-Based Reward Models for Computer Vision
por: Meyer, Maxwell, et al.
Publicado: (2024)
por: Meyer, Maxwell, et al.
Publicado: (2024)
Beyond Gaussian Bottlenecks: Topologically Aligned Encoding of Vision-Transformer Feature Spaces
por: Bond, Andrew, et al.
Publicado: (2026)
por: Bond, Andrew, et al.
Publicado: (2026)
IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
por: Faraz, Ali, et al.
Publicado: (2025)
por: Faraz, Ali, et al.
Publicado: (2025)
Learning from Synthetic Data for Visual Grounding
por: He, Ruozhen, et al.
Publicado: (2024)
por: He, Ruozhen, et al.
Publicado: (2024)
Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language Models
por: Liu, Zhining, et al.
Publicado: (2026)
por: Liu, Zhining, et al.
Publicado: (2026)
OCT Data is All You Need: How Vision Transformers with and without Pre-training Benefit Imaging
por: Han, Zihao, et al.
Publicado: (2025)
por: Han, Zihao, et al.
Publicado: (2025)
Perturbed State Space Feature Encoders for Optical Flow with Event Cameras
por: Raju, Gokul Raju Govinda, et al.
Publicado: (2025)
por: Raju, Gokul Raju Govinda, et al.
Publicado: (2025)
Hybrid Convolution and Vision Transformer NAS Search Space for TinyML Image Classification
por: Djajapermana, Mikhael, et al.
Publicado: (2025)
por: Djajapermana, Mikhael, et al.
Publicado: (2025)
Native Segmentation Vision Transformers
por: Brasó, Guillem, et al.
Publicado: (2025)
por: Brasó, Guillem, et al.
Publicado: (2025)
Exploration of VLMs for Driver Monitoring Systems Applications
por: Cañas, Paola Natalia, et al.
Publicado: (2025)
por: Cañas, Paola Natalia, et al.
Publicado: (2025)
ParFormer: A Vision Transformer with Parallel Mixer and Sparse Channel Attention Patch Embedding
por: Setyawan, Novendra, et al.
Publicado: (2024)
por: Setyawan, Novendra, et al.
Publicado: (2024)
How Much Information Can a Vision Token Hold? A Scaling Law for Recognition Limits in VLMs
por: Zhuang, Shuxin, et al.
Publicado: (2026)
por: Zhuang, Shuxin, et al.
Publicado: (2026)
UniFusion: Vision-Language Model as Unified Encoder in Image Generation
por: Li, Kevin, et al.
Publicado: (2025)
por: Li, Kevin, et al.
Publicado: (2025)
Intriguing Equivalence Structures of the Embedding Space of Vision Transformers
por: Salman, Shaeke, et al.
Publicado: (2024)
por: Salman, Shaeke, et al.
Publicado: (2024)
Do Vision Foundation Models Enhance Domain Generalization in Medical Image Segmentation?
por: Cekmeceli, Kerem, et al.
Publicado: (2024)
por: Cekmeceli, Kerem, et al.
Publicado: (2024)
GrootVL: Tree Topology is All You Need in State Space Model
por: Xiao, Yicheng, et al.
Publicado: (2024)
por: Xiao, Yicheng, et al.
Publicado: (2024)
RAViT: Resolution-Adaptive Vision Transformer
por: Guidez, Martial, et al.
Publicado: (2026)
por: Guidez, Martial, et al.
Publicado: (2026)
Slicing Vision Transformer for Flexible Inference
por: Zhang, Yitian, et al.
Publicado: (2024)
por: Zhang, Yitian, et al.
Publicado: (2024)
Rotary Position Embedding for Vision Transformer
por: Heo, Byeongho, et al.
Publicado: (2024)
por: Heo, Byeongho, et al.
Publicado: (2024)
Decorrelation Speeds Up Vision Transformers
por: Carrigg, Kieran, et al.
Publicado: (2025)
por: Carrigg, Kieran, et al.
Publicado: (2025)
Hierarchical Pre-Training of Vision Encoders with Large Language Models
por: Lee, Eugene, et al.
Publicado: (2026)
por: Lee, Eugene, et al.
Publicado: (2026)
Multi-Modal Landslide Detection from Sentinel-1 SAR and Sentinel-2 Optical Imagery Using Multi-Encoder Vision Transformers and Ensemble Learning
por: Nasios, Ioannis
Publicado: (2026)
por: Nasios, Ioannis
Publicado: (2026)
Ejemplares similares
-
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
por: Pantazopoulos, Georgios, et al.
Publicado: (2024) -
Activation Quantization of Vision Encoders Needs Prefixing Registers
por: Kim, Seunghyeon, et al.
Publicado: (2025) -
Localizing Memorization in SSL Vision Encoders
por: Wang, Wenhao, et al.
Publicado: (2024) -
Breast Cancer VLMs: Clinically Practical Vision-Language Train-Inference Models
por: Zheng, Shunjie-Fabian, et al.
Publicado: (2025) -
Do Vision and Language Encoders Represent the World Similarly?
por: Maniparambil, Mayug, et al.
Publicado: (2024)