A Separable Self-attention Inspired by the State Space Model for Computer Vision
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Juntao, Liu, Shaogeng, Bian, Kun, Zhou, You, Zhang, Pei, Liu, Jianning, Zhou, Jun, Liu, Bingyan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Vim-F: Visual State Space Model Benefiting from Learning in the Frequency Domain
por: Zhang, Juntao, et al.
Publicado: (2024)
por: Zhang, Juntao, et al.
Publicado: (2024)
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
por: Liu, Hanpeng, et al.
Publicado: (2026)
por: Liu, Hanpeng, et al.
Publicado: (2026)
Deformba: Vision State Space Model with Adaptive State Fusion
por: Ke, Hongyu, et al.
Publicado: (2026)
por: Ke, Hongyu, et al.
Publicado: (2026)
Unified Medical Image Segmentation with State Space Modeling Snake
por: Zhang, Ruicheng, et al.
Publicado: (2025)
por: Zhang, Ruicheng, et al.
Publicado: (2025)
Masked Modeling for Self-supervised Representation Learning on Vision and Beyond
por: Li, Siyuan, et al.
Publicado: (2023)
por: Li, Siyuan, et al.
Publicado: (2023)
CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications
por: Zhang, Tianfang, et al.
Publicado: (2024)
por: Zhang, Tianfang, et al.
Publicado: (2024)
LocalMamba: Visual State Space Model with Windowed Selective Scan
por: Huang, Tao, et al.
Publicado: (2024)
por: Huang, Tao, et al.
Publicado: (2024)
Mamba-CAD: State Space Model For 3D Computer-Aided Design Generative Modeling
por: Li, Xueyang, et al.
Publicado: (2026)
por: Li, Xueyang, et al.
Publicado: (2026)
Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play
por: Wang, Qinsi, et al.
Publicado: (2025)
por: Wang, Qinsi, et al.
Publicado: (2025)
Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling
por: Wang, Huanzhen, et al.
Publicado: (2026)
por: Wang, Huanzhen, et al.
Publicado: (2026)
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
por: Liu, Xinqi, et al.
Publicado: (2024)
por: Liu, Xinqi, et al.
Publicado: (2024)
VFIMamba: Video Frame Interpolation with State Space Models
por: Zhang, Guozhen, et al.
Publicado: (2024)
por: Zhang, Guozhen, et al.
Publicado: (2024)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
State Space Model Meets Transformer: A New Paradigm for 3D Object Detection
por: Wang, Chuxin, et al.
Publicado: (2025)
por: Wang, Chuxin, et al.
Publicado: (2025)
Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning
por: You, Xiaoxing, et al.
Publicado: (2025)
por: You, Xiaoxing, et al.
Publicado: (2025)
MRN: Harnessing 2D Vision Foundation Models for Diagnosing Parkinson's Disease with Limited 3D MR Data
por: Shaodong, Ding, et al.
Publicado: (2025)
por: Shaodong, Ding, et al.
Publicado: (2025)
ECMamba: Consolidating Selective State Space Model with Retinex Guidance for Efficient Multiple Exposure Correction
por: Dong, Wei, et al.
Publicado: (2024)
por: Dong, Wei, et al.
Publicado: (2024)
Towards Self-Refinement of Vision-Language Models with Triangular Consistency
por: Deng, Yunlong, et al.
Publicado: (2025)
por: Deng, Yunlong, et al.
Publicado: (2025)
Trustworthy Large Models in Vision: A Survey
por: Guo, Ziyan, et al.
Publicado: (2023)
por: Guo, Ziyan, et al.
Publicado: (2023)
Vision-Language Models Can Self-Improve Reasoning via Reflection
por: Cheng, Kanzhi, et al.
Publicado: (2024)
por: Cheng, Kanzhi, et al.
Publicado: (2024)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
por: Ding, Kun, et al.
Publicado: (2022)
por: Ding, Kun, et al.
Publicado: (2022)
Enhancing Adversarial Robustness of Vision-Language Models through Low-Rank Adaptation
por: Ji, Yuheng, et al.
Publicado: (2024)
por: Ji, Yuheng, et al.
Publicado: (2024)
SF-Mamba: Rethinking State Space Model for Vision
por: Yoshimura, Masakazu, et al.
Publicado: (2026)
por: Yoshimura, Masakazu, et al.
Publicado: (2026)
Vision Generalist Model: A Survey
por: Wang, Ziyi, et al.
Publicado: (2025)
por: Wang, Ziyi, et al.
Publicado: (2025)
SAMamba: Adaptive State Space Modeling with Hierarchical Vision for Infrared Small Target Detection
por: Xu, Wenhao, et al.
Publicado: (2025)
por: Xu, Wenhao, et al.
Publicado: (2025)
MVP-CBM:Multi-layer Visual Preference-enhanced Concept Bottleneck Model for Explainable Medical Image Classification
por: Wang, Chunjiang, et al.
Publicado: (2025)
por: Wang, Chunjiang, et al.
Publicado: (2025)
SSMamba: A Self-Supervised Hybrid State Space Model for Pathological Image Classification
por: Chai, Enhui, et al.
Publicado: (2026)
por: Chai, Enhui, et al.
Publicado: (2026)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
por: He, Yefei, et al.
Publicado: (2024)
por: He, Yefei, et al.
Publicado: (2024)
From Local Cues to Global Percepts: Emergent Gestalt Organization in Self-Supervised Vision Models
por: Li, Tianqin, et al.
Publicado: (2025)
por: Li, Tianqin, et al.
Publicado: (2025)
All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
por: Zhang, Chunhui, et al.
Publicado: (2023)
por: Zhang, Chunhui, et al.
Publicado: (2023)
Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models
por: Wu, Rining, et al.
Publicado: (2024)
por: Wu, Rining, et al.
Publicado: (2024)
Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding
por: Yan, Haiyang, et al.
Publicado: (2026)
por: Yan, Haiyang, et al.
Publicado: (2026)
MemoryMamba: Memory-Augmented State Space Model for Defect Recognition
por: Wang, Qianning, et al.
Publicado: (2024)
por: Wang, Qianning, et al.
Publicado: (2024)
InsectMamba: Insect Pest Classification with State Space Model
por: Wang, Qianning, et al.
Publicado: (2024)
por: Wang, Qianning, et al.
Publicado: (2024)
GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
por: Zhang, Jensen, et al.
Publicado: (2025)
por: Zhang, Jensen, et al.
Publicado: (2025)
LIBERO-X: Robustness Litmus for Vision-Language-Action Models
por: Wang, Guodong, et al.
Publicado: (2026)
por: Wang, Guodong, et al.
Publicado: (2026)
Vision-Language Consistency Guided Multi-modal Prompt Learning for Blind AI Generated Image Quality Assessment
por: Fu, Jun, et al.
Publicado: (2024)
por: Fu, Jun, et al.
Publicado: (2024)
POINTS: Improving Your Vision-language Model with Affordable Strategies
por: Liu, Yuan, et al.
Publicado: (2024)
por: Liu, Yuan, et al.
Publicado: (2024)
UST-SSM: Unified Spatio-Temporal State Space Models for Point Cloud Video Modeling
por: Li, Peiming, et al.
Publicado: (2025)
por: Li, Peiming, et al.
Publicado: (2025)
BioVFM-21M: Benchmarking and Scaling Self-Supervised Vision Foundation Models for Biomedical Image Analysis
por: Liu, Jiarun, et al.
Publicado: (2025)
por: Liu, Jiarun, et al.
Publicado: (2025)
Ejemplares similares
-
Vim-F: Visual State Space Model Benefiting from Learning in the Frequency Domain
por: Zhang, Juntao, et al.
Publicado: (2024) -
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
por: Liu, Hanpeng, et al.
Publicado: (2026) -
Deformba: Vision State Space Model with Adaptive State Fusion
por: Ke, Hongyu, et al.
Publicado: (2026) -
Unified Medical Image Segmentation with State Space Modeling Snake
por: Zhang, Ruicheng, et al.
Publicado: (2025) -
Masked Modeling for Self-supervised Representation Learning on Vision and Beyond
por: Li, Siyuan, et al.
Publicado: (2023)