VMamba: Visual State Space Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yue, Tian, Yunjie, Zhao, Yuzhong, Yu, Hongtian, Xie, Lingxi, Wang, Yaowei, Ye, Qixiang, Jiao, Jianbin, Liu, Yunfan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Spatial Transform Decoupling for Oriented Object Detection
par: Yu, Hongtian, et autres
Publié: (2023)
par: Yu, Hongtian, et autres
Publié: (2023)
Fast-iTPN: Integrally Pre-Trained Transformer Pyramid Network with Token Migration
par: Tian, Yunjie, et autres
Publié: (2022)
par: Tian, Yunjie, et autres
Publié: (2022)
Building Vision Models upon Heat Conduction
par: Wang, Zhaozhi, et autres
Publié: (2024)
par: Wang, Zhaozhi, et autres
Publié: (2024)
Adaptive Keyframe Sampling for Long Video Understanding
par: Tang, Xi, et autres
Publié: (2025)
par: Tang, Xi, et autres
Publié: (2025)
ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension
par: Ma, Tianren, et autres
Publié: (2024)
par: Ma, Tianren, et autres
Publié: (2024)
CC-Diff: Enhancing Contextual Coherence in Remote Sensing Image Synthesis
par: Zhang, Mu, et autres
Publié: (2024)
par: Zhang, Mu, et autres
Publié: (2024)
ChatterBox: Multi-round Multimodal Referring and Grounding
par: Tian, Yunjie, et autres
Publié: (2024)
par: Tian, Yunjie, et autres
Publié: (2024)
VMambaCC: A Visual State Space Model for Crowd Counting
par: Ma, Hao-Yuan, et autres
Publié: (2024)
par: Ma, Hao-Yuan, et autres
Publié: (2024)
Multi-Scale VMamba: Hierarchy in Hierarchy Visual State Space Model
par: Shi, Yuheng, et autres
Publié: (2024)
par: Shi, Yuheng, et autres
Publié: (2024)
Self-supervised Feature-Gate Coupling for Dynamic Network Pruning
par: Shi, Mengnan, et autres
Publié: (2021)
par: Shi, Mengnan, et autres
Publié: (2021)
YOLOv12: Attention-Centric Real-Time Object Detectors
par: Tian, Yunjie, et autres
Publié: (2025)
par: Tian, Yunjie, et autres
Publié: (2025)
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
par: Qiu, Jihao, et autres
Publié: (2026)
par: Qiu, Jihao, et autres
Publié: (2026)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
par: Wang, Zhaozhi, et autres
Publié: (2025)
par: Wang, Zhaozhi, et autres
Publié: (2025)
Thinking with Images via Self-Calling Agent
par: Yang, Wenxi, et autres
Publié: (2025)
par: Yang, Wenxi, et autres
Publié: (2025)
DynRefer: Delving into Region-level Multimodal Tasks via Dynamic Resolution
par: Zhao, Yuzhong, et autres
Publié: (2024)
par: Zhao, Yuzhong, et autres
Publié: (2024)
VMambaMorph: a Multi-Modality Deformable Image Registration Framework based on Visual State Space Model with Cross-Scan Module
par: Wang, Ziyang, et autres
Publié: (2024)
par: Wang, Ziyang, et autres
Publié: (2024)
Expandable Residual Approximation for Knowledge Distillation
par: Yan, Zhaoyi, et autres
Publié: (2025)
par: Yan, Zhaoyi, et autres
Publié: (2025)
ControlCap: Controllable Region-level Captioning
par: Zhao, Yuzhong, et autres
Publié: (2024)
par: Zhao, Yuzhong, et autres
Publié: (2024)
Artemis: Towards Referential Understanding in Complex Videos
par: Qiu, Jihao, et autres
Publié: (2024)
par: Qiu, Jihao, et autres
Publié: (2024)
Res-VMamba: Fine-Grained Food Category Visual Classification Using Selective State Space Models with Deep Residual Learning
par: Chen, Chi-Sheng, et autres
Publié: (2024)
par: Chen, Chi-Sheng, et autres
Publié: (2024)
Depth-guided Texture Diffusion for Image Semantic Segmentation
par: Sun, Wei, et autres
Publié: (2024)
par: Sun, Wei, et autres
Publié: (2024)
Vision Calorimeter for Anti-neutron Reconstruction: A Baseline
par: Yu, Hongtian, et autres
Publié: (2024)
par: Yu, Hongtian, et autres
Publié: (2024)
ClickTrack: Towards Real-time Interactive Single Object Tracking
par: Wang, Kuiran, et autres
Publié: (2024)
par: Wang, Kuiran, et autres
Publié: (2024)
Rethinking Sampling Strategies for Unsupervised Person Re-identification
par: Han, Xumeng, et autres
Publié: (2021)
par: Han, Xumeng, et autres
Publié: (2021)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
par: He, Xin, et autres
Publié: (2024)
par: He, Xin, et autres
Publié: (2024)
Virtual Classification: Modulating Domain-Specific Knowledge for Multidomain Crowd Counting
par: Guo, Mingyue, et autres
Publié: (2024)
par: Guo, Mingyue, et autres
Publié: (2024)
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
par: Liu, Feng, et autres
Publié: (2024)
par: Liu, Feng, et autres
Publié: (2024)
P2Object: Single Point Supervised Object Detection and Instance Segmentation
par: Chen, Pengfei, et autres
Publié: (2025)
par: Chen, Pengfei, et autres
Publié: (2025)
CPR++: Object Localization via Single Coarse Point Supervision
par: Yu, Xuehui, et autres
Publié: (2024)
par: Yu, Xuehui, et autres
Publié: (2024)
EfficientVMamba: Atrous Selective Scan for Light Weight Visual Mamba
par: Pei, Xiaohuan, et autres
Publié: (2024)
par: Pei, Xiaohuan, et autres
Publié: (2024)
Uncertainty-guided Optimal Transport in Depth Supervised Sparse-View 3D Gaussian
par: Sun, Wei, et autres
Publié: (2024)
par: Sun, Wei, et autres
Publié: (2024)
Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending
par: Hou, Jingqi, et autres
Publié: (2026)
par: Hou, Jingqi, et autres
Publié: (2026)
Evaluation of Text-to-Video Generation Models: A Dynamics Perspective
par: Liao, Mingxiang, et autres
Publié: (2024)
par: Liao, Mingxiang, et autres
Publié: (2024)
Regressor-Segmenter Mutual Prompt Learning for Crowd Counting
par: Guo, Mingyue, et autres
Publié: (2023)
par: Guo, Mingyue, et autres
Publié: (2023)
CAST: Modeling Visual State Transitions for Consistent Video Retrieval
par: Liu, Yanqing, et autres
Publié: (2026)
par: Liu, Yanqing, et autres
Publié: (2026)
Text-Animator: Controllable Visual Text Video Generation
par: Liu, Lin, et autres
Publié: (2024)
par: Liu, Lin, et autres
Publié: (2024)
Mamba-Adaptor: State Space Model Adaptor for Visual Recognition
par: Xie, Fei, et autres
Publié: (2025)
par: Xie, Fei, et autres
Publié: (2025)
Correspondence-Guided SfM-Free 3D Gaussian Splatting for NVS
par: Sun, Wei, et autres
Publié: (2024)
par: Sun, Wei, et autres
Publié: (2024)
X-VMamba: Explainable Vision Mamba
par: Mabrok, Mohamed A., et autres
Publié: (2025)
par: Mabrok, Mohamed A., et autres
Publié: (2025)
Delving Deep into Semantic Relation Distillation
par: Yan, Zhaoyi, et autres
Publié: (2025)
par: Yan, Zhaoyi, et autres
Publié: (2025)
Documents similaires
-
Spatial Transform Decoupling for Oriented Object Detection
par: Yu, Hongtian, et autres
Publié: (2023) -
Fast-iTPN: Integrally Pre-Trained Transformer Pyramid Network with Token Migration
par: Tian, Yunjie, et autres
Publié: (2022) -
Building Vision Models upon Heat Conduction
par: Wang, Zhaozhi, et autres
Publié: (2024) -
Adaptive Keyframe Sampling for Long Video Understanding
par: Tang, Xi, et autres
Publié: (2025) -
ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension
par: Ma, Tianren, et autres
Publié: (2024)