Multi-Scale VMamba: Hierarchy in Hierarchy Visual State Space Model
Fuente:
arXiv
Saved in:
| Main Authors: | Shi, Yuheng, Dong, Minjing, Xu, Chang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VSSD: Vision Mamba with Non-Causal State Space Duality
by: Shi, Yuheng, et al.
Published: (2024)
by: Shi, Yuheng, et al.
Published: (2024)
VMamba: Visual State Space Model
by: Liu, Yue, et al.
Published: (2024)
by: Liu, Yue, et al.
Published: (2024)
Harnessing Vision Foundation Models for High-Performance, Training-Free Open Vocabulary Segmentation
by: Shi, Yuheng, et al.
Published: (2024)
by: Shi, Yuheng, et al.
Published: (2024)
VMambaCC: A Visual State Space Model for Crowd Counting
by: Ma, Hao-Yuan, et al.
Published: (2024)
by: Ma, Hao-Yuan, et al.
Published: (2024)
Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception
by: Shi, Yuheng, et al.
Published: (2025)
by: Shi, Yuheng, et al.
Published: (2025)
Learning Visual Hierarchies in Hyperbolic Space for Image Retrieval
by: Wang, Ziwei, et al.
Published: (2024)
by: Wang, Ziwei, et al.
Published: (2024)
Res-VMamba: Fine-Grained Food Category Visual Classification Using Selective State Space Models with Deep Residual Learning
by: Chen, Chi-Sheng, et al.
Published: (2024)
by: Chen, Chi-Sheng, et al.
Published: (2024)
Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models
by: Shi, Yuheng, et al.
Published: (2026)
by: Shi, Yuheng, et al.
Published: (2026)
VMambaMorph: a Multi-Modality Deformable Image Registration Framework based on Visual State Space Model with Cross-Scan Module
by: Wang, Ziyang, et al.
Published: (2024)
by: Wang, Ziyang, et al.
Published: (2024)
EfficientVMamba: Atrous Selective Scan for Light Weight Visual Mamba
by: Pei, Xiaohuan, et al.
Published: (2024)
by: Pei, Xiaohuan, et al.
Published: (2024)
HiH: A Multi-modal Hierarchy in Hierarchy Network for Unconstrained Gait Recognition
by: Wang, Lei, et al.
Published: (2023)
by: Wang, Lei, et al.
Published: (2023)
Improving Visual Recognition with Hyperbolical Visual Hierarchy Mapping
by: Kwon, Hyeongjun, et al.
Published: (2024)
by: Kwon, Hyeongjun, et al.
Published: (2024)
Efficient Image-to-Image Diffusion Classifier for Adversarial Robustness
by: Mei, Hefei, et al.
Published: (2024)
by: Mei, Hefei, et al.
Published: (2024)
Emergent Visual-Semantic Hierarchies in Image-Text Representations
by: Alper, Morris, et al.
Published: (2024)
by: Alper, Morris, et al.
Published: (2024)
Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
by: Zhang, Xu, et al.
Published: (2025)
by: Zhang, Xu, et al.
Published: (2025)
HyNeuralMap: Hyperbolic Mapping of Visual Semantics to Neural Hierarchies
by: Ma, Zihan, et al.
Published: (2026)
by: Ma, Zihan, et al.
Published: (2026)
Feature Clipping for Uncertainty Calibration
by: Tao, Linwei, et al.
Published: (2024)
by: Tao, Linwei, et al.
Published: (2024)
VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models
by: Mei, Hefei, et al.
Published: (2025)
by: Mei, Hefei, et al.
Published: (2025)
Beyond One-Hot Labels: Semantic Mixing for Model Calibration
by: Luo, Haoyang, et al.
Published: (2025)
by: Luo, Haoyang, et al.
Published: (2025)
VMGNet: A Low Computational Complexity Robotic Grasping Network Based on VMamba with Multi-Scale Feature Fusion
by: Jin, Yuhao, et al.
Published: (2024)
by: Jin, Yuhao, et al.
Published: (2024)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
by: Zhu, Younan, et al.
Published: (2025)
by: Zhu, Younan, et al.
Published: (2025)
Understanding Robustness of Visual State Space Models for Image Classification
by: Du, Chengbin, et al.
Published: (2024)
by: Du, Chengbin, et al.
Published: (2024)
Learning Procedural-aware Video Representations through State-Grounded Hierarchy Unfolding
by: Zhao, Jinghan, et al.
Published: (2025)
by: Zhao, Jinghan, et al.
Published: (2025)
Light Cones For Vision: Simple Causal Priors For Visual Hierarchy
by: Kartik, Manglam, et al.
Published: (2026)
by: Kartik, Manglam, et al.
Published: (2026)
H2G: Hierarchy-Aware Hyperbolic Grouping for 3D Scenes
by: Ko, ByungHa, et al.
Published: (2026)
by: Ko, ByungHa, et al.
Published: (2026)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
by: Zheng, Naishan, et al.
Published: (2025)
by: Zheng, Naishan, et al.
Published: (2025)
HieraSurg: Hierarchy-Aware Diffusion Model for Surgical Video Generation
by: Biagini, Diego, et al.
Published: (2025)
by: Biagini, Diego, et al.
Published: (2025)
HAFormer: Unleashing the Power of Hierarchy-Aware Features for Lightweight Semantic Segmentation
by: Xu, Guoan, et al.
Published: (2024)
by: Xu, Guoan, et al.
Published: (2024)
PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention
by: Mei, Hefei, et al.
Published: (2026)
by: Mei, Hefei, et al.
Published: (2026)
Hyperspectral Unmixing Hierarchies
by: Garrett, Joseph L., et al.
Published: (2026)
by: Garrett, Joseph L., et al.
Published: (2026)
Sample Margin-Aware Recalibration of Temperature Scaling
by: Guo, Haolan, et al.
Published: (2025)
by: Guo, Haolan, et al.
Published: (2025)
IHF-Harmony: Multi-Modality Magnetic Resonance Images Harmonization using Invertible Hierarchy Flow Model
by: Zhu, Pengli, et al.
Published: (2026)
by: Zhu, Pengli, et al.
Published: (2026)
Learning Action Hierarchies via Hybrid Geometric Diffusion
by: Kaushik, Arjun Ramesh, et al.
Published: (2026)
by: Kaushik, Arjun Ramesh, et al.
Published: (2026)
Diversifying Counterattacks: Orthogonal Exploration for Robust CLIP Inference
by: Jiang, Chengze, et al.
Published: (2025)
by: Jiang, Chengze, et al.
Published: (2025)
Representing Long Volumetric Video with Temporal Gaussian Hierarchy
by: Xu, Zhen, et al.
Published: (2024)
by: Xu, Zhen, et al.
Published: (2024)
VFM-Loc: Zero-Shot Cross-View Geo-Localization via Aligning Discriminative Visual Hierarchies
by: Lu, Jun, et al.
Published: (2026)
by: Lu, Jun, et al.
Published: (2026)
X-VMamba: Explainable Vision Mamba
by: Mabrok, Mohamed A., et al.
Published: (2025)
by: Mabrok, Mohamed A., et al.
Published: (2025)
HyperPath: Knowledge-Guided Hyperbolic Semantic Hierarchy Modeling for WSI Analysis
by: Huang, Peixiang, et al.
Published: (2025)
by: Huang, Peixiang, et al.
Published: (2025)
Hierarchy-Aware Fine-Tuning of Vision-Language Models
by: Li, Jiayu, et al.
Published: (2025)
by: Li, Jiayu, et al.
Published: (2025)
Hierarchy-Guided Multimodal Representation Learning for Taxonomic Inference
by: Ahmed, Sk Miraj, et al.
Published: (2026)
by: Ahmed, Sk Miraj, et al.
Published: (2026)
Similar Items
-
VSSD: Vision Mamba with Non-Causal State Space Duality
by: Shi, Yuheng, et al.
Published: (2024) -
VMamba: Visual State Space Model
by: Liu, Yue, et al.
Published: (2024) -
Harnessing Vision Foundation Models for High-Performance, Training-Free Open Vocabulary Segmentation
by: Shi, Yuheng, et al.
Published: (2024) -
VMambaCC: A Visual State Space Model for Crowd Counting
by: Ma, Hao-Yuan, et al.
Published: (2024) -
Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception
by: Shi, Yuheng, et al.
Published: (2025)