DAMamba: Vision State Space Model with Dynamic Adaptive Scan
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Tanzhe, Li, Caoshuo, Lyu, Jiayi, Pei, Hongjuan, Zhang, Baochang, Jin, Taisong, Ji, Rongrong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DVHGNN: Multi-Scale Dilated Vision HGNN for Efficient Vision Recognition
by: Li, Caoshuo, et al.
Published: (2025)
by: Li, Caoshuo, et al.
Published: (2025)
OracleFusion: Assisting the Decipherment of Oracle Bone Script with Structurally Constrained Semantic Typography
by: Li, Caoshuo, et al.
Published: (2025)
by: Li, Caoshuo, et al.
Published: (2025)
Partial Ring Scan: Revisiting Scan Order in Vision State Space Models
by: Hsieh, Yi-Kuan, et al.
Published: (2026)
by: Hsieh, Yi-Kuan, et al.
Published: (2026)
Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models
by: Wu, Mingrui, et al.
Published: (2024)
by: Wu, Mingrui, et al.
Published: (2024)
Scalable Visual State Space Model with Fractal Scanning
by: Tang, Lv, et al.
Published: (2024)
by: Tang, Lv, et al.
Published: (2024)
Beyond Global Scanning: Adaptive Visual State Space Modeling for Salient Object Detection in Optical Remote Sensing Images
by: Ren, Mengyu, et al.
Published: (2025)
by: Ren, Mengyu, et al.
Published: (2025)
Inter2Former: Dynamic Hybrid Attention for Efficient High-Precision Interactive
by: Huang, You, et al.
Published: (2025)
by: Huang, You, et al.
Published: (2025)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
by: Li, Jiale, et al.
Published: (2025)
by: Li, Jiale, et al.
Published: (2025)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
by: Wu, Mingrui, et al.
Published: (2026)
by: Wu, Mingrui, et al.
Published: (2026)
Mixed Degradation Image Restoration via Local Dynamic Optimization and Conditional Embedding
by: Gu, Yubin, et al.
Published: (2024)
by: Gu, Yubin, et al.
Published: (2024)
LocalMamba: Visual State Space Model with Windowed Selective Scan
by: Huang, Tao, et al.
Published: (2024)
by: Huang, Tao, et al.
Published: (2024)
Image Captioning via Dynamic Path Customization
by: Ma, Yiwei, et al.
Published: (2024)
by: Ma, Yiwei, et al.
Published: (2024)
Prototype-Based Test-Time Adaptation of Vision-Language Models
by: Huang, Zhaohong, et al.
Published: (2026)
by: Huang, Zhaohong, et al.
Published: (2026)
CD-Lamba: Boosting Remote Sensing Change Detection via a Cross-Temporal Locally Adaptive State Space Model
by: Wu, Zhenkai, et al.
Published: (2025)
by: Wu, Zhenkai, et al.
Published: (2025)
Unified-Width Adaptive Dynamic Network for All-In-One Image Restoration
by: Xu, Yimin, et al.
Published: (2024)
by: Xu, Yimin, et al.
Published: (2024)
Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models
by: Li, Xudong, et al.
Published: (2024)
by: Li, Xudong, et al.
Published: (2024)
Causally Guided Gaussian Perturbations for Out-Of-Distribution Generalization in Medical Imaging
by: Pei, Haoran, et al.
Published: (2025)
by: Pei, Haoran, et al.
Published: (2025)
QMamba: Post-Training Quantization for Vision State Space Models
by: Li, Yinglong, et al.
Published: (2025)
by: Li, Yinglong, et al.
Published: (2025)
Deformba: Vision State Space Model with Adaptive State Fusion
by: Ke, Hongyu, et al.
Published: (2026)
by: Ke, Hongyu, et al.
Published: (2026)
OracleAgent: A Multimodal Reasoning Agent for Oracle Bone Script Research
by: Li, Caoshuo, et al.
Published: (2025)
by: Li, Caoshuo, et al.
Published: (2025)
QuadMamba: Learning Quadtree-based Selective Scan for Visual State Space Model
by: Xie, Fei, et al.
Published: (2024)
by: Xie, Fei, et al.
Published: (2024)
DiffuMatting: Synthesizing Arbitrary Objects with Matting-level Annotation
by: Hu, Xiaobin, et al.
Published: (2024)
by: Hu, Xiaobin, et al.
Published: (2024)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
by: Lin, Weihuang, et al.
Published: (2025)
by: Lin, Weihuang, et al.
Published: (2025)
Any-to-3D Generation via Hybrid Diffusion Supervision
by: Fan, Yijun, et al.
Published: (2024)
by: Fan, Yijun, et al.
Published: (2024)
BadScan: An Architectural Backdoor Attack on Visual State Space Models
by: Deshmukh, Om Suhas, et al.
Published: (2024)
by: Deshmukh, Om Suhas, et al.
Published: (2024)
GS-Bias: Global-Spatial Bias Learner for Single-Image Test-Time Adaptation of Vision-Language Models
by: Huang, Zhaohong, et al.
Published: (2025)
by: Huang, Zhaohong, et al.
Published: (2025)
AtrousMamaba: An Atrous-Window Scanning Visual State Space Model for Remote Sensing Change Detection
by: Wang, Tao, et al.
Published: (2025)
by: Wang, Tao, et al.
Published: (2025)
Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers
by: Zhong, Yunshan, et al.
Published: (2024)
by: Zhong, Yunshan, et al.
Published: (2024)
PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation
by: Ke, Shuyan, et al.
Published: (2026)
by: Ke, Shuyan, et al.
Published: (2026)
$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
by: Luo, Yaxin, et al.
Published: (2024)
by: Luo, Yaxin, et al.
Published: (2024)
Burst Image Super-Resolution via Multi-Cross Attention Encoding and Multi-Scan State-Space Decoding
by: Huang, Tengda, et al.
Published: (2025)
by: Huang, Tengda, et al.
Published: (2025)
ShadowMamba: State-Space Model with Boundary-Region Selective Scan for Shadow Removal
by: Zhu, Xiujin, et al.
Published: (2024)
by: Zhu, Xiujin, et al.
Published: (2024)
Interactive State Space Model with Cross-Modal Local Scanning for Depth Super-Resolution
by: Wu, Chen, et al.
Published: (2026)
by: Wu, Chen, et al.
Published: (2026)
MambaVSR: Content-Aware Scanning State Space Model for Video Super-Resolution
by: He, Linfeng, et al.
Published: (2025)
by: He, Linfeng, et al.
Published: (2025)
Towards Accurate Post-Training Quantization of Vision Transformers via Error Reduction
by: Zhong, Yunshan, et al.
Published: (2024)
by: Zhong, Yunshan, et al.
Published: (2024)
SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence
by: Gong, Ziyang, et al.
Published: (2025)
by: Gong, Ziyang, et al.
Published: (2025)
Beat: Bi-directional One-to-Many Embedding Alignment for Text-based Person Retrieval
by: Ma, Yiwei, et al.
Published: (2024)
by: Ma, Yiwei, et al.
Published: (2024)
X-Oscar: A Progressive Framework for High-quality Text-guided 3D Animatable Avatar Generation
by: Ma, Yiwei, et al.
Published: (2024)
by: Ma, Yiwei, et al.
Published: (2024)
JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues
by: Ji, Jiayi, et al.
Published: (2023)
by: Ji, Jiayi, et al.
Published: (2023)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
by: Ma, Jie, et al.
Published: (2026)
by: Ma, Jie, et al.
Published: (2026)
Similar Items
-
DVHGNN: Multi-Scale Dilated Vision HGNN for Efficient Vision Recognition
by: Li, Caoshuo, et al.
Published: (2025) -
OracleFusion: Assisting the Decipherment of Oracle Bone Script with Structurally Constrained Semantic Typography
by: Li, Caoshuo, et al.
Published: (2025) -
Partial Ring Scan: Revisiting Scan Order in Vision State Space Models
by: Hsieh, Yi-Kuan, et al.
Published: (2026) -
Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models
by: Wu, Mingrui, et al.
Published: (2024) -
Scalable Visual State Space Model with Fractal Scanning
by: Tang, Lv, et al.
Published: (2024)