Vim-F: Visual State Space Model Benefiting from Learning in the Frequency Domain
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Juntao, Liu, Shaogeng, Zhou, Jun, Bian, Kun, Zhou, You, Liu, Jianning, Zhang, Pei, Liu, Bingyan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Separable Self-attention Inspired by the State Space Model for Computer Vision
by: Zhang, Juntao, et al.
Published: (2025)
by: Zhang, Juntao, et al.
Published: (2025)
BadVim: Unveiling Backdoor Threats in Visual State Space Model
by: Lee, Cheng-Yi, et al.
Published: (2024)
by: Lee, Cheng-Yi, et al.
Published: (2024)
DefMamba: Deformable Visual State Space Model
by: Liu, Leiye, et al.
Published: (2025)
by: Liu, Leiye, et al.
Published: (2025)
ECMamba: Consolidating Selective State Space Model with Retinex Guidance for Efficient Multiple Exposure Correction
by: Dong, Wei, et al.
Published: (2024)
by: Dong, Wei, et al.
Published: (2024)
VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph
by: Wang, Qiuchen, et al.
Published: (2026)
by: Wang, Qiuchen, et al.
Published: (2026)
VMamba: Visual State Space Model
by: Liu, Yue, et al.
Published: (2024)
by: Liu, Yue, et al.
Published: (2024)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
by: Liu, Juntao, et al.
Published: (2025)
by: Liu, Juntao, et al.
Published: (2025)
SpectralMamba-UNet: Frequency-Disentangled State Space Modeling for Texture-Structure Consistent Medical Image Segmentation
by: Zhang, Fuhao, et al.
Published: (2026)
by: Zhang, Fuhao, et al.
Published: (2026)
Frequency-Domain Decomposition and Recomposition for Robust Audio-Visual Segmentation
by: Shen, Yunzhe, et al.
Published: (2025)
by: Shen, Yunzhe, et al.
Published: (2025)
CFTrack: Enhancing Lightweight Visual Tracking through Contrastive Learning and Feature Matching
by: Liang, Juntao, et al.
Published: (2025)
by: Liang, Juntao, et al.
Published: (2025)
Continual Learning in the Frequency Domain
by: Liu, Ruiqi, et al.
Published: (2024)
by: Liu, Ruiqi, et al.
Published: (2024)
VFGS-Net: Frequency-Guided State-Space Learning for Topology-Preserving Retinal Vessel Segmentation
by: Song, Ruiqi, et al.
Published: (2026)
by: Song, Ruiqi, et al.
Published: (2026)
LocalMamba: Visual State Space Model with Windowed Selective Scan
by: Huang, Tao, et al.
Published: (2024)
by: Huang, Tao, et al.
Published: (2024)
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
by: Zhu, Lianghui, et al.
Published: (2024)
by: Zhu, Lianghui, et al.
Published: (2024)
PointDGMamba: Domain Generalization of Point Cloud Classification via Generalized State Space Model
by: Yang, Hao, et al.
Published: (2024)
by: Yang, Hao, et al.
Published: (2024)
ZeroMamba: Exploring Visual State Space Model for Zero-Shot Learning
by: Hou, Wenjin, et al.
Published: (2024)
by: Hou, Wenjin, et al.
Published: (2024)
Selective Structured State Space for Multispectral-fused Small Target Detection
by: Zhang, Qianqian, et al.
Published: (2025)
by: Zhang, Qianqian, et al.
Published: (2025)
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
by: Liu, Xinqi, et al.
Published: (2024)
by: Liu, Xinqi, et al.
Published: (2024)
VimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-domain Generalization
by: Liu, Yuliang, et al.
Published: (2024)
by: Liu, Yuliang, et al.
Published: (2024)
Meta-Exploiting Frequency Prior for Cross-Domain Few-Shot Learning
by: Zhou, Fei, et al.
Published: (2024)
by: Zhou, Fei, et al.
Published: (2024)
Multimodal Instruction Tuning with Hybrid State Space Models
by: Zhou, Jianing, et al.
Published: (2024)
by: Zhou, Jianing, et al.
Published: (2024)
Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis
by: Su, Tongtong, et al.
Published: (2025)
by: Su, Tongtong, et al.
Published: (2025)
HCVP: Leveraging Hierarchical Contrastive Visual Prompt for Domain Generalization
by: Zhou, Guanglin, et al.
Published: (2024)
by: Zhou, Guanglin, et al.
Published: (2024)
CMViM: Contrastive Masked Vim Autoencoder for 3D Multi-modal Representation Learning for AD classification
by: Yang, Guangqian, et al.
Published: (2024)
by: Yang, Guangqian, et al.
Published: (2024)
AtrousMamaba: An Atrous-Window Scanning Visual State Space Model for Remote Sensing Change Detection
by: Wang, Tao, et al.
Published: (2025)
by: Wang, Tao, et al.
Published: (2025)
FrequencyCT: Frequency Domain Self-supervised Low-dose CT Denoising
by: Wei, Guoquan, et al.
Published: (2026)
by: Wei, Guoquan, et al.
Published: (2026)
DifAttack++: Query-Efficient Black-Box Adversarial Attack via Hierarchical Disentangled Feature Space in Cross-Domain
by: Liu, Jun, et al.
Published: (2024)
by: Liu, Jun, et al.
Published: (2024)
DGMamba: Domain Generalization via Generalized State Space Model
by: Long, Shaocong, et al.
Published: (2024)
by: Long, Shaocong, et al.
Published: (2024)
Visual Foundation Models Boost Cross-Modal Unsupervised Domain Adaptation for 3D Semantic Segmentation
by: Xu, Jingyi, et al.
Published: (2024)
by: Xu, Jingyi, et al.
Published: (2024)
TSkel-Mamba: Temporal Dynamic Modeling via State Space Model for Human Skeleton-based Action Recognition
by: Liu, Yanan, et al.
Published: (2025)
by: Liu, Yanan, et al.
Published: (2025)
DA-Mamba: Learning Domain-Aware State Space Model for Global-Local Alignment in Domain Adaptive Object Detection
by: Li, Haochen, et al.
Published: (2026)
by: Li, Haochen, et al.
Published: (2026)
Learning View-Dependent Splatting Kernels
by: Ding, Huakeng, et al.
Published: (2026)
by: Ding, Huakeng, et al.
Published: (2026)
SFDFusion: An Efficient Spatial-Frequency Domain Fusion Network for Infrared and Visible Image Fusion
by: Hu, Kun, et al.
Published: (2024)
by: Hu, Kun, et al.
Published: (2024)
Language as an Anchor: Preserving Relative Visual Geometry for Domain Incremental Learning
by: Geng, Shuyi, et al.
Published: (2025)
by: Geng, Shuyi, et al.
Published: (2025)
SkipVAR: Accelerating Visual Autoregressive Modeling via Adaptive Frequency-Aware Skipping
by: Li, Jiajun, et al.
Published: (2025)
by: Li, Jiajun, et al.
Published: (2025)
SPJFNet: Self-Mining Prior-Guided Joint Frequency Enhancement for Ultra-Efficient Dark Image Restoration
by: Zhang, Tongshun, et al.
Published: (2025)
by: Zhang, Tongshun, et al.
Published: (2025)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
by: Feng, Hao, et al.
Published: (2023)
by: Feng, Hao, et al.
Published: (2023)
Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation
by: Zhang, Hao, et al.
Published: (2024)
by: Zhang, Hao, et al.
Published: (2024)
QuadMamba: Learning Quadtree-based Selective Scan for Visual State Space Model
by: Xie, Fei, et al.
Published: (2024)
by: Xie, Fei, et al.
Published: (2024)
SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
by: Ouyang, Kun, et al.
Published: (2025)
by: Ouyang, Kun, et al.
Published: (2025)
Similar Items
-
A Separable Self-attention Inspired by the State Space Model for Computer Vision
by: Zhang, Juntao, et al.
Published: (2025) -
BadVim: Unveiling Backdoor Threats in Visual State Space Model
by: Lee, Cheng-Yi, et al.
Published: (2024) -
DefMamba: Deformable Visual State Space Model
by: Liu, Leiye, et al.
Published: (2025) -
ECMamba: Consolidating Selective State Space Model with Retinex Guidance for Efficient Multiple Exposure Correction
by: Dong, Wei, et al.
Published: (2024) -
VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph
by: Wang, Qiuchen, et al.
Published: (2026)