VL-Mamba: Exploring State Space Models for Multimodal Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qiao, Yanyuan, Yu, Zheng, Guo, Longteng, Chen, Sihan, Zhao, Zijia, Sun, Mingzhen, Wu, Qi, Liu, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video Generation
par: Sun, Mingzhen, et autres
Publié: (2024)
par: Sun, Mingzhen, et autres
Publié: (2024)
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
par: Zhang, Siqi, et autres
Publié: (2025)
par: Zhang, Siqi, et autres
Publié: (2025)
OneDiff: A Generalist Model for Image Difference Captioning
par: Hu, Erdong, et autres
Publié: (2024)
par: Hu, Erdong, et autres
Publié: (2024)
StyleMamba : State Space Model for Efficient Text-driven Image Style Transfer
par: Wang, Zijia, et autres
Publié: (2024)
par: Wang, Zijia, et autres
Publié: (2024)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
par: Ma, Jiatong, et autres
Publié: (2026)
par: Ma, Jiatong, et autres
Publié: (2026)
LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation
par: Yue, Tongtian, et autres
Publié: (2025)
par: Yue, Tongtian, et autres
Publié: (2025)
CardiacMamba: A Multimodal RGB-RF Fusion Framework with State Space Models for Remote Physiological Measurement
par: Wu, Zheng, et autres
Publié: (2025)
par: Wu, Zheng, et autres
Publié: (2025)
ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval
par: Zhao, Zijia, et autres
Publié: (2024)
par: Zhao, Zijia, et autres
Publié: (2024)
VideoMamba: State Space Model for Efficient Video Understanding
par: Li, Kunchang, et autres
Publié: (2024)
par: Li, Kunchang, et autres
Publié: (2024)
ZeroMamba: Exploring Visual State Space Model for Zero-Shot Learning
par: Hou, Wenjin, et autres
Publié: (2024)
par: Hou, Wenjin, et autres
Publié: (2024)
NavBench: Probing Multimodal Large Language Models for Embodied Navigation
par: Qiao, Yanyuan, et autres
Publié: (2025)
par: Qiao, Yanyuan, et autres
Publié: (2025)
SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
par: Yue, Tongtian, et autres
Publié: (2024)
par: Yue, Tongtian, et autres
Publié: (2024)
Efficient Motion-Aware Video MLLM
par: Zhao, Zijia, et autres
Publié: (2025)
par: Zhao, Zijia, et autres
Publié: (2025)
Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation
par: Shi, Xiangyu, et autres
Publié: (2025)
par: Shi, Xiangyu, et autres
Publié: (2025)
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
par: Xuan, Weihao, et autres
Publié: (2025)
par: Xuan, Weihao, et autres
Publié: (2025)
MiniVLN: Efficient Vision-and-Language Navigation by Progressive Knowledge Distillation
par: Zhu, Junyou, et autres
Publié: (2024)
par: Zhu, Junyou, et autres
Publié: (2024)
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
par: Zhu, Jinguo, et autres
Publié: (2025)
par: Zhu, Jinguo, et autres
Publié: (2025)
Point Cloud Mamba: Point Cloud Learning via State Space Model
par: Zhang, Tao, et autres
Publié: (2024)
par: Zhang, Tao, et autres
Publié: (2024)
Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation
par: Liao, Bencheng, et autres
Publié: (2025)
par: Liao, Bencheng, et autres
Publié: (2025)
MambaVSR: Content-Aware Scanning State Space Model for Video Super-Resolution
par: He, Linfeng, et autres
Publié: (2025)
par: He, Linfeng, et autres
Publié: (2025)
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
par: Tian, Changyao, et autres
Publié: (2026)
par: Tian, Changyao, et autres
Publié: (2026)
HydraMamba: Multi-Head State Space Model for Global Point Cloud Learning
par: Qu, Kanglin, et autres
Publié: (2025)
par: Qu, Kanglin, et autres
Publié: (2025)
Improving Online Source-free Domain Adaptation for Object Detection by Unsupervised Data Acquisition
par: Shi, Xiangyu, et autres
Publié: (2023)
par: Shi, Xiangyu, et autres
Publié: (2023)
RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining
par: Wu, Hongtao, et autres
Publié: (2024)
par: Wu, Hongtao, et autres
Publié: (2024)
Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
par: Zhao, Zijia, et autres
Publié: (2024)
par: Zhao, Zijia, et autres
Publié: (2024)
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
par: Liu, Xinqi, et autres
Publié: (2024)
par: Liu, Xinqi, et autres
Publié: (2024)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
par: Zou, Jialv, et autres
Publié: (2025)
par: Zou, Jialv, et autres
Publié: (2025)
MambaAD: Exploring State Space Models for Multi-class Unsupervised Anomaly Detection
par: He, Haoyang, et autres
Publié: (2024)
par: He, Haoyang, et autres
Publié: (2024)
CountMamba: Exploring Multi-directional Selective State-Space Models for Plant Counting
par: He, Hulingxiao, et autres
Publié: (2024)
par: He, Hulingxiao, et autres
Publié: (2024)
OccMamba: Semantic Occupancy Prediction with State Space Models
par: Li, Heng, et autres
Publié: (2024)
par: Li, Heng, et autres
Publié: (2024)
Mamba-Adaptor: State Space Model Adaptor for Visual Recognition
par: Xie, Fei, et autres
Publié: (2025)
par: Xie, Fei, et autres
Publié: (2025)
SpectMamba: Integrating Frequency and State Space Models for Enhanced Medical Image Detection
par: Wang, Yao, et autres
Publié: (2025)
par: Wang, Yao, et autres
Publié: (2025)
Mamba-FSCIL: Dynamic Adaptation with Selective State Space Model for Few-Shot Class-Incremental Learning
par: Li, Xiaojie, et autres
Publié: (2024)
par: Li, Xiaojie, et autres
Publié: (2024)
MambaVF: State Space Model for Efficient Video Fusion
par: Zhao, Zixiang, et autres
Publié: (2026)
par: Zhao, Zixiang, et autres
Publié: (2026)
UIS-Mamba: Exploring Mamba for Underwater Instance Segmentation via Dynamic Tree Scan and Hidden State Weaken
par: Cong, Runmin, et autres
Publié: (2025)
par: Cong, Runmin, et autres
Publié: (2025)
Mamba-CL: Optimizing Selective State Space Model in Null Space for Continual Learning
par: Cheng, De, et autres
Publié: (2024)
par: Cheng, De, et autres
Publié: (2024)
GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI
par: Li, Tianbin, et autres
Publié: (2024)
par: Li, Tianbin, et autres
Publié: (2024)
Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
par: Zhang, Boqiang, et autres
Publié: (2026)
par: Zhang, Boqiang, et autres
Publié: (2026)
InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
par: Wang, Weiyun, et autres
Publié: (2025)
par: Wang, Weiyun, et autres
Publié: (2025)
FusionMamba: Dynamic Feature Enhancement for Multimodal Image Fusion with Mamba
par: Xie, Xinyu, et autres
Publié: (2024)
par: Xie, Xinyu, et autres
Publié: (2024)
Documents similaires
-
MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video Generation
par: Sun, Mingzhen, et autres
Publié: (2024) -
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
par: Zhang, Siqi, et autres
Publié: (2025) -
OneDiff: A Generalist Model for Image Difference Captioning
par: Hu, Erdong, et autres
Publié: (2024) -
StyleMamba : State Space Model for Efficient Text-driven Image Style Transfer
par: Wang, Zijia, et autres
Publié: (2024) -
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
par: Ma, Jiatong, et autres
Publié: (2026)