MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Xinqi, Zhou, Li, Zhou, Zikun, Chen, Jianqiu, He, Zhenyu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ZeroBP: Learning Position-Aware Correspondence for Zero-shot 6D Pose Estimation in Bin-Picking
par: Chen, Jianqiu, et autres
Publié: (2025)
par: Chen, Jianqiu, et autres
Publié: (2025)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
par: Zhou, Zikun, et autres
Publié: (2024)
par: Zhou, Zikun, et autres
Publié: (2024)
ZeroPose: CAD-Prompted Zero-shot Object 6D Pose Estimation in Cluttered Scenes
par: Chen, Jianqiu, et autres
Publié: (2023)
par: Chen, Jianqiu, et autres
Publié: (2023)
RTracker: Recoverable Tracking via PN Tree Structured Memory
par: Huang, Yuqing, et autres
Publié: (2024)
par: Huang, Yuqing, et autres
Publié: (2024)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
par: Liu, Jiaming, et autres
Publié: (2024)
par: Liu, Jiaming, et autres
Publié: (2024)
VL-Mamba: Exploring State Space Models for Multimodal Learning
par: Qiao, Yanyuan, et autres
Publié: (2024)
par: Qiao, Yanyuan, et autres
Publié: (2024)
Pan-Mamba: Effective pan-sharpening with State Space Model
par: He, Xuanhua, et autres
Publié: (2024)
par: He, Xuanhua, et autres
Publié: (2024)
Evolving Prompt Adaptation for Vision-Language Models
par: Zhang, Enming, et autres
Publié: (2026)
par: Zhang, Enming, et autres
Publié: (2026)
MemoryMamba: Memory-Augmented State Space Model for Defect Recognition
par: Wang, Qianning, et autres
Publié: (2024)
par: Wang, Qianning, et autres
Publié: (2024)
Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation
par: Liao, Bencheng, et autres
Publié: (2025)
par: Liao, Bencheng, et autres
Publié: (2025)
MambaTrack: A Simple Baseline for Multiple Object Tracking with State Space Model
par: Xiao, Changcheng, et autres
Publié: (2024)
par: Xiao, Changcheng, et autres
Publié: (2024)
Instruction-guided Multi-Granularity Segmentation and Captioning with Large Multimodal Model
par: Zhou, Li, et autres
Publié: (2024)
par: Zhou, Li, et autres
Publié: (2024)
Selective Visual Prompting in Vision Mamba
par: Yao, Yifeng, et autres
Publié: (2024)
par: Yao, Yifeng, et autres
Publié: (2024)
MambaLCT: Boosting Tracking via Long-term Context State Space Model
par: Li, Xiaohai, et autres
Publié: (2024)
par: Li, Xiaohai, et autres
Publié: (2024)
MambaTrack: Exploiting Dual-Enhancement for Night UAV Tracking
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
Shuffle Mamba: State Space Models with Random Shuffle for Multi-Modal Image Fusion
par: Cao, Ke, et autres
Publié: (2024)
par: Cao, Ke, et autres
Publié: (2024)
VSSD: Vision Mamba with Non-Causal State Space Duality
par: Shi, Yuheng, et autres
Publié: (2024)
par: Shi, Yuheng, et autres
Publié: (2024)
MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
par: Huang, Hsiang-Wei, et autres
Publié: (2024)
par: Huang, Hsiang-Wei, et autres
Publié: (2024)
VideoMamba: State Space Model for Efficient Video Understanding
par: Li, Kunchang, et autres
Publié: (2024)
par: Li, Kunchang, et autres
Publié: (2024)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
par: Zou, Jialv, et autres
Publié: (2025)
par: Zou, Jialv, et autres
Publié: (2025)
DTLLM-VLT: Diverse Text Generation for Visual Language Tracking Based on LLM
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
SportMamba: Adaptive Non-Linear Multi-Object Tracking with State Space Models for Team Sports
par: Khanna, Dheeraj, et autres
Publié: (2025)
par: Khanna, Dheeraj, et autres
Publié: (2025)
MambaMIM: Pre-training Mamba with State Space Token Interpolation and its Application to Medical Image Segmentation
par: Tang, Fenghe, et autres
Publié: (2024)
par: Tang, Fenghe, et autres
Publié: (2024)
SF-Mamba: Rethinking State Space Model for Vision
par: Yoshimura, Masakazu, et autres
Publié: (2026)
par: Yoshimura, Masakazu, et autres
Publié: (2026)
SMTrack: State-Aware Mamba for Efficient Temporal Modeling in Visual Tracking
par: Ma, Yinchao, et autres
Publié: (2026)
par: Ma, Yinchao, et autres
Publié: (2026)
SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language Models
par: Dong, Xiangyu, et autres
Publié: (2025)
par: Dong, Xiangyu, et autres
Publié: (2025)
Point Cloud Mamba: Point Cloud Learning via State Space Model
par: Zhang, Tao, et autres
Publié: (2024)
par: Zhang, Tao, et autres
Publié: (2024)
DefMamba: Deformable Visual State Space Model
par: Liu, Leiye, et autres
Publié: (2025)
par: Liu, Leiye, et autres
Publié: (2025)
MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks
par: Xu, Yushen, et autres
Publié: (2025)
par: Xu, Yushen, et autres
Publié: (2025)
RSDehamba: Lightweight Vision Mamba for Remote Sensing Satellite Image Dehazing
par: Zhou, Huiling, et autres
Publié: (2024)
par: Zhou, Huiling, et autres
Publié: (2024)
RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining
par: Wu, Hongtao, et autres
Publié: (2024)
par: Wu, Hongtao, et autres
Publié: (2024)
MambaAD: Exploring State Space Models for Multi-class Unsupervised Anomaly Detection
par: He, Haoyang, et autres
Publié: (2024)
par: He, Haoyang, et autres
Publié: (2024)
Mamba-FETrack: Frame-Event Tracking via State Space Model
par: Huang, Ju, et autres
Publié: (2024)
par: Huang, Ju, et autres
Publié: (2024)
Multimodal Instruction Tuning with Hybrid State Space Models
par: Zhou, Jianing, et autres
Publié: (2024)
par: Zhou, Jianing, et autres
Publié: (2024)
CardiacMamba: A Multimodal RGB-RF Fusion Framework with State Space Models for Remote Physiological Measurement
par: Wu, Zheng, et autres
Publié: (2025)
par: Wu, Zheng, et autres
Publié: (2025)
InsectMamba: Insect Pest Classification with State Space Model
par: Wang, Qianning, et autres
Publié: (2024)
par: Wang, Qianning, et autres
Publié: (2024)
GlobalMamba: Global Image Serialization for Vision Mamba
par: Wang, Chengkun, et autres
Publié: (2024)
par: Wang, Chengkun, et autres
Publié: (2024)
UAVD-Mamba: Deformable Token Fusion Vision Mamba for Multimodal UAV Detection
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
MambaTrack3D: A State Space Model Framework for LiDAR-Based Object Tracking under High Temporal Variation
par: Tian, Shengjing, et autres
Publié: (2025)
par: Tian, Shengjing, et autres
Publié: (2025)
TrackingMiM: Efficient Mamba-in-Mamba Serialization for Real-time UAV Object Tracking
par: Liu, Bingxi, et autres
Publié: (2025)
par: Liu, Bingxi, et autres
Publié: (2025)
Documents similaires
-
ZeroBP: Learning Position-Aware Correspondence for Zero-shot 6D Pose Estimation in Bin-Picking
par: Chen, Jianqiu, et autres
Publié: (2025) -
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
par: Zhou, Zikun, et autres
Publié: (2024) -
ZeroPose: CAD-Prompted Zero-shot Object 6D Pose Estimation in Cluttered Scenes
par: Chen, Jianqiu, et autres
Publié: (2023) -
RTracker: Recoverable Tracking via PN Tree Structured Memory
par: Huang, Yuqing, et autres
Publié: (2024) -
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
par: Liu, Jiaming, et autres
Publié: (2024)