MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Yuhuan, Ma, Chaofan, Mao, Zhenjie, Yao, Jiangchao, Zhang, Ya, Wang, Yanfeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
by: Mao, Zhenjie, et al.
Published: (2025)
by: Mao, Zhenjie, et al.
Published: (2025)
ReMamber: Referring Image Segmentation with Mamba Twister
by: Yang, Yuhuan, et al.
Published: (2024)
by: Yang, Yuhuan, et al.
Published: (2024)
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
by: Yang, Yuhuan, et al.
Published: (2026)
by: Yang, Yuhuan, et al.
Published: (2026)
Multi-Modal Prototypes for Open-World Semantic Segmentation
by: Yang, Yuhuan, et al.
Published: (2023)
by: Yang, Yuhuan, et al.
Published: (2023)
Reprogramming Distillation for Medical Foundation Models
by: Zhou, Yuhang, et al.
Published: (2024)
by: Zhou, Yuhang, et al.
Published: (2024)
Low-Rank Knowledge Decomposition for Medical Foundation Models
by: Zhou, Yuhang, et al.
Published: (2024)
by: Zhou, Yuhang, et al.
Published: (2024)
AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation
by: Ma, Chaofan, et al.
Published: (2023)
by: Ma, Chaofan, et al.
Published: (2023)
Zero-shot Composed Text-Image Retrieval
by: Liu, Yikun, et al.
Published: (2023)
by: Liu, Yikun, et al.
Published: (2023)
Deep Reprogramming Distillation for Medical Foundation Models
by: Du, Siyuan, et al.
Published: (2026)
by: Du, Siyuan, et al.
Published: (2026)
AIRoA MoMa Dataset: A Large-Scale Hierarchical Dataset for Mobile Manipulation
by: Takanami, Ryosuke, et al.
Published: (2025)
by: Takanami, Ryosuke, et al.
Published: (2025)
LoRKD: Low-Rank Knowledge Decomposition for Medical Foundation Models
by: Li, Haolin, et al.
Published: (2024)
by: Li, Haolin, et al.
Published: (2024)
G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models
by: Zhang, Tianjiao, et al.
Published: (2025)
by: Zhang, Tianjiao, et al.
Published: (2025)
A Sanity Check on Composed Image Retrieval
by: Liu, Yikun, et al.
Published: (2026)
by: Liu, Yikun, et al.
Published: (2026)
MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation
by: Zhang, Pingrui, et al.
Published: (2025)
by: Zhang, Pingrui, et al.
Published: (2025)
Domain-Inspired Sharpness-Aware Minimization Under Domain Shifts
by: Zhang, Ruipeng, et al.
Published: (2024)
by: Zhang, Ruipeng, et al.
Published: (2024)
Adapting Visual-Language Models for Generalizable Anomaly Detection in Medical Images
by: Huang, Chaoqin, et al.
Published: (2024)
by: Huang, Chaoqin, et al.
Published: (2024)
One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
by: Fang, Yushun, et al.
Published: (2025)
by: Fang, Yushun, et al.
Published: (2025)
UniChest: Conquer-and-Divide Pre-training for Multi-Source Chest X-Ray Classification
by: Dai, Tianjie, et al.
Published: (2023)
by: Dai, Tianjie, et al.
Published: (2023)
Exploring Training on Heterogeneous Data with Mixture of Low-rank Adapters
by: Zhou, Yuhang, et al.
Published: (2024)
by: Zhou, Yuhang, et al.
Published: (2024)
Mitigating Noisy Correspondence by Geometrical Structure Consistency Learning
by: Zhao, Zihua, et al.
Published: (2024)
by: Zhao, Zihua, et al.
Published: (2024)
OPa-Ma: Text Guided Mamba for 360-degree Image Out-painting
by: Gao, Penglei, et al.
Published: (2024)
by: Gao, Penglei, et al.
Published: (2024)
Decouple before Align: Visual Disentanglement Enhances Prompt Tuning
by: Zhang, Fei, et al.
Published: (2025)
by: Zhang, Fei, et al.
Published: (2025)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
by: Chen, Boyu, et al.
Published: (2024)
by: Chen, Boyu, et al.
Published: (2024)
Adapting Foundation Models for Few-Shot Medical Image Segmentation: Actively and Sequentially
by: Yang, Jingyun, et al.
Published: (2025)
by: Yang, Jingyun, et al.
Published: (2025)
MoA-VR: A Mixture-of-Agents System Towards All-in-One Video Restoration
by: Liu, Lu, et al.
Published: (2025)
by: Liu, Lu, et al.
Published: (2025)
Contrast-Unity for Partially-Supervised Temporal Sentence Grounding
by: Wang, Haicheng, et al.
Published: (2025)
by: Wang, Haicheng, et al.
Published: (2025)
From Static to Dynamic: Adapting Landmark-Aware Image Models for Facial Expression Recognition in Videos
by: Chen, Yin, et al.
Published: (2023)
by: Chen, Yin, et al.
Published: (2023)
Multi-Modal Mamba Modeling for Survival Prediction (M4Survive): Adapting Joint Foundation Model Representations
by: Lee, Ho Hin, et al.
Published: (2025)
by: Lee, Ho Hin, et al.
Published: (2025)
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
by: Liu, Yikun, et al.
Published: (2024)
by: Liu, Yikun, et al.
Published: (2024)
POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch
by: Liu, Yikun, et al.
Published: (2026)
by: Liu, Yikun, et al.
Published: (2026)
MaIR: A Locality- and Continuity-Preserving Mamba for Image Restoration
by: Li, Boyun, et al.
Published: (2024)
by: Li, Boyun, et al.
Published: (2024)
EndoMamba: An Efficient Foundation Model for Endoscopic Videos via Hierarchical Pre-training
by: Tian, Qingyao, et al.
Published: (2025)
by: Tian, Qingyao, et al.
Published: (2025)
DriveMamba: Task-Centric Scalable State Space Model for Efficient End-to-End Autonomous Driving
by: Su, Haisheng, et al.
Published: (2026)
by: Su, Haisheng, et al.
Published: (2026)
Adapting Vision Foundation Models for Real-time Ultrasound Image Segmentation
by: Zhang, Xiaoran, et al.
Published: (2025)
by: Zhang, Xiaoran, et al.
Published: (2025)
Adapting a Segmentation Foundation Model for Medical Image Classification
by: Gu, Pengfei, et al.
Published: (2025)
by: Gu, Pengfei, et al.
Published: (2025)
Dual-granularity Sinkhorn Distillation for Enhanced Learning from Long-tailed Noisy Data
by: Hong, Feng, et al.
Published: (2025)
by: Hong, Feng, et al.
Published: (2025)
Differential-informed Sample Selection Accelerates Multimodal Contrastive Learning
by: Zhao, Zihua, et al.
Published: (2025)
by: Zhao, Zihua, et al.
Published: (2025)
ShapeMamba-EM: Fine-Tuning Foundation Model with Local Shape Descriptors and Mamba Blocks for 3D EM Image Segmentation
by: Shi, Ruohua, et al.
Published: (2024)
by: Shi, Ruohua, et al.
Published: (2024)
Improving Continuous Sign Language Recognition with Adapted Image Models
by: Hu, Lianyu, et al.
Published: (2024)
by: Hu, Lianyu, et al.
Published: (2024)
WaMaIR: Image Restoration via Multiscale Wavelet Convolutions and Mamba-based Channel Modeling with Texture Enhancement
by: Zhu, Shengyu, et al.
Published: (2025)
by: Zhu, Shengyu, et al.
Published: (2025)
Similar Items
-
SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
by: Mao, Zhenjie, et al.
Published: (2025) -
ReMamber: Referring Image Segmentation with Mamba Twister
by: Yang, Yuhuan, et al.
Published: (2024) -
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
by: Yang, Yuhuan, et al.
Published: (2026) -
Multi-Modal Prototypes for Open-World Semantic Segmentation
by: Yang, Yuhuan, et al.
Published: (2023) -
Reprogramming Distillation for Medical Foundation Models
by: Zhou, Yuhang, et al.
Published: (2024)