Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Guo, Huang, Yifei, Xu, Jilan, Pei, Baoqi, Chen, Zhe, Li, Zhiqi, Wang, Jiahao, Li, Kunchang, Lu, Tong, Wang, Limin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024)
di: Li, Kunchang, et al.
Pubblicazione: (2024)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs
di: He, Yuping, et al.
Pubblicazione: (2025)
di: He, Yuping, et al.
Pubblicazione: (2025)
VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model
di: Li, Xinhao, et al.
Pubblicazione: (2024)
di: Li, Xinhao, et al.
Pubblicazione: (2024)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
di: Wang, Yi, et al.
Pubblicazione: (2024)
di: Wang, Yi, et al.
Pubblicazione: (2024)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
di: Xu, Jilan, et al.
Pubblicazione: (2025)
di: Xu, Jilan, et al.
Pubblicazione: (2025)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
Bridging Perspectives: A Survey on Cross-view Collaborative Intelligence with Egocentric-Exocentric Vision
di: He, Yuping, et al.
Pubblicazione: (2025)
di: He, Yuping, et al.
Pubblicazione: (2025)
VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models
di: Huang, Ziqi, et al.
Pubblicazione: (2024)
di: Huang, Ziqi, et al.
Pubblicazione: (2024)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World
di: Huang, Yifei, et al.
Pubblicazione: (2024)
di: Huang, Yifei, et al.
Pubblicazione: (2024)
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
Make Your Training Flexible: Towards Deployment-Efficient Video Models
di: Wang, Chenting, et al.
Pubblicazione: (2025)
di: Wang, Chenting, et al.
Pubblicazione: (2025)
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
Retrieval-Augmented Egocentric Video Captioning
di: Xu, Jilan, et al.
Pubblicazione: (2024)
di: Xu, Jilan, et al.
Pubblicazione: (2024)
Unmasked Teacher: Towards Training-Efficient Video Foundation Models
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
di: Wang, Shihao, et al.
Pubblicazione: (2025)
di: Wang, Shihao, et al.
Pubblicazione: (2025)
VADMamba: Exploring State Space Models for Fast Video Anomaly Detection
di: Lyu, Jiahao, et al.
Pubblicazione: (2025)
di: Lyu, Jiahao, et al.
Pubblicazione: (2025)
Online Video Understanding: OVBench and VideoChat-Online
di: Huang, Zhenpeng, et al.
Pubblicazione: (2024)
di: Huang, Zhenpeng, et al.
Pubblicazione: (2024)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
di: Wang, Yi, et al.
Pubblicazione: (2023)
di: Wang, Yi, et al.
Pubblicazione: (2023)
Harvest Video Foundation Models via Efficient Post-Pretraining
di: Li, Yizhuo, et al.
Pubblicazione: (2023)
di: Li, Yizhuo, et al.
Pubblicazione: (2023)
VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining
di: Liu, Yunze, et al.
Pubblicazione: (2025)
di: Liu, Yunze, et al.
Pubblicazione: (2025)
MemMamba: Rethinking Memory Patterns in State Space Model
di: Wang, Youjin, et al.
Pubblicazione: (2025)
di: Wang, Youjin, et al.
Pubblicazione: (2025)
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
di: Li, Xinhao, et al.
Pubblicazione: (2024)
di: Li, Xinhao, et al.
Pubblicazione: (2024)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
di: Chen, Boyu, et al.
Pubblicazione: (2024)
di: Chen, Boyu, et al.
Pubblicazione: (2024)
Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline
di: Chen, Guo, et al.
Pubblicazione: (2026)
di: Chen, Guo, et al.
Pubblicazione: (2026)
VideoChat: Chat-Centric Video Understanding
di: Li, KunChang, et al.
Pubblicazione: (2023)
di: Li, KunChang, et al.
Pubblicazione: (2023)
Vamos: Versatile Action Models for Video Understanding
di: Wang, Shijie, et al.
Pubblicazione: (2023)
di: Wang, Shijie, et al.
Pubblicazione: (2023)
Learning Streaming Video Representation via Multitask Training
di: Yan, Yibin, et al.
Pubblicazione: (2025)
di: Yan, Yibin, et al.
Pubblicazione: (2025)
LocalMamba: Visual State Space Model with Windowed Selective Scan
di: Huang, Tao, et al.
Pubblicazione: (2024)
di: Huang, Tao, et al.
Pubblicazione: (2024)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
di: Yuan, Yuqian, et al.
Pubblicazione: (2024)
di: Yuan, Yuqian, et al.
Pubblicazione: (2024)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
di: Zhang, Xiaoyi, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoyi, et al.
Pubblicazione: (2025)
RainMamba: Enhanced Locality Learning with State Space Models for Video Deraining
di: Wu, Hongtao, et al.
Pubblicazione: (2024)
di: Wu, Hongtao, et al.
Pubblicazione: (2024)
USV: Towards Understanding the User-generated Short-form Videos
di: Cheng, Haoyue, et al.
Pubblicazione: (2026)
di: Cheng, Haoyue, et al.
Pubblicazione: (2026)
VFIMamba: Video Frame Interpolation with State Space Models
di: Zhang, Guozhen, et al.
Pubblicazione: (2024)
di: Zhang, Guozhen, et al.
Pubblicazione: (2024)
DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark
di: Chen, Haoxing, et al.
Pubblicazione: (2024)
di: Chen, Haoxing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024) -
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024) -
EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs
di: He, Yuping, et al.
Pubblicazione: (2025) -
VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model
di: Li, Xinhao, et al.
Pubblicazione: (2024) -
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
di: Wang, Yi, et al.
Pubblicazione: (2024)