H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Siran, Luo, Yuxiao, Ma, Yue, Qiao, Yu, Wang, Yali |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
di: Chen, Boyu, et al.
Pubblicazione: (2024)
di: Chen, Boyu, et al.
Pubblicazione: (2024)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024)
di: Li, Kunchang, et al.
Pubblicazione: (2024)
MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval
di: Ying, Xinru, et al.
Pubblicazione: (2025)
di: Ying, Xinru, et al.
Pubblicazione: (2025)
Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models
di: Ding, Xinpeng, et al.
Pubblicazione: (2024)
di: Ding, Xinpeng, et al.
Pubblicazione: (2024)
Multi-Modal Data-Efficient 3D Scene Understanding for Autonomous Driving
di: Kong, Lingdong, et al.
Pubblicazione: (2024)
di: Kong, Lingdong, et al.
Pubblicazione: (2024)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
DeepInteraction++: Multi-Modality Interaction for Autonomous Driving
di: Yang, Zeyu, et al.
Pubblicazione: (2024)
di: Yang, Zeyu, et al.
Pubblicazione: (2024)
AD-H: Language-guided Autonomous Driving with Hierarchical Agents
di: Zhang, Zaibin, et al.
Pubblicazione: (2024)
di: Zhang, Zaibin, et al.
Pubblicazione: (2024)
MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration
di: Ding, Yanbo, et al.
Pubblicazione: (2024)
di: Ding, Yanbo, et al.
Pubblicazione: (2024)
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
di: Cui, Erfei, et al.
Pubblicazione: (2023)
di: Cui, Erfei, et al.
Pubblicazione: (2023)
VideoChat: Chat-Centric Video Understanding
di: Li, KunChang, et al.
Pubblicazione: (2023)
di: Li, KunChang, et al.
Pubblicazione: (2023)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
di: Wang, Zikang, et al.
Pubblicazione: (2025)
di: Wang, Zikang, et al.
Pubblicazione: (2025)
An Overview about Emerging Technologies of Autonomous Driving
di: Huang, Yu, et al.
Pubblicazione: (2023)
di: Huang, Yu, et al.
Pubblicazione: (2023)
Domain Adaptation based Object Detection for Autonomous Driving in Foggy and Rainy Weather
di: Li, Jinlong, et al.
Pubblicazione: (2023)
di: Li, Jinlong, et al.
Pubblicazione: (2023)
RealDriveSim: A Realistic Multi-Modal Multi-Task Synthetic Dataset for Autonomous Driving
di: Jadon, Arpit, et al.
Pubblicazione: (2025)
di: Jadon, Arpit, et al.
Pubblicazione: (2025)
Applications of Large Scale Foundation Models for Autonomous Driving
di: Huang, Yu, et al.
Pubblicazione: (2023)
di: Huang, Yu, et al.
Pubblicazione: (2023)
HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving
di: Wu, Zehuan, et al.
Pubblicazione: (2024)
di: Wu, Zehuan, et al.
Pubblicazione: (2024)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
Graph-Based Multi-Modal Sensor Fusion for Autonomous Driving
di: Sani, Depanshu, et al.
Pubblicazione: (2024)
di: Sani, Depanshu, et al.
Pubblicazione: (2024)
MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving
di: Duan, Yiqun, et al.
Pubblicazione: (2024)
di: Duan, Yiqun, et al.
Pubblicazione: (2024)
Not All Pairs are Equal: Hierarchical Learning for Average-Precision-Oriented Video Retrieval
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving
di: Lu, Hao, et al.
Pubblicazione: (2025)
di: Lu, Hao, et al.
Pubblicazione: (2025)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
di: Wang, Yi, et al.
Pubblicazione: (2023)
di: Wang, Yi, et al.
Pubblicazione: (2023)
Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos
di: Ma, Yue, et al.
Pubblicazione: (2023)
di: Ma, Yue, et al.
Pubblicazione: (2023)
GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
di: Deng, Tianchen, et al.
Pubblicazione: (2025)
di: Deng, Tianchen, et al.
Pubblicazione: (2025)
123D: Unifying Multi-Modal Autonomous Driving Data at Scale
di: Dauner, Daniel, et al.
Pubblicazione: (2026)
di: Dauner, Daniel, et al.
Pubblicazione: (2026)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
di: Bai, Purui, et al.
Pubblicazione: (2026)
di: Bai, Purui, et al.
Pubblicazione: (2026)
UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving
di: Xiong, Zhexiao, et al.
Pubblicazione: (2026)
di: Xiong, Zhexiao, et al.
Pubblicazione: (2026)
SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
di: Yang, Zhongyu, et al.
Pubblicazione: (2026)
di: Yang, Zhongyu, et al.
Pubblicazione: (2026)
MiLA: Multi-view Intensive-fidelity Long-term Video Generation World Model for Autonomous Driving
di: Wang, Haiguang, et al.
Pubblicazione: (2025)
di: Wang, Haiguang, et al.
Pubblicazione: (2025)
Low-Resolution Action Recognition for Tiny Actions Challenge
di: Chen, Boyu, et al.
Pubblicazione: (2022)
di: Chen, Boyu, et al.
Pubblicazione: (2022)
Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
FAR-Drive: Frame-AutoRegressive Video Generation in Closed-Loop Autonomous Driving
di: Li, Yaoru, et al.
Pubblicazione: (2026)
di: Li, Yaoru, et al.
Pubblicazione: (2026)
MagicStick: Controllable Video Editing via Control Handle Transformations
di: Ma, Yue, et al.
Pubblicazione: (2023)
di: Ma, Yue, et al.
Pubblicazione: (2023)
SCaRL- A Synthetic Multi-Modal Dataset for Autonomous Driving
di: Ramesh, Avinash Nittur, et al.
Pubblicazione: (2024)
di: Ramesh, Avinash Nittur, et al.
Pubblicazione: (2024)
Multi-Modal Sensor Fusion using Hybrid Attention for Autonomous Driving
di: Mayank, Mayank, et al.
Pubblicazione: (2026)
di: Mayank, Mayank, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
di: Chen, Boyu, et al.
Pubblicazione: (2025) -
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
di: Chen, Boyu, et al.
Pubblicazione: (2025) -
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
di: Chen, Boyu, et al.
Pubblicazione: (2024) -
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
di: Li, Kunchang, et al.
Pubblicazione: (2023) -
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024)