MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous Driving
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zhiyuan, Li, Xiaofan, Xu, Zhihao, Peng, Wenjie, Zhou, Zijian, Shi, Miaojing, Huang, Shuangping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation
di: Zhou, Zijian, et al.
Pubblicazione: (2023)
di: Zhou, Zijian, et al.
Pubblicazione: (2023)
SEG-SAM: Semantic-Guided SAM for Unified Medical Image Segmentation
di: Huang, Shuangping, et al.
Pubblicazione: (2024)
di: Huang, Shuangping, et al.
Pubblicazione: (2024)
Enhancing Space-time Video Super-resolution via Spatial-temporal Feature Interaction
di: Yue, Zijie, et al.
Pubblicazione: (2022)
di: Yue, Zijie, et al.
Pubblicazione: (2022)
OpenPSG: Open-set Panoptic Scene Graph Generation via Large Multimodal Models
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
Large Model driven Radiology Report Generation with Clinical Quality Reinforcement Learning
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
OrbitNVS: Harnessing Video Diffusion Priors for Novel View Synthesis
di: Liang, Jinglin, et al.
Pubblicazione: (2026)
di: Liang, Jinglin, et al.
Pubblicazione: (2026)
Spatial Retrieval Augmented Autonomous Driving
di: Jia, Xiaosong, et al.
Pubblicazione: (2025)
di: Jia, Xiaosong, et al.
Pubblicazione: (2025)
Enhancing Generalized Few-Shot Semantic Segmentation via Effective Knowledge Transfer
di: Chen, Xinyue, et al.
Pubblicazione: (2024)
di: Chen, Xinyue, et al.
Pubblicazione: (2024)
Text Promptable Surgical Instrument Segmentation with Vision-Language Models
di: Zhou, Zijian, et al.
Pubblicazione: (2023)
di: Zhou, Zijian, et al.
Pubblicazione: (2023)
STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding
di: Liu, Zichen, et al.
Pubblicazione: (2025)
di: Liu, Zichen, et al.
Pubblicazione: (2025)
Language Prompt for Autonomous Driving
di: Wu, Dongming, et al.
Pubblicazione: (2023)
di: Wu, Dongming, et al.
Pubblicazione: (2023)
Globally Correlation-Aware Hard Negative Generation
di: Peng, Wenjie, et al.
Pubblicazione: (2024)
di: Peng, Wenjie, et al.
Pubblicazione: (2024)
Multitask Learning in Minimally Invasive Surgical Vision: A Review
di: Alabi, Oluwatosin, et al.
Pubblicazione: (2024)
di: Alabi, Oluwatosin, et al.
Pubblicazione: (2024)
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
di: Liu, Zhe, et al.
Pubblicazione: (2025)
di: Liu, Zhe, et al.
Pubblicazione: (2025)
Unifying Language-Action Understanding and Generation for Autonomous Driving
di: Wang, Xinyang, et al.
Pubblicazione: (2026)
di: Wang, Xinyang, et al.
Pubblicazione: (2026)
Memory-guided Network with Uncertainty-based Feature Augmentation for Few-shot Semantic Segmentation
di: Chen, Xinyue, et al.
Pubblicazione: (2024)
di: Chen, Xinyue, et al.
Pubblicazione: (2024)
KMTalk: Speech-Driven 3D Facial Animation with Key Motion Embedding
di: Xu, Zhihao, et al.
Pubblicazione: (2024)
di: Xu, Zhihao, et al.
Pubblicazione: (2024)
The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey
di: Tu, Sifan, et al.
Pubblicazione: (2025)
di: Tu, Sifan, et al.
Pubblicazione: (2025)
Weakly-Supervised Referring Video Object Segmentation through Text Supervision
di: Shi, Miaojing, et al.
Pubblicazione: (2026)
di: Shi, Miaojing, et al.
Pubblicazione: (2026)
FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selection
di: Fontana, Maxime, et al.
Pubblicazione: (2026)
di: Fontana, Maxime, et al.
Pubblicazione: (2026)
Boosting Object Detection with Zero-Shot Day-Night Domain Adaptation
di: Du, Zhipeng, et al.
Pubblicazione: (2023)
di: Du, Zhipeng, et al.
Pubblicazione: (2023)
Information Coordination as a Bridge: A Neuro-Symbolic Architecture for Reliable Autonomous Driving Scene Understanding
di: Liu, Shuo, et al.
Pubblicazione: (2026)
di: Liu, Shuo, et al.
Pubblicazione: (2026)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
di: Tian, Kexin, et al.
Pubblicazione: (2025)
di: Tian, Kexin, et al.
Pubblicazione: (2025)
Exploring Diversity-based Active Learning for 3D Object Detection in Autonomous Driving
di: Lin, Jinpeng, et al.
Pubblicazione: (2022)
di: Lin, Jinpeng, et al.
Pubblicazione: (2022)
Hints of Prompt: Enhancing Visual Representation for Multimodal LLMs in Autonomous Driving
di: Zhou, Hao, et al.
Pubblicazione: (2024)
di: Zhou, Hao, et al.
Pubblicazione: (2024)
CholecInstanceSeg: A Tool Instance Segmentation Dataset for Laparoscopic Surgery
di: Alabi, Oluwatosin, et al.
Pubblicazione: (2024)
di: Alabi, Oluwatosin, et al.
Pubblicazione: (2024)
DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving
di: Shi, Chen, et al.
Pubblicazione: (2025)
di: Shi, Chen, et al.
Pubblicazione: (2025)
SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving
di: Li, Peizheng, et al.
Pubblicazione: (2025)
di: Li, Peizheng, et al.
Pubblicazione: (2025)
Spatial-aware Vision Language Model for Autonomous Driving
di: Wei, Weijie, et al.
Pubblicazione: (2025)
di: Wei, Weijie, et al.
Pubblicazione: (2025)
LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving
di: Sun, Qihao, et al.
Pubblicazione: (2026)
di: Sun, Qihao, et al.
Pubblicazione: (2026)
When Multi-Task Learning Meets Partial Supervision: A Computer Vision Review
di: Fontana, Maxime, et al.
Pubblicazione: (2023)
di: Fontana, Maxime, et al.
Pubblicazione: (2023)
Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning
di: Wu, Aodi, et al.
Pubblicazione: (2025)
di: Wu, Aodi, et al.
Pubblicazione: (2025)
DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving
di: Shi, Chen, et al.
Pubblicazione: (2026)
di: Shi, Chen, et al.
Pubblicazione: (2026)
GMF-Drive: Gated Mamba Fusion with Spatial-Aware BEV Representation for End-to-End Autonomous Driving
di: Wang, Jian, et al.
Pubblicazione: (2025)
di: Wang, Jian, et al.
Pubblicazione: (2025)
UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
di: Li, Yongkang, et al.
Pubblicazione: (2026)
di: Li, Yongkang, et al.
Pubblicazione: (2026)
ADGaussian: Generalizable Gaussian Splatting for Autonomous Driving via Multi-modal Joint Learning
di: Song, Qi, et al.
Pubblicazione: (2025)
di: Song, Qi, et al.
Pubblicazione: (2025)
MGNet: Monocular Geometric Scene Understanding for Autonomous Driving
di: Schön, Markus, et al.
Pubblicazione: (2022)
di: Schön, Markus, et al.
Pubblicazione: (2022)
DriveCode: Domain Specific Numerical Encoding for LLM-Based Autonomous Driving
di: Wang, Zhiye, et al.
Pubblicazione: (2026)
di: Wang, Zhiye, et al.
Pubblicazione: (2026)
Optimizing Dense Visual Predictions Through Multi-Task Coherence and Prioritization
di: Fontana, Maxime, et al.
Pubblicazione: (2024)
di: Fontana, Maxime, et al.
Pubblicazione: (2024)
LoSh: Long-Short Text Joint Prediction Network for Referring Video Object Segmentation
di: Yuan, Linfeng, et al.
Pubblicazione: (2023)
di: Yuan, Linfeng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation
di: Zhou, Zijian, et al.
Pubblicazione: (2023) -
SEG-SAM: Semantic-Guided SAM for Unified Medical Image Segmentation
di: Huang, Shuangping, et al.
Pubblicazione: (2024) -
Enhancing Space-time Video Super-resolution via Spatial-temporal Feature Interaction
di: Yue, Zijie, et al.
Pubblicazione: (2022) -
OpenPSG: Open-set Panoptic Scene Graph Generation via Large Multimodal Models
di: Zhou, Zijian, et al.
Pubblicazione: (2024) -
Large Model driven Radiology Report Generation with Clinical Quality Reinforcement Learning
di: Zhou, Zijian, et al.
Pubblicazione: (2024)