DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Xirui, Shan, Lianlei, Gui, Xiaolin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
di: Zhang, Siyu, et al.
Pubblicazione: (2025)
di: Zhang, Siyu, et al.
Pubblicazione: (2025)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024)
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024)
DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving
di: Liu, Xiaolu, et al.
Pubblicazione: (2026)
di: Liu, Xiaolu, et al.
Pubblicazione: (2026)
GDGS: 3D Gaussian Splatting Via Geometry-Guided Initialization And Dynamic Density Control
di: Wang, Xingjun, et al.
Pubblicazione: (2025)
di: Wang, Xingjun, et al.
Pubblicazione: (2025)
DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving
di: Shang, Shuyao, et al.
Pubblicazione: (2026)
di: Shang, Shuyao, et al.
Pubblicazione: (2026)
KV-Efficient VLA: A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache
di: Xu, Wanshun, et al.
Pubblicazione: (2025)
di: Xu, Wanshun, et al.
Pubblicazione: (2025)
NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding
di: Liu, Shiyu, et al.
Pubblicazione: (2025)
di: Liu, Shiyu, et al.
Pubblicazione: (2025)
VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
di: Bhat, Mohammad Qazim, et al.
Pubblicazione: (2026)
di: Bhat, Mohammad Qazim, et al.
Pubblicazione: (2026)
DriveGenVLM: Real-world Video Generation for Vision Language Model based Autonomous Driving
di: Fu, Yongjie, et al.
Pubblicazione: (2024)
di: Fu, Yongjie, et al.
Pubblicazione: (2024)
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
di: Xu, Yi, et al.
Pubblicazione: (2024)
di: Xu, Yi, et al.
Pubblicazione: (2024)
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
di: Schäfer, Finn Rasmus, et al.
Pubblicazione: (2026)
di: Schäfer, Finn Rasmus, et al.
Pubblicazione: (2026)
ContextVLM: Zero-Shot and Few-Shot Context Understanding for Autonomous Driving using Vision Language Models
di: Sural, Shounak, et al.
Pubblicazione: (2024)
di: Sural, Shounak, et al.
Pubblicazione: (2024)
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
di: Ma, Yingzi, et al.
Pubblicazione: (2025)
di: Ma, Yingzi, et al.
Pubblicazione: (2025)
DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking
di: Zheng, Weicheng, et al.
Pubblicazione: (2025)
di: Zheng, Weicheng, et al.
Pubblicazione: (2025)
Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM
di: Qin, Jack, et al.
Pubblicazione: (2025)
di: Qin, Jack, et al.
Pubblicazione: (2025)
DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving
di: Huang, Zilin, et al.
Pubblicazione: (2026)
di: Huang, Zilin, et al.
Pubblicazione: (2026)
SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving
di: Li, Peizheng, et al.
Pubblicazione: (2025)
di: Li, Peizheng, et al.
Pubblicazione: (2025)
Spatial-aware Vision Language Model for Autonomous Driving
di: Wei, Weijie, et al.
Pubblicazione: (2025)
di: Wei, Weijie, et al.
Pubblicazione: (2025)
Synthetic Lung X-ray Generation through Cross-Attention and Affinity Transformation
di: Pi, Ruochen, et al.
Pubblicazione: (2025)
di: Pi, Ruochen, et al.
Pubblicazione: (2025)
VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving
di: Huang, Zilin, et al.
Pubblicazione: (2024)
di: Huang, Zilin, et al.
Pubblicazione: (2024)
DynRefer: Delving into Region-level Multimodal Tasks via Dynamic Resolution
di: Zhao, Yuzhong, et al.
Pubblicazione: (2024)
di: Zhao, Yuzhong, et al.
Pubblicazione: (2024)
Organizing Background to Explore Latent Classes for Incremental Few-shot Semantic Segmentation
di: Shan, Lianlei, et al.
Pubblicazione: (2024)
di: Shan, Lianlei, et al.
Pubblicazione: (2024)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving
di: Peng, Xiaoxu, et al.
Pubblicazione: (2026)
di: Peng, Xiaoxu, et al.
Pubblicazione: (2026)
DrivingGaussian: Composite Gaussian Splatting for Surrounding Dynamic Autonomous Driving Scenes
di: Zhou, Xiaoyu, et al.
Pubblicazione: (2023)
di: Zhou, Xiaoyu, et al.
Pubblicazione: (2023)
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
Visual Adversarial Attack on Vision-Language Models for Autonomous Driving
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement
di: Jiao, Siwen, et al.
Pubblicazione: (2024)
di: Jiao, Siwen, et al.
Pubblicazione: (2024)
VLP: Vision Language Planning for Autonomous Driving
di: Pan, Chenbin, et al.
Pubblicazione: (2024)
di: Pan, Chenbin, et al.
Pubblicazione: (2024)
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
di: Shi, Liang, et al.
Pubblicazione: (2024)
di: Shi, Liang, et al.
Pubblicazione: (2024)
SEPT: Standard-Definition Map Enhanced Scene Perception and Topology Reasoning for Autonomous Driving
di: Pei, Muleilan, et al.
Pubblicazione: (2025)
di: Pei, Muleilan, et al.
Pubblicazione: (2025)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
di: Diao, Muxi, et al.
Pubblicazione: (2025)
di: Diao, Muxi, et al.
Pubblicazione: (2025)
VLM-3D:End-to-End Vision-Language Models for Open-World 3D Perception
di: Chang, Fuhao, et al.
Pubblicazione: (2025)
di: Chang, Fuhao, et al.
Pubblicazione: (2025)
AD-SAM: Fine-Tuning the Segment Anything Vision Foundation Model for Autonomous Driving Perception
di: Camarena, Mario, et al.
Pubblicazione: (2025)
di: Camarena, Mario, et al.
Pubblicazione: (2025)
Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures
di: Fernandez, David, et al.
Pubblicazione: (2026)
di: Fernandez, David, et al.
Pubblicazione: (2026)
Vehicle-to-Everything Cooperative Perception for Autonomous Driving
di: Huang, Tao, et al.
Pubblicazione: (2023)
di: Huang, Tao, et al.
Pubblicazione: (2023)
CurricuVLM: Towards Safe Autonomous Driving via Personalized Safety-Critical Curriculum Learning with Vision-Language Models
di: Sheng, Zihao, et al.
Pubblicazione: (2025)
di: Sheng, Zihao, et al.
Pubblicazione: (2025)
Vision Language Models in Autonomous Driving: A Survey and Outlook
di: Zhou, Xingcheng, et al.
Pubblicazione: (2023)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2023)
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
di: Wang, Peng, et al.
Pubblicazione: (2024)
di: Wang, Peng, et al.
Pubblicazione: (2024)
Q-VLM: Post-training Quantization for Large Vision-Language Models
di: Wang, Changyuan, et al.
Pubblicazione: (2024)
di: Wang, Changyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
di: Zhang, Siyu, et al.
Pubblicazione: (2025) -
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024) -
DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving
di: Liu, Xiaolu, et al.
Pubblicazione: (2026) -
GDGS: 3D Gaussian Splatting Via Geometry-Guided Initialization And Dynamic Density Control
di: Wang, Xingjun, et al.
Pubblicazione: (2025) -
DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving
di: Shang, Shuyao, et al.
Pubblicazione: (2026)