Scenario Understanding of Traffic Scenes Through Large Visual Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Rivera, Esteban, Lübberstedt, Jannik, Uhlemann, Nico, Lienkamp, Markus |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
V3LMA: Visual 3D-enhanced Language Model for Autonomous Driving
by: Lübberstedt, Jannik, et al.
Published: (2025)
by: Lübberstedt, Jannik, et al.
Published: (2025)
Snapshot: Towards Application-centered Models for Pedestrian Trajectory Prediction in Urban Traffic Environments
by: Uhlemann, Nico, et al.
Published: (2024)
by: Uhlemann, Nico, et al.
Published: (2024)
VESPA: Towards un(Human)supervised Open-World Pointcloud Labeling for Autonomous Driving
by: Tempfli, Levente, et al.
Published: (2025)
by: Tempfli, Levente, et al.
Published: (2025)
Inconsistency-based Active Learning for LiDAR Object Detection
by: Rivera, Esteban, et al.
Published: (2025)
by: Rivera, Esteban, et al.
Published: (2025)
HeAL3D: Heuristical-enhanced Active Learning for 3D Object Detection
by: Rivera, Esteban, et al.
Published: (2025)
by: Rivera, Esteban, et al.
Published: (2025)
MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios
by: Fan, Jiaqi, et al.
Published: (2024)
by: Fan, Jiaqi, et al.
Published: (2024)
To New Beginnings: A Survey of Unified Perception in Autonomous Vehicle Software
by: Stratil, Loïc, et al.
Published: (2025)
by: Stratil, Loïc, et al.
Published: (2025)
FlowCalib: LiDAR-to-Vehicle Miscalibration Detection using Scene Flows
by: Tahiraj, Ilir, et al.
Published: (2026)
by: Tahiraj, Ilir, et al.
Published: (2026)
TAU-R1: Visual Language Model for Traffic Anomaly Understanding
by: Lin, Yuqiang, et al.
Published: (2026)
by: Lin, Yuqiang, et al.
Published: (2026)
Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes
by: Rivera, Antonio Carlos, et al.
Published: (2024)
by: Rivera, Antonio Carlos, et al.
Published: (2024)
RadarGNN: Transformation Invariant Graph Neural Network for Radar-based Perception
by: Fent, Felix, et al.
Published: (2023)
by: Fent, Felix, et al.
Published: (2023)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
by: Ma, Jingtian, et al.
Published: (2025)
by: Ma, Jingtian, et al.
Published: (2025)
Calibrating the Full Predictive Class Distribution of 3D Object Detectors for Autonomous Driving
by: Schröder, Cornelius, et al.
Published: (2025)
by: Schröder, Cornelius, et al.
Published: (2025)
Spatial As Deep: Spatial CNN for Traffic Scene Understanding
by: Pan, Xingang, et al.
Published: (2017)
by: Pan, Xingang, et al.
Published: (2017)
ScenarioCLIP: Pretrained Transferable Visual Language Models and Action-Genome Dataset for Natural Scene Analysis
by: Sinha, Advik, et al.
Published: (2025)
by: Sinha, Advik, et al.
Published: (2025)
CaLiV: LiDAR-to-Vehicle Calibration of Arbitrary Sensor Setups
by: Tahiraj, Ilir, et al.
Published: (2025)
by: Tahiraj, Ilir, et al.
Published: (2025)
Enhancing Vision-Language Models with Scene Graphs for Traffic Accident Understanding
by: Lohner, Aaron, et al.
Published: (2024)
by: Lohner, Aaron, et al.
Published: (2024)
Probing Conceptual Understanding of Large Visual-Language Models
by: Schiappa, Madeline, et al.
Published: (2023)
by: Schiappa, Madeline, et al.
Published: (2023)
Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios
by: Fan, Jiaqi, et al.
Published: (2024)
by: Fan, Jiaqi, et al.
Published: (2024)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
by: Xu, Pengxin, et al.
Published: (2026)
by: Xu, Pengxin, et al.
Published: (2026)
Adaptive Visual Scene Understanding: Incremental Scene Graph Generation
by: Khandelwal, Naitik, et al.
Published: (2023)
by: Khandelwal, Naitik, et al.
Published: (2023)
SceneGPT: A Language Model for 3D Scene Understanding
by: Chandhok, Shivam
Published: (2024)
by: Chandhok, Shivam
Published: (2024)
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
by: Li, Xin, et al.
Published: (2024)
by: Li, Xin, et al.
Published: (2024)
Do Large Language Models Understand Data Visualization Rules?
by: Sinnona, Martin, et al.
Published: (2026)
by: Sinnona, Martin, et al.
Published: (2026)
Do Large Language Models Understand Data Visualization Principles?
by: Sinnona, Martin, et al.
Published: (2026)
by: Sinnona, Martin, et al.
Published: (2026)
Understanding Depth and Height Perception in Large Visual-Language Models
by: Azad, Shehreen, et al.
Published: (2024)
by: Azad, Shehreen, et al.
Published: (2024)
SSF-PAN: Semantic Scene Flow-Based Perception for Autonomous Navigation in Traffic Scenarios
by: Chen, Yinqi, et al.
Published: (2025)
by: Chen, Yinqi, et al.
Published: (2025)
Unified 3D Scene Understanding Through Physical World Modeling
by: Lee, Wanhee, et al.
Published: (2026)
by: Lee, Wanhee, et al.
Published: (2026)
Cal or No Cal? -- Real-Time Miscalibration Detection of LiDAR and Camera Sensors
by: Tahiraj, Ilir, et al.
Published: (2025)
by: Tahiraj, Ilir, et al.
Published: (2025)
CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios
by: Ye, Qilang, et al.
Published: (2024)
by: Ye, Qilang, et al.
Published: (2024)
SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
by: Zhou, Xingcheng, et al.
Published: (2026)
by: Zhou, Xingcheng, et al.
Published: (2026)
Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles
by: Elhenawy, Mohammed, et al.
Published: (2025)
by: Elhenawy, Mohammed, et al.
Published: (2025)
MGNet: Monocular Geometric Scene Understanding for Autonomous Driving
by: Schön, Markus, et al.
Published: (2022)
by: Schön, Markus, et al.
Published: (2022)
MGNiceNet: Unified Monocular Geometric Scene Understanding
by: Schön, Markus, et al.
Published: (2024)
by: Schön, Markus, et al.
Published: (2024)
Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models
by: Ranasinghe, Yasiru, et al.
Published: (2025)
by: Ranasinghe, Yasiru, et al.
Published: (2025)
3D Scene Understanding Through Local Random Access Sequence Modeling
by: Lee, Wanhee, et al.
Published: (2025)
by: Lee, Wanhee, et al.
Published: (2025)
NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
by: Xu, Wei, et al.
Published: (2025)
by: Xu, Wei, et al.
Published: (2025)
Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning
by: Fu, Rao, et al.
Published: (2024)
by: Fu, Rao, et al.
Published: (2024)
LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences
by: Zhi, Hongyan, et al.
Published: (2024)
by: Zhi, Hongyan, et al.
Published: (2024)
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
by: Du, Henghui, et al.
Published: (2025)
by: Du, Henghui, et al.
Published: (2025)
Similar Items
-
V3LMA: Visual 3D-enhanced Language Model for Autonomous Driving
by: Lübberstedt, Jannik, et al.
Published: (2025) -
Snapshot: Towards Application-centered Models for Pedestrian Trajectory Prediction in Urban Traffic Environments
by: Uhlemann, Nico, et al.
Published: (2024) -
VESPA: Towards un(Human)supervised Open-World Pointcloud Labeling for Autonomous Driving
by: Tempfli, Levente, et al.
Published: (2025) -
Inconsistency-based Active Learning for LiDAR Object Detection
by: Rivera, Esteban, et al.
Published: (2025) -
HeAL3D: Heuristical-enhanced Active Learning for 3D Object Detection
by: Rivera, Esteban, et al.
Published: (2025)