SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Xingcheng, Liu, Mingyu, Zimmer, Walter, Zhang, Jiajie, Knoll, Alois |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs
di: Zhou, Xingcheng, et al.
Pubblicazione: (2026)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2026)
GPT-4V as Traffic Assistant: An In-depth Look at Vision Language Model on Complex Traffic Events
di: Zhou, Xingcheng, et al.
Pubblicazione: (2024)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2024)
PointCompress3D: A Point Cloud Compression Framework for Roadside LiDARs in Intelligent Transportation Systems
di: Zimmer, Walter, et al.
Pubblicazione: (2024)
di: Zimmer, Walter, et al.
Pubblicazione: (2024)
TUMTraf EMOT: Event-Based Multi-Object Tracking Dataset and Baseline for Traffic Scenarios
di: Li, Mengyu, et al.
Pubblicazione: (2025)
di: Li, Mengyu, et al.
Pubblicazione: (2025)
WARM-3D: A Weakly-Supervised Sim2Real Domain Adaptation Framework for Roadside Monocular 3D Object Detection
di: Zhou, Xingcheng, et al.
Pubblicazione: (2024)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2024)
GraphRelate3D: Context-Dependent 3D Object Detection with Inter-Object Relationship Graphs
di: Liu, Mingyu, et al.
Pubblicazione: (2024)
di: Liu, Mingyu, et al.
Pubblicazione: (2024)
SegRGB-X: General RGB-X Semantic Segmentation Model
di: Liu, Jiong, et al.
Pubblicazione: (2026)
di: Liu, Jiong, et al.
Pubblicazione: (2026)
Vision Language Models in Autonomous Driving: A Survey and Outlook
di: Zhou, Xingcheng, et al.
Pubblicazione: (2023)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2023)
A Survey on Autonomous Driving Datasets: Statistics, Annotation Quality, and a Future Outlook
di: Liu, Mingyu, et al.
Pubblicazione: (2024)
di: Liu, Mingyu, et al.
Pubblicazione: (2024)
Safety-Critical Learning for Long-Tail Events: The TUM Traffic Accident Dataset
di: Zimmer, Walter, et al.
Pubblicazione: (2025)
di: Zimmer, Walter, et al.
Pubblicazione: (2025)
TUMTraf V2X Cooperative Perception Dataset
di: Zimmer, Walter, et al.
Pubblicazione: (2024)
di: Zimmer, Walter, et al.
Pubblicazione: (2024)
Towards Vision Zero: The TUM Traffic Accid3nD Dataset
di: Zimmer, Walter, et al.
Pubblicazione: (2025)
di: Zimmer, Walter, et al.
Pubblicazione: (2025)
Enhancing Highway Safety: Accident Detection on the A9 Test Stretch Using Roadside Sensors
di: Zimmer, Walter, et al.
Pubblicazione: (2025)
di: Zimmer, Walter, et al.
Pubblicazione: (2025)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
ActiveAnno3D -- An Active Learning Framework for Multi-Modal 3D Object Detection
di: Ghita, Ahmed, et al.
Pubblicazione: (2024)
di: Ghita, Ahmed, et al.
Pubblicazione: (2024)
Transfer Learning from Simulated to Real Scenes for Monocular 3D Object Detection
di: Mohamed, Sondos, et al.
Pubblicazione: (2024)
di: Mohamed, Sondos, et al.
Pubblicazione: (2024)
Energy-Aware Imitation Learning for Steering Prediction Using Events and Frames
di: Cao, Hu, et al.
Pubblicazione: (2026)
di: Cao, Hu, et al.
Pubblicazione: (2026)
LFA: Layer Feature Attention for Run-Time Introspection of 2D Object Detectors in Automated Driving
di: Keser, Mert, et al.
Pubblicazione: (2026)
di: Keser, Mert, et al.
Pubblicazione: (2026)
Unveiling Ontological Commitment in Multi-Modal Foundation Models
di: Keser, Mert, et al.
Pubblicazione: (2024)
di: Keser, Mert, et al.
Pubblicazione: (2024)
TUMTraf Event: Calibration and Fusion Resulting in a Dataset for Roadside Event-Based and RGB Cameras
di: Creß, Christian, et al.
Pubblicazione: (2024)
di: Creß, Christian, et al.
Pubblicazione: (2024)
Part-Whole Relational Fusion Towards Multi-Modal Scene Understanding
di: Liu, Yi, et al.
Pubblicazione: (2024)
di: Liu, Yi, et al.
Pubblicazione: (2024)
CoDa-4DGS: Dynamic Gaussian Splatting with Context and Deformation Awareness for Autonomous Driving
di: Song, Rui, et al.
Pubblicazione: (2025)
di: Song, Rui, et al.
Pubblicazione: (2025)
Collaborative Semantic Occupancy Prediction with Hybrid Feature Fusion in Connected Automated Vehicles
di: Song, Rui, et al.
Pubblicazione: (2024)
di: Song, Rui, et al.
Pubblicazione: (2024)
Adaptive Visual Scene Understanding: Incremental Scene Graph Generation
di: Khandelwal, Naitik, et al.
Pubblicazione: (2023)
di: Khandelwal, Naitik, et al.
Pubblicazione: (2023)
Robust Multi-Modal Image Stitching for Improved Scene Understanding
di: Dutta, Aritra, et al.
Pubblicazione: (2023)
di: Dutta, Aritra, et al.
Pubblicazione: (2023)
EgoGaussian: Dynamic Scene Understanding from Egocentric Video with 3D Gaussian Splatting
di: Zhang, Daiwei, et al.
Pubblicazione: (2024)
di: Zhang, Daiwei, et al.
Pubblicazione: (2024)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
di: Bai, Purui, et al.
Pubblicazione: (2026)
di: Bai, Purui, et al.
Pubblicazione: (2026)
IDSelect: A RL-Based Cost-Aware Selection Agent for Video-based Multi-Modal Person Recognition
di: Ji, Yuyang, et al.
Pubblicazione: (2026)
di: Ji, Yuyang, et al.
Pubblicazione: (2026)
Triplet: Triangle Patchlet for Mesh-Based Inverse Rendering and Scene Parameters Approximation
di: Yang, Jiajie
Pubblicazione: (2024)
di: Yang, Jiajie
Pubblicazione: (2024)
Efficient and Deterministic Search Strategy Based on Residual Projections for Point Cloud Registration with Correspondences
di: Li, Xinyi, et al.
Pubblicazione: (2023)
di: Li, Xinyi, et al.
Pubblicazione: (2023)
HIG: Hierarchical Interlacement Graph Approach to Scene Graph Generation in Video Understanding
di: Nguyen, Trong-Thuan, et al.
Pubblicazione: (2023)
di: Nguyen, Trong-Thuan, et al.
Pubblicazione: (2023)
How Could Generative AI Support Compliance with the EU AI Act? A Review for Safe Automated Driving Perception
di: Keser, Mert, et al.
Pubblicazione: (2024)
di: Keser, Mert, et al.
Pubblicazione: (2024)
URNet: Uncertainty-aware Refinement Network for Event-based Stereo Depth Estimation
di: Cheng, Yifeng, et al.
Pubblicazione: (2025)
di: Cheng, Yifeng, et al.
Pubblicazione: (2025)
SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
di: Yang, Zhongyu, et al.
Pubblicazione: (2026)
di: Yang, Zhongyu, et al.
Pubblicazione: (2026)
Hazard-Aware Traffic Scene Graph Generation
di: Huang, Yaoqi, et al.
Pubblicazione: (2026)
di: Huang, Yaoqi, et al.
Pubblicazione: (2026)
TB-Bench: Training and Testing Multi-Modal AI for Understanding Spatio-Temporal Traffic Behaviors from Dashcam Images/Videos
di: Charoenpitaks, Korawat, et al.
Pubblicazione: (2025)
di: Charoenpitaks, Korawat, et al.
Pubblicazione: (2025)
Spatial As Deep: Spatial CNN for Traffic Scene Understanding
di: Pan, Xingang, et al.
Pubblicazione: (2017)
di: Pan, Xingang, et al.
Pubblicazione: (2017)
MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer
di: Wu, Guile, et al.
Pubblicazione: (2025)
di: Wu, Guile, et al.
Pubblicazione: (2025)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
di: He, Haichen, et al.
Pubblicazione: (2026)
di: He, Haichen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025) -
CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs
di: Zhou, Xingcheng, et al.
Pubblicazione: (2026) -
GPT-4V as Traffic Assistant: An In-depth Look at Vision Language Model on Complex Traffic Events
di: Zhou, Xingcheng, et al.
Pubblicazione: (2024) -
PointCompress3D: A Point Cloud Compression Framework for Roadside LiDARs in Intelligent Transportation Systems
di: Zimmer, Walter, et al.
Pubblicazione: (2024) -
TUMTraf EMOT: Event-Based Multi-Object Tracking Dataset and Baseline for Traffic Scenarios
di: Li, Mengyu, et al.
Pubblicazione: (2025)