When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Ruixuan, Wang, Beichen, Zhang, Juexiao, Bian, Zilin, Feng, Chen, Ozbay, Kaan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning When to See for Long-term Traffic Data Collection on Power-constrained Devices
di: Zhang, Ruixuan, et al.
Pubblicazione: (2024)
di: Zhang, Ruixuan, et al.
Pubblicazione: (2024)
ChildEval: When large language models meet children's personalities
di: Luo, Yanyan, et al.
Pubblicazione: (2026)
di: Luo, Yanyan, et al.
Pubblicazione: (2026)
Informed along the road: roadway capacity driven graph convolution network for network-wide traffic prediction
di: Bian, Zilin, et al.
Pubblicazione: (2024)
di: Bian, Zilin, et al.
Pubblicazione: (2024)
When marine radar target detection meets pretrained large language models
di: Hu, Qiying, et al.
Pubblicazione: (2025)
di: Hu, Qiying, et al.
Pubblicazione: (2025)
A benchmark multimodal oro-dental dataset for large vision-language models
di: Lv, Haoxin, et al.
Pubblicazione: (2025)
di: Lv, Haoxin, et al.
Pubblicazione: (2025)
Is your multimodal large language model a good science tutor?
di: Liu, Ming, et al.
Pubblicazione: (2025)
di: Liu, Ming, et al.
Pubblicazione: (2025)
A multi-dimension and high-granularity equity measurement for transportation services through accessibility and reliability
di: Mengke, et al.
Pubblicazione: (2024)
di: Mengke, et al.
Pubblicazione: (2024)
Protecting multimodal large language models against misleading visualizations
di: Tonglet, Jonathan, et al.
Pubblicazione: (2025)
di: Tonglet, Jonathan, et al.
Pubblicazione: (2025)
Dynamic Deployment of Mobile Charging Trucks During Natural Disaster Evacuation: An Offline-to-Online Framework
di: Ma, Rui, et al.
Pubblicazione: (2026)
di: Ma, Rui, et al.
Pubblicazione: (2026)
Human-like object concept representations emerge naturally in multimodal large language models
di: Du, Changde, et al.
Pubblicazione: (2024)
di: Du, Changde, et al.
Pubblicazione: (2024)
Hallucination-aware intermediate representation edit in large vision-language models
di: Suo, Wei, et al.
Pubblicazione: (2026)
di: Suo, Wei, et al.
Pubblicazione: (2026)
On the robustness of multimodal language model towards distractions
di: Liu, Ming, et al.
Pubblicazione: (2025)
di: Liu, Ming, et al.
Pubblicazione: (2025)
Traffic Prediction considering Multiple Levels of Spatial-temporal Information: A Multi-scale Graph Wavelet-based Approach
di: Bian, Zilin, et al.
Pubblicazione: (2024)
di: Bian, Zilin, et al.
Pubblicazione: (2024)
Evaluating point-light biological motion in multimodal large language models
di: Kadambi, Akila, et al.
Pubblicazione: (2025)
di: Kadambi, Akila, et al.
Pubblicazione: (2025)
MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
di: Chen, Yanyuan, et al.
Pubblicazione: (2025)
di: Chen, Yanyuan, et al.
Pubblicazione: (2025)
An analysis of vision-language models for fabric retrieval
di: Giuliari, Francesco, et al.
Pubblicazione: (2025)
di: Giuliari, Francesco, et al.
Pubblicazione: (2025)
Dissociating language and thought in large language models
di: Mahowald, Kyle, et al.
Pubblicazione: (2023)
di: Mahowald, Kyle, et al.
Pubblicazione: (2023)
A survey on fairness of large language models in e-commerce: progress, application, and challenge
di: Ren, Qingyang, et al.
Pubblicazione: (2024)
di: Ren, Qingyang, et al.
Pubblicazione: (2024)
Dynamic data sampler for cross-language transfer learning in large language models
di: Li, Yudong, et al.
Pubblicazione: (2024)
di: Li, Yudong, et al.
Pubblicazione: (2024)
Visual hallucination detection in large vision-language models via evidential conflict
di: Huang, Tao, et al.
Pubblicazione: (2025)
di: Huang, Tao, et al.
Pubblicazione: (2025)
AI-AI Bias: large language models favor communications generated by large language models
di: Laurito, Walter, et al.
Pubblicazione: (2024)
di: Laurito, Walter, et al.
Pubblicazione: (2024)
MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
In-context learning enables multimodal large language models to classify cancer pathology images
di: Ferber, Dyke, et al.
Pubblicazione: (2024)
di: Ferber, Dyke, et al.
Pubblicazione: (2024)
VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model
di: Wang, Beichen, et al.
Pubblicazione: (2024)
di: Wang, Beichen, et al.
Pubblicazione: (2024)
Network traffic classification based‐ masked language regression model using CNN
di: Steffi P. L., et al.
Pubblicazione: (2024)
di: Steffi P. L., et al.
Pubblicazione: (2024)
Automatic deductive coding in discourse analysis: an application of large language models in learning analytics
di: Zhang, Lishan, et al.
Pubblicazione: (2024)
di: Zhang, Lishan, et al.
Pubblicazione: (2024)
A safety realignment framework via subspace-oriented model fusion for large language models
di: Yi, Xin, et al.
Pubblicazione: (2024)
di: Yi, Xin, et al.
Pubblicazione: (2024)
Retrieval augmentation of large language models for lay language generation
di: Guo, Yue, et al.
Pubblicazione: (2022)
di: Guo, Yue, et al.
Pubblicazione: (2022)
Do large language models resemble humans in language use?
di: Cai, Zhenguang G., et al.
Pubblicazione: (2023)
di: Cai, Zhenguang G., et al.
Pubblicazione: (2023)
A vision-language model and platform for temporally mapping surgery from video
di: Kiyasseh, Dani
Pubblicazione: (2026)
di: Kiyasseh, Dani
Pubblicazione: (2026)
Do large language vision models understand 3D shapes?
di: Eppel, Sagi
Pubblicazione: (2024)
di: Eppel, Sagi
Pubblicazione: (2024)
Question answering system of bridge design specification based on large language model
di: Zhang, Leye, et al.
Pubblicazione: (2024)
di: Zhang, Leye, et al.
Pubblicazione: (2024)
GlitchBench: Can large multimodal models detect video game glitches?
di: Taesiri, Mohammad Reza, et al.
Pubblicazione: (2023)
di: Taesiri, Mohammad Reza, et al.
Pubblicazione: (2023)
What do vision-language models see in the context? Investigating multimodal in-context learning
di: Santos, Gabriel O. dos, et al.
Pubblicazione: (2025)
di: Santos, Gabriel O. dos, et al.
Pubblicazione: (2025)
Composite Safety Potential Field for Highway Driving Risk Assessment
di: Zuo, Dachuan, et al.
Pubblicazione: (2025)
di: Zuo, Dachuan, et al.
Pubblicazione: (2025)
Alzheimer's disease detection based on large language model prompt engineering
di: Zheng, Tian, et al.
Pubblicazione: (2025)
di: Zheng, Tian, et al.
Pubblicazione: (2025)
Automating psychological hypothesis generation with AI: when large language models meet causal graph
di: Tong, Song, et al.
Pubblicazione: (2024)
di: Tong, Song, et al.
Pubblicazione: (2024)
CXR-LLAVA: a multimodal large language model for interpreting chest X-ray images
di: Lee, Seowoo, et al.
Pubblicazione: (2023)
di: Lee, Seowoo, et al.
Pubblicazione: (2023)
Chain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehension
di: Pang, Yik Lung, et al.
Pubblicazione: (2026)
di: Pang, Yik Lung, et al.
Pubblicazione: (2026)
Prompting language influences diagnostic reasoning and accuracy of large language models
di: Bazoge, Adrien, et al.
Pubblicazione: (2026)
di: Bazoge, Adrien, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Learning When to See for Long-term Traffic Data Collection on Power-constrained Devices
di: Zhang, Ruixuan, et al.
Pubblicazione: (2024) -
ChildEval: When large language models meet children's personalities
di: Luo, Yanyan, et al.
Pubblicazione: (2026) -
Informed along the road: roadway capacity driven graph convolution network for network-wide traffic prediction
di: Bian, Zilin, et al.
Pubblicazione: (2024) -
When marine radar target detection meets pretrained large language models
di: Hu, Qiying, et al.
Pubblicazione: (2025) -
A benchmark multimodal oro-dental dataset for large vision-language models
di: Lv, Haoxin, et al.
Pubblicazione: (2025)