Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis
Fuente:
arXiv
Saved in:
| Main Authors: | Trinci, Tomaso, Monteagudo, Henrique Piñeiro, Taccari, Leonardo |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RendBEV: Semantic Novel View Synthesis for Self-Supervised Bird's Eye View Segmentation
by: Monteagudo, Henrique Piñeiro, et al.
Published: (2025)
by: Monteagudo, Henrique Piñeiro, et al.
Published: (2025)
Elastic Feature Consolidation for Cold Start Exemplar-Free Incremental Learning
by: Magistri, Simone, et al.
Published: (2024)
by: Magistri, Simone, et al.
Published: (2024)
SafeAug: Safety-Critical Driving Data Augmentation from Naturalistic Datasets
by: Mo, Zhaobin, et al.
Published: (2025)
by: Mo, Zhaobin, et al.
Published: (2025)
Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models
by: Khanal, Bidur, et al.
Published: (2025)
by: Khanal, Bidur, et al.
Published: (2025)
ReGentS: Real-World Safety-Critical Driving Scenario Generation Made Stable
by: Yin, Yuan, et al.
Published: (2024)
by: Yin, Yuan, et al.
Published: (2024)
LLM-attacker: Enhancing Closed-loop Adversarial Scenario Generation for Autonomous Driving with Large Language Models
by: Mei, Yuewen, et al.
Published: (2025)
by: Mei, Yuewen, et al.
Published: (2025)
Visual Prompting in Multimodal Large Language Models: A Survey
by: Wu, Junda, et al.
Published: (2024)
by: Wu, Junda, et al.
Published: (2024)
Introducing Visual Perception Token into Multimodal Large Language Model
by: Yu, Runpeng, et al.
Published: (2025)
by: Yu, Runpeng, et al.
Published: (2025)
Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models
by: You, Weiqiu, et al.
Published: (2026)
by: You, Weiqiu, et al.
Published: (2026)
ViewpointDepth: A New Dataset for Monocular Depth Estimation Under Viewpoint Shifts
by: Pjetri, Aurel, et al.
Published: (2024)
by: Pjetri, Aurel, et al.
Published: (2024)
Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression
by: Jennings, Roy H., et al.
Published: (2025)
by: Jennings, Roy H., et al.
Published: (2025)
SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models
by: Reza, Md Kaykobad, et al.
Published: (2026)
by: Reza, Md Kaykobad, et al.
Published: (2026)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering
by: Huai, Tianyu, et al.
Published: (2025)
by: Huai, Tianyu, et al.
Published: (2025)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
by: Patel, Alkesh, et al.
Published: (2025)
by: Patel, Alkesh, et al.
Published: (2025)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
by: Cai, Chengyi, et al.
Published: (2026)
by: Cai, Chengyi, et al.
Published: (2026)
Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
by: Wang, Enguang, et al.
Published: (2026)
by: Wang, Enguang, et al.
Published: (2026)
WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models
by: Zhou, Runjie, et al.
Published: (2026)
by: Zhou, Runjie, et al.
Published: (2026)
ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry Area
by: Li, Junxian, et al.
Published: (2024)
by: Li, Junxian, et al.
Published: (2024)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
by: Sun, Zhihao, et al.
Published: (2024)
by: Sun, Zhihao, et al.
Published: (2024)
Towards Large-scale Chemical Reaction Image Parsing via a Multimodal Large Language Model
by: Chen, Yufan, et al.
Published: (2025)
by: Chen, Yufan, et al.
Published: (2025)
LaVy: Vietnamese Multimodal Large Language Model
by: Tran, Chi, et al.
Published: (2024)
by: Tran, Chi, et al.
Published: (2024)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
by: Agarwal, Sakshi, et al.
Published: (2026)
by: Agarwal, Sakshi, et al.
Published: (2026)
TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors
by: Cheng, Wei-Yuan, et al.
Published: (2026)
by: Cheng, Wei-Yuan, et al.
Published: (2026)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
by: Tao, Keda, et al.
Published: (2024)
by: Tao, Keda, et al.
Published: (2024)
Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models
by: Liu, Yuehao, et al.
Published: (2026)
by: Liu, Yuehao, et al.
Published: (2026)
Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study
by: Torop, Max, et al.
Published: (2025)
by: Torop, Max, et al.
Published: (2025)
Graph-based Unsupervised Disentangled Representation Learning via Multimodal Large Language Models
by: Xie, Baao, et al.
Published: (2024)
by: Xie, Baao, et al.
Published: (2024)
Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models
by: Zheng, Kening, et al.
Published: (2024)
by: Zheng, Kening, et al.
Published: (2024)
LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model
by: Muhtar, Dilxat, et al.
Published: (2024)
by: Muhtar, Dilxat, et al.
Published: (2024)
AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
by: Xing, Shuo, et al.
Published: (2024)
by: Xing, Shuo, et al.
Published: (2024)
A Safety-Adapted Loss for Pedestrian Detection in Automated Driving
by: Lyssenko, Maria, et al.
Published: (2024)
by: Lyssenko, Maria, et al.
Published: (2024)
Bridging Compressed Image Latents and Multimodal Large Language Models
by: Kao, Chia-Hao, et al.
Published: (2024)
by: Kao, Chia-Hao, et al.
Published: (2024)
Improving Multimodal Large Language Models Using Continual Learning
by: Srivastava, Shikhar, et al.
Published: (2024)
by: Srivastava, Shikhar, et al.
Published: (2024)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
by: Cheng, Daixuan, et al.
Published: (2024)
by: Cheng, Daixuan, et al.
Published: (2024)
Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models
by: Hu, Rui, et al.
Published: (2025)
by: Hu, Rui, et al.
Published: (2025)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
by: Zhang, Dingkun, et al.
Published: (2026)
by: Zhang, Dingkun, et al.
Published: (2026)
CapeLLM: Support-Free Category-Agnostic Pose Estimation with Multimodal Large Language Models
by: Kim, Junho, et al.
Published: (2024)
by: Kim, Junho, et al.
Published: (2024)
Toward Unified Multimodal Representation Learning for Autonomous Driving
by: Tao, Ximeng, et al.
Published: (2026)
by: Tao, Ximeng, et al.
Published: (2026)
Universal Camouflage Attack on Vision-Language Models for Autonomous Driving
by: Kong, Dehong, et al.
Published: (2025)
by: Kong, Dehong, et al.
Published: (2025)
Similar Items
-
RendBEV: Semantic Novel View Synthesis for Self-Supervised Bird's Eye View Segmentation
by: Monteagudo, Henrique Piñeiro, et al.
Published: (2025) -
Elastic Feature Consolidation for Cold Start Exemplar-Free Incremental Learning
by: Magistri, Simone, et al.
Published: (2024) -
SafeAug: Safety-Critical Driving Data Augmentation from Naturalistic Datasets
by: Mo, Zhaobin, et al.
Published: (2025) -
Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models
by: Khanal, Bidur, et al.
Published: (2025) -
ReGentS: Real-World Safety-Critical Driving Scenario Generation Made Stable
by: Yin, Yuan, et al.
Published: (2024)