DriveMRP: Enhancing Vision-Language Models with Synthetic Motion Data for Motion Risk Prediction
Fuente:
arXiv
Salvato in:
| Autori principali: | Hou, Zhiyi, Ma, Enhui, Li, Fang, Lai, Zhiyi, Ho, Kalok, Wu, Zhanqian, Zhou, Lijun, Chen, Long, Sun, Chitian, Sun, Haiyang, Wang, Bing, Chen, Guang, Ye, Hangjun, Yu, Kaicheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
di: Raoufi, Behnam, et al.
Pubblicazione: (2025)
di: Raoufi, Behnam, et al.
Pubblicazione: (2025)
Evaluating the Impact of Synthetic Data on Object Detection Tasks in Autonomous Driving
di: Özeren, Enes, et al.
Pubblicazione: (2025)
di: Özeren, Enes, et al.
Pubblicazione: (2025)
Dense Motion Captioning
di: Xu, Shiyao, et al.
Pubblicazione: (2025)
di: Xu, Shiyao, et al.
Pubblicazione: (2025)
Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention
di: Durrani, Hamza Ahmed, et al.
Pubblicazione: (2026)
di: Durrani, Hamza Ahmed, et al.
Pubblicazione: (2026)
OnlyFlow: Optical Flow based Motion Conditioning for Video Diffusion Models
di: Koroglu, Mathis, et al.
Pubblicazione: (2024)
di: Koroglu, Mathis, et al.
Pubblicazione: (2024)
Motion-Guided Semantic Alignment with Negative Prompts for Zero-Shot Video Action Recognition
di: Wang, Yiming, et al.
Pubblicazione: (2026)
di: Wang, Yiming, et al.
Pubblicazione: (2026)
Selection, Not Fusion: Radar-Modulated State Space Models for Radar-Camera Depth Estimation
di: Hou, Zhangcheng, et al.
Pubblicazione: (2026)
di: Hou, Zhangcheng, et al.
Pubblicazione: (2026)
MSPCaps: A Multi-Scale Patchify Capsule Network with Cross-Agreement Routing for Visual Recognition
di: Hu, Yudong, et al.
Pubblicazione: (2025)
di: Hu, Yudong, et al.
Pubblicazione: (2025)
OmniAcc: Personalized Accessibility Assistant Using Generative AI
di: Karki, Siddhant, et al.
Pubblicazione: (2025)
di: Karki, Siddhant, et al.
Pubblicazione: (2025)
Efficient Temporally-Aware DeepFake Detection using H.264 Motion Vectors
di: Grönquist, Peter, et al.
Pubblicazione: (2023)
di: Grönquist, Peter, et al.
Pubblicazione: (2023)
Synthetic-Child: An AIGC-Based Synthetic Data Pipeline for Privacy-Preserving Child Posture Estimation
di: Zeng, Taowen
Pubblicazione: (2026)
di: Zeng, Taowen
Pubblicazione: (2026)
FlexDoc: Parameterized Sampling for Diverse Multilingual Synthetic Documents for Training Document Understanding Models
di: Dua, Karan, et al.
Pubblicazione: (2025)
di: Dua, Karan, et al.
Pubblicazione: (2025)
Semi supervised GAN for smart microscopy, fast and data efficient cell cycle classification
di: Manick, Rajeev, et al.
Pubblicazione: (2026)
di: Manick, Rajeev, et al.
Pubblicazione: (2026)
Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images
di: Chen, Yuangong, et al.
Pubblicazione: (2026)
di: Chen, Yuangong, et al.
Pubblicazione: (2026)
Exploring Surround-View Fisheye Camera 3D Object Detection
di: Li, Changcai, et al.
Pubblicazione: (2025)
di: Li, Changcai, et al.
Pubblicazione: (2025)
Leum-VL Technical Report
di: He, Yuxuan, et al.
Pubblicazione: (2026)
di: He, Yuxuan, et al.
Pubblicazione: (2026)
CARScenes: Semantic VLM Dataset for Safe Autonomous Driving
di: He, Yuankai, et al.
Pubblicazione: (2025)
di: He, Yuankai, et al.
Pubblicazione: (2025)
From eye to AI: studying rodent social behavior in the era of machine Learning
di: Chindemi, Giuseppe, et al.
Pubblicazione: (2025)
di: Chindemi, Giuseppe, et al.
Pubblicazione: (2025)
DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification
di: Ho, Darryl, et al.
Pubblicazione: (2025)
di: Ho, Darryl, et al.
Pubblicazione: (2025)
HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding
di: Jin, Haopeng, et al.
Pubblicazione: (2026)
di: Jin, Haopeng, et al.
Pubblicazione: (2026)
T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models
di: Chen, Yiteng, et al.
Pubblicazione: (2025)
di: Chen, Yiteng, et al.
Pubblicazione: (2025)
AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making
di: Li, Wenbo, et al.
Pubblicazione: (2025)
di: Li, Wenbo, et al.
Pubblicazione: (2025)
A Reverse Causal Framework to Mitigate Spurious Correlations for Debiasing Scene Graph Generation
di: Sun, Shuzhou, et al.
Pubblicazione: (2025)
di: Sun, Shuzhou, et al.
Pubblicazione: (2025)
Slow - Motion Video Synthesis for Basketball Using Frame Interpolation
di: Huang, Jiantang
Pubblicazione: (2025)
di: Huang, Jiantang
Pubblicazione: (2025)
High-Frequency Semantics and Geometric Priors for End-to-End Detection Transformers in Challenging UAV Imagery
di: Peng, Hongxing, et al.
Pubblicazione: (2025)
di: Peng, Hongxing, et al.
Pubblicazione: (2025)
Single-Shot Metric Depth from Focused Plenoptic Cameras
di: Lasheras-Hernandez, Blanca, et al.
Pubblicazione: (2024)
di: Lasheras-Hernandez, Blanca, et al.
Pubblicazione: (2024)
VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions
di: Pu, Qingwen, et al.
Pubblicazione: (2026)
di: Pu, Qingwen, et al.
Pubblicazione: (2026)
Smooth regularization for efficient video recognition
di: Goldman, Gil, et al.
Pubblicazione: (2025)
di: Goldman, Gil, et al.
Pubblicazione: (2025)
Neuromorphic Monocular Depth Estimation with Uncertainty Modeling
di: Bergkvist, Viktor, et al.
Pubblicazione: (2026)
di: Bergkvist, Viktor, et al.
Pubblicazione: (2026)
A Vision-Language Model for Focal Liver Lesion Classification
di: Jian, Song, et al.
Pubblicazione: (2025)
di: Jian, Song, et al.
Pubblicazione: (2025)
PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance
di: Satish, Siddarth Nilol Kundur, et al.
Pubblicazione: (2026)
di: Satish, Siddarth Nilol Kundur, et al.
Pubblicazione: (2026)
EmoVerse: A MLLMs-Driven Emotion Representation Dataset for Interpretable Visual Emotion Analysis
di: Guo, Yijie, et al.
Pubblicazione: (2025)
di: Guo, Yijie, et al.
Pubblicazione: (2025)
Butter: Frequency Consistency and Hierarchical Fusion for Autonomous Driving Object Detection
di: Lin, Xiaojian, et al.
Pubblicazione: (2025)
di: Lin, Xiaojian, et al.
Pubblicazione: (2025)
4D Synchronized Fields: Motion-Language Gaussian Splatting for Temporal Scene Understanding
di: Barhdadi, Mohamed Rayan, et al.
Pubblicazione: (2026)
di: Barhdadi, Mohamed Rayan, et al.
Pubblicazione: (2026)
Motion Perceiver: Real-Time Occupancy Forecasting for Embedded Systems
di: Ferenczi, Bryce, et al.
Pubblicazione: (2023)
di: Ferenczi, Bryce, et al.
Pubblicazione: (2023)
Foreground Focus: Enhancing Coherence and Fidelity in Camouflaged Image Generation
di: Chen, Pei-Chi, et al.
Pubblicazione: (2025)
di: Chen, Pei-Chi, et al.
Pubblicazione: (2025)
Motion Attribution for Video Generation
di: Wu, Xindi, et al.
Pubblicazione: (2026)
di: Wu, Xindi, et al.
Pubblicazione: (2026)
Domain-Adaptive Pretraining Improves Primate Behavior Recognition
di: Mueller, Felix B., et al.
Pubblicazione: (2025)
di: Mueller, Felix B., et al.
Pubblicazione: (2025)
Visible Iris Area as a Quality Metric for Reliable Iris Recognition Under Pupil Dilation and Eyelid Occlusion
di: Pessaud, Jack, et al.
Pubblicazione: (2025)
di: Pessaud, Jack, et al.
Pubblicazione: (2025)
Decoupling Vision and Language: Codebook Anchored Visual Adaptation
di: Wu, Jason, et al.
Pubblicazione: (2026)
di: Wu, Jason, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
di: Raoufi, Behnam, et al.
Pubblicazione: (2025) -
Evaluating the Impact of Synthetic Data on Object Detection Tasks in Autonomous Driving
di: Özeren, Enes, et al.
Pubblicazione: (2025) -
Dense Motion Captioning
di: Xu, Shiyao, et al.
Pubblicazione: (2025) -
Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention
di: Durrani, Hamza Ahmed, et al.
Pubblicazione: (2026) -
OnlyFlow: Optical Flow based Motion Conditioning for Video Diffusion Models
di: Koroglu, Mathis, et al.
Pubblicazione: (2024)