Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning Framework with Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhen, Hao, Yang, Yunxiang, Yang, Jidong J. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enhancing Nighttime Vehicle Detection with Day-to-Night Style Transfer and Labeling-Free Augmentation
por: Yang, Yunxiang, et al.
Publicado: (2024)
por: Yang, Yunxiang, et al.
Publicado: (2024)
Multi-Agent Visual-Language Reasoning for Comprehensive Highway Scene Understanding
por: Yang, Yunxiang, et al.
Publicado: (2025)
por: Yang, Yunxiang, et al.
Publicado: (2025)
Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts
por: Lu, Xiao, et al.
Publicado: (2026)
por: Lu, Xiao, et al.
Publicado: (2026)
Structured Prompting and Multi-Agent Knowledge Distillation for Traffic Video Interpretation and Risk Inference
por: Yang, Yunxiang, et al.
Publicado: (2025)
por: Yang, Yunxiang, et al.
Publicado: (2025)
Cross-Paradigm Evaluation of Gaze-Based Semantic Object Identification for Intelligent Vehicles
por: Deng, Penghao, et al.
Publicado: (2026)
por: Deng, Penghao, et al.
Publicado: (2026)
VLM-PAR: A Vision Language Model for Pedestrian Attribute Recognition
por: Sellam, Abdellah Zakaria, et al.
Publicado: (2025)
por: Sellam, Abdellah Zakaria, et al.
Publicado: (2025)
PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction
por: Mishra, Naman, et al.
Publicado: (2026)
por: Mishra, Naman, et al.
Publicado: (2026)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
por: Xu, Haotian, et al.
Publicado: (2026)
por: Xu, Haotian, et al.
Publicado: (2026)
Video-to-Text Pedestrian Monitoring (VTPM): Leveraging Computer Vision and Large Language Models for Privacy-Preserve Pedestrian Activity Monitoring at Intersections
por: Abdelrahman, Ahmed S., et al.
Publicado: (2024)
por: Abdelrahman, Ahmed S., et al.
Publicado: (2024)
OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding
por: Fu, Teng, et al.
Publicado: (2025)
por: Fu, Teng, et al.
Publicado: (2025)
Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving
por: Gao, Haoxiang, et al.
Publicado: (2025)
por: Gao, Haoxiang, et al.
Publicado: (2025)
AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models
por: Zhang, Jiarui, et al.
Publicado: (2026)
por: Zhang, Jiarui, et al.
Publicado: (2026)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
por: Song, Python, et al.
Publicado: (2025)
por: Song, Python, et al.
Publicado: (2025)
Pedestrian Attribute Recognition via CLIP based Prompt Vision-Language Fusion
por: Wang, Xiao, et al.
Publicado: (2023)
por: Wang, Xiao, et al.
Publicado: (2023)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models
por: Pyo, Jiyoon, et al.
Publicado: (2025)
por: Pyo, Jiyoon, et al.
Publicado: (2025)
Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis
por: Lu, Sheng, et al.
Publicado: (2026)
por: Lu, Sheng, et al.
Publicado: (2026)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2025)
por: An, Ruichuan, et al.
Publicado: (2025)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
por: Chen, Qiguang, et al.
Publicado: (2026)
por: Chen, Qiguang, et al.
Publicado: (2026)
Physics Context Builders: A Modular Framework for Physical Reasoning in Vision-Language Models
por: Balazadeh, Vahid, et al.
Publicado: (2024)
por: Balazadeh, Vahid, et al.
Publicado: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2024)
por: An, Ruichuan, et al.
Publicado: (2024)
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
por: Tian, Xinyu, et al.
Publicado: (2025)
por: Tian, Xinyu, et al.
Publicado: (2025)
Effective Black-Box Multi-Faceted Attacks Breach Vision Large Language Model Guardrails
por: Yang, Yijun, et al.
Publicado: (2025)
por: Yang, Yijun, et al.
Publicado: (2025)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
por: Cai, Jie, et al.
Publicado: (2025)
por: Cai, Jie, et al.
Publicado: (2025)
Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
por: Yu, Bo, et al.
Publicado: (2026)
por: Yu, Bo, et al.
Publicado: (2026)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
por: Lee, Youngwan, et al.
Publicado: (2026)
por: Lee, Youngwan, et al.
Publicado: (2026)
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
por: Zhang, Yuelin, et al.
Publicado: (2026)
por: Zhang, Yuelin, et al.
Publicado: (2026)
CARE Drive A Framework for Evaluating Reason-Responsiveness of Vision Language Models in Automated Driving
por: Suryana, Lucas Elbert, et al.
Publicado: (2026)
por: Suryana, Lucas Elbert, et al.
Publicado: (2026)
Improve Vision Language Model Chain-of-thought Reasoning
por: Zhang, Ruohong, et al.
Publicado: (2024)
por: Zhang, Ruohong, et al.
Publicado: (2024)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
por: Zhao, Bingchen, et al.
Publicado: (2024)
por: Zhao, Bingchen, et al.
Publicado: (2024)
ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models
por: Mou, Tingshu, et al.
Publicado: (2026)
por: Mou, Tingshu, et al.
Publicado: (2026)
Distilling Multi-view Diffusion Models into 3D Generators
por: Qin, Hao, et al.
Publicado: (2025)
por: Qin, Hao, et al.
Publicado: (2025)
ReasonEdit: Editing Vision-Language Models using Human Reasoning
por: Qiu, Jiaxing, et al.
Publicado: (2026)
por: Qiu, Jiaxing, et al.
Publicado: (2026)
ATA: Bridging Implicit Reasoning with Attention-Guided and Action-Guided Inference for Vision-Language Action Models
por: Yang, Cheng, et al.
Publicado: (2026)
por: Yang, Cheng, et al.
Publicado: (2026)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
por: Ren, Yiming, et al.
Publicado: (2026)
por: Ren, Yiming, et al.
Publicado: (2026)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
por: Xue, Haotian, et al.
Publicado: (2025)
por: Xue, Haotian, et al.
Publicado: (2025)
Medical Large Vision Language Models with Multi-Image Visual Ability
por: Yang, Xikai, et al.
Publicado: (2025)
por: Yang, Xikai, et al.
Publicado: (2025)
Prompting Large Vision-Language Models for Compositional Reasoning
por: Ossowski, Timothy, et al.
Publicado: (2024)
por: Ossowski, Timothy, et al.
Publicado: (2024)
Jailbreaks on Vision Language Model via Multimodal Reasoning
por: Noheria, Aarush, et al.
Publicado: (2026)
por: Noheria, Aarush, et al.
Publicado: (2026)
Can Vision-Language Models Understand and Interpret Dynamic Gestures from Pedestrians? Pilot Datasets and Exploration Towards Instructive Nonverbal Commands for Cooperative Autonomous Vehicles
por: Bossen, Tonko E. W., et al.
Publicado: (2025)
por: Bossen, Tonko E. W., et al.
Publicado: (2025)
Ejemplares similares
-
Enhancing Nighttime Vehicle Detection with Day-to-Night Style Transfer and Labeling-Free Augmentation
por: Yang, Yunxiang, et al.
Publicado: (2024) -
Multi-Agent Visual-Language Reasoning for Comprehensive Highway Scene Understanding
por: Yang, Yunxiang, et al.
Publicado: (2025) -
Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts
por: Lu, Xiao, et al.
Publicado: (2026) -
Structured Prompting and Multi-Agent Knowledge Distillation for Traffic Video Interpretation and Risk Inference
por: Yang, Yunxiang, et al.
Publicado: (2025) -
Cross-Paradigm Evaluation of Gaze-Based Semantic Object Identification for Intelligent Vehicles
por: Deng, Penghao, et al.
Publicado: (2026)