Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Panchal, Utsav, Liu, Yuchen, Palmieri, Luigi, Georgievski, Ilche, Aiello, Marco |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DELTA: Decomposed Efficient Long-Term Robot Task Planning using Large Language Models
por: Liu, Yuchen, et al.
Publicado: (2024)
por: Liu, Yuchen, et al.
Publicado: (2024)
Towards Human Awareness in Robot Task Planning with Large Language Models
por: Liu, Yuchen, et al.
Publicado: (2024)
por: Liu, Yuchen, et al.
Publicado: (2024)
Initial Steps in Integrating Large Reasoning and Action Models for Service Composition
por: Georgievski, Ilche, et al.
Publicado: (2025)
por: Georgievski, Ilche, et al.
Publicado: (2025)
Introduction to AI Planning
por: Aiello, Marco, et al.
Publicado: (2024)
por: Aiello, Marco, et al.
Publicado: (2024)
Risk Awareness in HTN Planning
por: Alnazer, Ebaa, et al.
Publicado: (2022)
por: Alnazer, Ebaa, et al.
Publicado: (2022)
Seeing Isn't Believing: Context-Aware Adversarial Patch Synthesis via Conditional GAN
por: Kazoom, Roie, et al.
Publicado: (2025)
por: Kazoom, Roie, et al.
Publicado: (2025)
The Energy Impact of Domain Model Design in Classical Planning
por: Georgievski, Ilche, et al.
Publicado: (2026)
por: Georgievski, Ilche, et al.
Publicado: (2026)
Context-Aware Human Behavior Prediction Using Multimodal Large Language Models: Challenges and Insights
por: Liu, Yuchen, et al.
Publicado: (2025)
por: Liu, Yuchen, et al.
Publicado: (2025)
Seeing is not Believing: An Identity Hider for Human Vision Privacy Protection
por: Wang, Tao, et al.
Publicado: (2023)
por: Wang, Tao, et al.
Publicado: (2023)
Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise
por: Geng, Zibin, et al.
Publicado: (2026)
por: Geng, Zibin, et al.
Publicado: (2026)
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
por: Talon, Davide, et al.
Publicado: (2025)
por: Talon, Davide, et al.
Publicado: (2025)
Believing is Seeing: Unobserved Object Detection using Generative Models
por: Bhattacharjee, Subhransu S., et al.
Publicado: (2024)
por: Bhattacharjee, Subhransu S., et al.
Publicado: (2024)
Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations
por: Zhang, Xuesong, et al.
Publicado: (2024)
por: Zhang, Xuesong, et al.
Publicado: (2024)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
por: Deng, Ailin, et al.
Publicado: (2024)
por: Deng, Ailin, et al.
Publicado: (2024)
Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
por: Liu, Zhining, et al.
Publicado: (2025)
por: Liu, Zhining, et al.
Publicado: (2025)
Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes
por: Ling, Chen, et al.
Publicado: (2026)
por: Ling, Chen, et al.
Publicado: (2026)
Conformal Predictions for Human Action Recognition with Vision-Language Models
por: Tim, Bary, et al.
Publicado: (2025)
por: Tim, Bary, et al.
Publicado: (2025)
INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation
por: Chen, Dianwei, et al.
Publicado: (2025)
por: Chen, Dianwei, et al.
Publicado: (2025)
Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
por: Xuan, Weihao, et al.
Publicado: (2025)
por: Xuan, Weihao, et al.
Publicado: (2025)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026)
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026)
HiLa: Hierarchical Vision-Language Collaboration for Cancer Survival Prediction
por: Cui, Jiaqi, et al.
Publicado: (2025)
por: Cui, Jiaqi, et al.
Publicado: (2025)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
por: He, Zhentao, et al.
Publicado: (2025)
por: He, Zhentao, et al.
Publicado: (2025)
Seeing Like Radiologists: Context- and Gaze-Guided Vision-Language Pretraining for Chest X-rays
por: Liu, Kang, et al.
Publicado: (2026)
por: Liu, Kang, et al.
Publicado: (2026)
Large Vision-Language Models as Emotion Recognizers in Context Awareness
por: Lei, Yuxuan, et al.
Publicado: (2024)
por: Lei, Yuxuan, et al.
Publicado: (2024)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
por: Hou, Wenjin, et al.
Publicado: (2026)
por: Hou, Wenjin, et al.
Publicado: (2026)
InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding
por: Zhang, Huaxiang, et al.
Publicado: (2024)
por: Zhang, Huaxiang, et al.
Publicado: (2024)
Modeling Human Gaze Behavior with Diffusion Models for Unified Scanpath Prediction
por: Cartella, Giuseppe, et al.
Publicado: (2025)
por: Cartella, Giuseppe, et al.
Publicado: (2025)
DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models
por: Song, Jingyu, et al.
Publicado: (2025)
por: Song, Jingyu, et al.
Publicado: (2025)
Learning to See the Elephant in the Room: Self-Supervised Context Reasoning in Humans and AI
por: Liu, Xiao, et al.
Publicado: (2022)
por: Liu, Xiao, et al.
Publicado: (2022)
To Trust Or Not To Trust Your Vision-Language Model's Prediction
por: Dong, Hao, et al.
Publicado: (2025)
por: Dong, Hao, et al.
Publicado: (2025)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
por: Lu, Yujie, et al.
Publicado: (2024)
por: Lu, Yujie, et al.
Publicado: (2024)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
por: Huang, Chengyue, et al.
Publicado: (2025)
por: Huang, Chengyue, et al.
Publicado: (2025)
When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models
por: Ortu, Francesco, et al.
Publicado: (2025)
por: Ortu, Francesco, et al.
Publicado: (2025)
CARPE: Context-Aware Image Representation Prioritization via Ensemble for Large Vision-Language Models
por: Lee, Donghee, et al.
Publicado: (2026)
por: Lee, Donghee, et al.
Publicado: (2026)
Medical Large Vision Language Models with Multi-Image Visual Ability
por: Yang, Xikai, et al.
Publicado: (2025)
por: Yang, Xikai, et al.
Publicado: (2025)
Intention-Aware Diffusion Model for Pedestrian Trajectory Prediction
por: Liu, Yu, et al.
Publicado: (2025)
por: Liu, Yu, et al.
Publicado: (2025)
COTTA: Context-Aware Transfer Adaptation for Trajectory Prediction in Autonomous Driving
por: Park, Seohyoung, et al.
Publicado: (2026)
por: Park, Seohyoung, et al.
Publicado: (2026)
See No Evil: Semantic Context-Aware Privacy Risk Detection for AR
por: Liu, Jialu, et al.
Publicado: (2026)
por: Liu, Jialu, et al.
Publicado: (2026)
UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction
por: Hao, Xixuan, et al.
Publicado: (2024)
por: Hao, Xixuan, et al.
Publicado: (2024)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
por: Ding, Kun, et al.
Publicado: (2022)
por: Ding, Kun, et al.
Publicado: (2022)
Ejemplares similares
-
DELTA: Decomposed Efficient Long-Term Robot Task Planning using Large Language Models
por: Liu, Yuchen, et al.
Publicado: (2024) -
Towards Human Awareness in Robot Task Planning with Large Language Models
por: Liu, Yuchen, et al.
Publicado: (2024) -
Initial Steps in Integrating Large Reasoning and Action Models for Service Composition
por: Georgievski, Ilche, et al.
Publicado: (2025) -
Introduction to AI Planning
por: Aiello, Marco, et al.
Publicado: (2024) -
Risk Awareness in HTN Planning
por: Alnazer, Ebaa, et al.
Publicado: (2022)