Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Gengyuan, Zhang, Yurui, Zhang, Kerui, Tresp, Volker |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
Localizing Events in Videos with Multimodal Queries
di: Zhang, Gengyuan, et al.
Pubblicazione: (2024)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2024)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
di: Chen, Haokun, et al.
Pubblicazione: (2025)
di: Chen, Haokun, et al.
Pubblicazione: (2025)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
di: Berman, Shmuel, et al.
Pubblicazione: (2025)
di: Berman, Shmuel, et al.
Pubblicazione: (2025)
Unveiling the "Fairness Seesaw": Discovering and Mitigating Gender and Race Bias in Vision-Language Models
di: Lan, Jian, et al.
Pubblicazione: (2025)
di: Lan, Jian, et al.
Pubblicazione: (2025)
Mixed Signals: Decoding VLMs' Reasoning and Underlying Bias in Vision-Language Conflict
di: Pezeshkpour, Pouya, et al.
Pubblicazione: (2025)
di: Pezeshkpour, Pouya, et al.
Pubblicazione: (2025)
Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
di: Yu, Bo, et al.
Pubblicazione: (2026)
di: Yu, Bo, et al.
Pubblicazione: (2026)
Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
LocateBench: Evaluating the Locating Ability of Vision Language Models
di: Chiang, Ting-Rui, et al.
Pubblicazione: (2024)
di: Chiang, Ting-Rui, et al.
Pubblicazione: (2024)
Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries
di: Amoroso, Roberto, et al.
Pubblicazione: (2024)
di: Amoroso, Roberto, et al.
Pubblicazione: (2024)
Can Generalist Vision Language Models (VLMs) Rival Specialist Medical VLMs? Benchmarking and Strategic Insights
di: Zhong, Yuan, et al.
Pubblicazione: (2025)
di: Zhong, Yuan, et al.
Pubblicazione: (2025)
Multimodal Pragmatic Jailbreak on Text-to-image Models
di: Liu, Tong, et al.
Pubblicazione: (2024)
di: Liu, Tong, et al.
Pubblicazione: (2024)
Can World Models Benefit VLMs for World Dynamics?
di: Zhang, Kevin, et al.
Pubblicazione: (2025)
di: Zhang, Kevin, et al.
Pubblicazione: (2025)
Evaluating Vision Language Models (VLMs) for Radiology: A Comprehensive Analysis
di: Li, Frank, et al.
Pubblicazione: (2025)
di: Li, Frank, et al.
Pubblicazione: (2025)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs
di: Zhang, Yuyou, et al.
Pubblicazione: (2025)
di: Zhang, Yuyou, et al.
Pubblicazione: (2025)
VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models
di: Wu, Kui, et al.
Pubblicazione: (2025)
di: Wu, Kui, et al.
Pubblicazione: (2025)
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
di: Chen, Shuo, et al.
Pubblicazione: (2023)
di: Chen, Shuo, et al.
Pubblicazione: (2023)
ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
di: Shi, Xinrui, et al.
Pubblicazione: (2026)
di: Shi, Xinrui, et al.
Pubblicazione: (2026)
PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models
di: Mak, Chak-Wing, et al.
Pubblicazione: (2026)
di: Mak, Chak-Wing, et al.
Pubblicazione: (2026)
Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning
di: Tan, Zhangyun, et al.
Pubblicazione: (2026)
di: Tan, Zhangyun, et al.
Pubblicazione: (2026)
GameVerse: Can Vision-Language Models Learn from Video-based Reflection?
di: Zhang, Kuan, et al.
Pubblicazione: (2026)
di: Zhang, Kuan, et al.
Pubblicazione: (2026)
Vision-Language Models Can Self-Improve Reasoning via Reflection
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
Multi-event Video-Text Retrieval
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs
di: Ballout, Mohamad, et al.
Pubblicazione: (2025)
di: Ballout, Mohamad, et al.
Pubblicazione: (2025)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2025)
di: Jin, Haibo, et al.
Pubblicazione: (2025)
Can VLMs Reason Robustly? A Neuro-Symbolic Investigation
di: Chen, Weixin, et al.
Pubblicazione: (2026)
di: Chen, Weixin, et al.
Pubblicazione: (2026)
Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
di: Pang, Yuqi, et al.
Pubblicazione: (2025)
di: Pang, Yuqi, et al.
Pubblicazione: (2025)
Test-Time Reasoning Through Visual Human Preferences with VLMs and Soft Rewards
di: Gambashidze, Alexander, et al.
Pubblicazione: (2025)
di: Gambashidze, Alexander, et al.
Pubblicazione: (2025)
Caption This, Reason That: VLMs Caught in the Middle
di: Weng, Zihan, et al.
Pubblicazione: (2025)
di: Weng, Zihan, et al.
Pubblicazione: (2025)
VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs
di: Liao, Ruotong, et al.
Pubblicazione: (2024)
di: Liao, Ruotong, et al.
Pubblicazione: (2024)
Visual Question Decomposition on Multimodal Large Language Models
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
DISSECT: Diagnosing Where Vision Ends and Language Priors Begin in Scientific VLMs
di: Kukreja, Dikshant, et al.
Pubblicazione: (2026)
di: Kukreja, Dikshant, et al.
Pubblicazione: (2026)
Improve Vision Language Model Chain-of-thought Reasoning
di: Zhang, Ruohong, et al.
Pubblicazione: (2024)
di: Zhang, Ruohong, et al.
Pubblicazione: (2024)
NanoVLMs: How small can we go and still make coherent Vision Language Models?
di: Agarwalla, Mukund, et al.
Pubblicazione: (2025)
di: Agarwalla, Mukund, et al.
Pubblicazione: (2025)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
di: Bao, Han, et al.
Pubblicazione: (2024)
di: Bao, Han, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
di: Guo, Xuyang, et al.
Pubblicazione: (2025) -
Localizing Events in Videos with Multimodal Queries
di: Zhang, Gengyuan, et al.
Pubblicazione: (2024) -
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
di: Chen, Haokun, et al.
Pubblicazione: (2025) -
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
di: Berman, Shmuel, et al.
Pubblicazione: (2025) -
Unveiling the "Fairness Seesaw": Discovering and Mitigating Gender and Race Bias in Vision-Language Models
di: Lan, Jian, et al.
Pubblicazione: (2025)