It's Time to Get It Right: Improving Analog Clock Reading and Clock-Hand Spatial Reasoning in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Choi, Jaeha, Lee, Jin Won, You, Siwoo, Lee, Jangho |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SAMIRO: Spatial Attention Mutual Information Regularization with a Pre-trained Model as Oracle for Lane Detection
par: Lee, Hyunjong, et autres
Publié: (2025)
par: Lee, Hyunjong, et autres
Publié: (2025)
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
par: Sayem, MD Khalequzzaman Chowdhury, et autres
Publié: (2026)
par: Sayem, MD Khalequzzaman Chowdhury, et autres
Publié: (2026)
Getting it Right: Improving Spatial Consistency in Text-to-Image Models
par: Chatterjee, Agneet, et autres
Publié: (2024)
par: Chatterjee, Agneet, et autres
Publié: (2024)
SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning
par: Hwang, Chan Yeong, et autres
Publié: (2026)
par: Hwang, Chan Yeong, et autres
Publié: (2026)
VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought
par: Lee, Eunsoo, et autres
Publié: (2026)
par: Lee, Eunsoo, et autres
Publié: (2026)
BEM: Training-Free Background Embedding Memory for False-Positive Suppression in Real-Time Fixed-Background Camera
par: Park, Junwoo, et autres
Publié: (2026)
par: Park, Junwoo, et autres
Publié: (2026)
PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis
par: Choi, Inseong, et autres
Publié: (2026)
par: Choi, Inseong, et autres
Publié: (2026)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
par: Lee, Youngwan, et autres
Publié: (2026)
par: Lee, Youngwan, et autres
Publié: (2026)
Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining
par: Jang, Hyeonseo, et autres
Publié: (2026)
par: Jang, Hyeonseo, et autres
Publié: (2026)
Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs
par: Saxena, Rohit, et autres
Publié: (2025)
par: Saxena, Rohit, et autres
Publié: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
Exploiting Diffusion Prior for Task-driven Image Restoration
par: Kim, Jaeha, et autres
Publié: (2025)
par: Kim, Jaeha, et autres
Publié: (2025)
Beyond Image Super-Resolution for Image Recognition with Task-Driven Perceptual Loss
par: Kim, Jaeha, et autres
Publié: (2024)
par: Kim, Jaeha, et autres
Publié: (2024)
Vision-Language Memory for Spatial Reasoning
par: Liu, Zuntao, et autres
Publié: (2025)
par: Liu, Zuntao, et autres
Publié: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
par: Deng, Nianchen, et autres
Publié: (2025)
par: Deng, Nianchen, et autres
Publié: (2025)
Intriguing Properties of Large Language and Vision Models
par: Lee, Young-Jun, et autres
Publié: (2024)
par: Lee, Young-Jun, et autres
Publié: (2024)
Phantom of Latent for Large Language and Vision Models
par: Lee, Byung-Kwan, et autres
Publié: (2024)
par: Lee, Byung-Kwan, et autres
Publié: (2024)
Learning Multi-View Spatial Reasoning from Cross-View Relations
par: Jeong, Suchae, et autres
Publié: (2026)
par: Jeong, Suchae, et autres
Publié: (2026)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
par: Huang, Xinmiao, et autres
Publié: (2025)
par: Huang, Xinmiao, et autres
Publié: (2025)
CLIP-HandID: Vision-Language Model for Hand-Based Person Identification
par: Baisa, Nathanael L., et autres
Publié: (2025)
par: Baisa, Nathanael L., et autres
Publié: (2025)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
par: Kim, Mingyeong, et autres
Publié: (2026)
par: Kim, Mingyeong, et autres
Publié: (2026)
Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models
par: Lee, Byung-Kwan, et autres
Publié: (2024)
par: Lee, Byung-Kwan, et autres
Publié: (2024)
MoAI: Mixture of All Intelligence for Large Language and Vision Models
par: Lee, Byung-Kwan, et autres
Publié: (2024)
par: Lee, Byung-Kwan, et autres
Publié: (2024)
Large Language Models can Share Images, Too!
par: Lee, Young-Jun, et autres
Publié: (2023)
par: Lee, Young-Jun, et autres
Publié: (2023)
Know Your Neighbors: Improving Single-View Reconstruction via Spatial Vision-Language Reasoning
par: Li, Rui, et autres
Publié: (2024)
par: Li, Rui, et autres
Publié: (2024)
Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
par: Jeon, Yerim, et autres
Publié: (2025)
par: Jeon, Yerim, et autres
Publié: (2025)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
par: Yu, Youngjoon, et autres
Publié: (2024)
par: Yu, Youngjoon, et autres
Publié: (2024)
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
par: Jeon, Byungwoo, et autres
Publié: (2026)
par: Jeon, Byungwoo, et autres
Publié: (2026)
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
par: Wu, Xiyang, et autres
Publié: (2025)
par: Wu, Xiyang, et autres
Publié: (2025)
Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
par: Won, John, et autres
Publié: (2025)
par: Won, John, et autres
Publié: (2025)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
par: Stogiannidis, Ilias, et autres
Publié: (2025)
par: Stogiannidis, Ilias, et autres
Publié: (2025)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
par: Xu, Ming, et autres
Publié: (2024)
par: Xu, Ming, et autres
Publié: (2024)
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
par: Ko, Dohwan, et autres
Publié: (2026)
par: Ko, Dohwan, et autres
Publié: (2026)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
par: Guo, Xianda, et autres
Publié: (2024)
par: Guo, Xianda, et autres
Publié: (2024)
Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
par: Zhang, Jiahuan, et autres
Publié: (2025)
par: Zhang, Jiahuan, et autres
Publié: (2025)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
par: Gholami, Mohsen, et autres
Publié: (2025)
par: Gholami, Mohsen, et autres
Publié: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
par: Cui, Kelly, et autres
Publié: (2026)
par: Cui, Kelly, et autres
Publié: (2026)
Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models
par: Jung, Daniel Sungho, et autres
Publié: (2026)
par: Jung, Daniel Sungho, et autres
Publié: (2026)
Documents similaires
-
SAMIRO: Spatial Attention Mutual Information Regularization with a Pre-trained Model as Oracle for Lane Detection
par: Lee, Hyunjong, et autres
Publié: (2025) -
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
par: Sayem, MD Khalequzzaman Chowdhury, et autres
Publié: (2026) -
Getting it Right: Improving Spatial Consistency in Text-to-Image Models
par: Chatterjee, Agneet, et autres
Publié: (2024) -
SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning
par: Hwang, Chan Yeong, et autres
Publié: (2026) -
VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought
par: Lee, Eunsoo, et autres
Publié: (2026)