Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation
Fuente:
arXiv
Guardado en:
| Autores principales: | Deng, Ken, Qiu, Yifu, Kasten, Yoni, Cohen, Shay B., Ziser, Yftah |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
por: Qiu, Yifu, et al.
Publicado: (2025)
por: Qiu, Yifu, et al.
Publicado: (2025)
Layer by Layer: Uncovering Where Multi-Task Learning Happens in Instruction-Tuned Large Language Models
por: Zhao, Zheng, et al.
Publicado: (2024)
por: Zhao, Zheng, et al.
Publicado: (2024)
Iterative Multilingual Spectral Attribute Erasure
por: Shao, Shun, et al.
Publicado: (2025)
por: Shao, Shun, et al.
Publicado: (2025)
Spectral Editing of Activations for Large Language Model Alignment
por: Qiu, Yifu, et al.
Publicado: (2024)
por: Qiu, Yifu, et al.
Publicado: (2024)
Unified Vision-Language Modeling via Concept Space Alignment
por: Qiu, Yifu, et al.
Publicado: (2026)
por: Qiu, Yifu, et al.
Publicado: (2026)
Self-Improving World Modelling with Latent Actions
por: Qiu, Yifu, et al.
Publicado: (2026)
por: Qiu, Yifu, et al.
Publicado: (2026)
Lost in Embeddings: Information Loss in Vision-Language Models
por: Li, Wenyan, et al.
Publicado: (2025)
por: Li, Wenyan, et al.
Publicado: (2025)
Texture or Semantics? Vision-Language Models Get Lost in Font Recognition
por: Li, Zhecheng, et al.
Publicado: (2025)
por: Li, Zhecheng, et al.
Publicado: (2025)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information
por: Kamoi, Ryo, et al.
Publicado: (2024)
por: Kamoi, Ryo, et al.
Publicado: (2024)
The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors
por: Lucy, Li, et al.
Publicado: (2026)
por: Lucy, Li, et al.
Publicado: (2026)
Policy Optimized Text-to-Image Pipeline Design
por: Gadot, Uri, et al.
Publicado: (2025)
por: Gadot, Uri, et al.
Publicado: (2025)
PoseFM: Relative Camera Pose Estimation Through Flow Matching
por: Kuczkowski, Dominik, et al.
Publicado: (2026)
por: Kuczkowski, Dominik, et al.
Publicado: (2026)
Pose Priors from Language Models
por: Subramanian, Sanjay, et al.
Publicado: (2024)
por: Subramanian, Sanjay, et al.
Publicado: (2024)
TriTex: Learning Texture from a Single Mesh via Triplane Semantic Features
por: Cohen-Bar, Dana, et al.
Publicado: (2025)
por: Cohen-Bar, Dana, et al.
Publicado: (2025)
When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise
por: Shin, Philip Wootaek, et al.
Publicado: (2026)
por: Shin, Philip Wootaek, et al.
Publicado: (2026)
Relational Epipolar Graphs for Robust Relative Camera Pose Estimation
por: Rao, Prateeth, et al.
Publicado: (2026)
por: Rao, Prateeth, et al.
Publicado: (2026)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
por: Cai, Hengxing, et al.
Publicado: (2025)
por: Cai, Hengxing, et al.
Publicado: (2025)
Aligning What LLMs Do and Say: Towards Self-Consistent Explanations
por: Admoni, Sahar, et al.
Publicado: (2025)
por: Admoni, Sahar, et al.
Publicado: (2025)
Knowing Before Saying: LLM Representations Encode Information About Chain-of-Thought Success Before Completion
por: Afzal, Anum, et al.
Publicado: (2025)
por: Afzal, Anum, et al.
Publicado: (2025)
Wide-Baseline Relative Camera Pose Estimation with Directional Learning
por: Chen, Kefan, et al.
Publicado: (2021)
por: Chen, Kefan, et al.
Publicado: (2021)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
por: Qiu, Haoyi, et al.
Publicado: (2024)
por: Qiu, Haoyi, et al.
Publicado: (2024)
Ham2Pose: Animating Sign Language Notation into Pose Sequences
por: Shalev-Arkushin, Rotem, et al.
Publicado: (2022)
por: Shalev-Arkushin, Rotem, et al.
Publicado: (2022)
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
por: Tian, Yu, et al.
Publicado: (2024)
por: Tian, Yu, et al.
Publicado: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
por: Jie, Shibo, et al.
Publicado: (2024)
por: Jie, Shibo, et al.
Publicado: (2024)
Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models
por: Liu, Peiju, et al.
Publicado: (2026)
por: Liu, Peiju, et al.
Publicado: (2026)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
por: Zhang, Zheyuan, et al.
Publicado: (2024)
por: Zhang, Zheyuan, et al.
Publicado: (2024)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
por: Deng, Yihe, et al.
Publicado: (2024)
por: Deng, Yihe, et al.
Publicado: (2024)
Pose-Based Sign Language Appearance Transfer
por: Moryossef, Amit, et al.
Publicado: (2024)
por: Moryossef, Amit, et al.
Publicado: (2024)
When Knowledge Is Not Free: Cost-Aware Evidence Selection in Retrieval-Augmented Generation
por: Wu, Mingyan, et al.
Publicado: (2026)
por: Wu, Mingyan, et al.
Publicado: (2026)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
por: Cui, Chenhang, et al.
Publicado: (2024)
por: Cui, Chenhang, et al.
Publicado: (2024)
Fast Encoder-Based 3D from Casual Videos via Point Track Processing
por: Kasten, Yoni, et al.
Publicado: (2024)
por: Kasten, Yoni, et al.
Publicado: (2024)
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
por: Lee, Seongyun, et al.
Publicado: (2024)
por: Lee, Seongyun, et al.
Publicado: (2024)
SignX: Continuous Sign Recognition in Compact Pose-Rich Latent Space
por: Fang, Sen, et al.
Publicado: (2025)
por: Fang, Sen, et al.
Publicado: (2025)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
por: Ye, Jiacheng, et al.
Publicado: (2025)
por: Ye, Jiacheng, et al.
Publicado: (2025)
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
por: Kargaran, Amir Hossein, et al.
Publicado: (2026)
por: Kargaran, Amir Hossein, et al.
Publicado: (2026)
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
por: Ding, Yi, et al.
Publicado: (2026)
por: Ding, Yi, et al.
Publicado: (2026)
Conflict Adaptation in Vision-Language Models
por: Hu, Xiaoyang
Publicado: (2025)
por: Hu, Xiaoyang
Publicado: (2025)
Vision Language Models are Confused Tourists
por: Irawan, Patrick Amadeus, et al.
Publicado: (2025)
por: Irawan, Patrick Amadeus, et al.
Publicado: (2025)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
por: Zhou, Keyan, et al.
Publicado: (2025)
por: Zhou, Keyan, et al.
Publicado: (2025)
Ejemplares similares
-
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
por: Qiu, Yifu, et al.
Publicado: (2025) -
Layer by Layer: Uncovering Where Multi-Task Learning Happens in Instruction-Tuned Large Language Models
por: Zhao, Zheng, et al.
Publicado: (2024) -
Iterative Multilingual Spectral Attribute Erasure
por: Shao, Shun, et al.
Publicado: (2025) -
Spectral Editing of Activations for Large Language Model Alignment
por: Qiu, Yifu, et al.
Publicado: (2024) -
Unified Vision-Language Modeling via Concept Space Alignment
por: Qiu, Yifu, et al.
Publicado: (2026)