Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Góral, Gracjan, Ziarko, Alicja, Nauman, Michal, Wołczyk, Maciej |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models
di: Góral, Gracjan, et al.
Pubblicazione: (2025)
di: Góral, Gracjan, et al.
Pubblicazione: (2025)
Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
di: Li, Sijie, et al.
Pubblicazione: (2026)
di: Li, Sijie, et al.
Pubblicazione: (2026)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
Rethinking Misalignment in Vision-Language Model Adaptation from a Causal Perspective
di: Zhang, Yanan, et al.
Pubblicazione: (2024)
di: Zhang, Yanan, et al.
Pubblicazione: (2024)
Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models
di: Groot, Tobias, et al.
Pubblicazione: (2024)
di: Groot, Tobias, et al.
Pubblicazione: (2024)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time
di: Ding, Yi, et al.
Pubblicazione: (2024)
di: Ding, Yi, et al.
Pubblicazione: (2024)
Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models
di: Nigam, Shubham Kumar, et al.
Pubblicazione: (2025)
di: Nigam, Shubham Kumar, et al.
Pubblicazione: (2025)
If CLIP Could Talk: Understanding Vision-Language Model Representations Through Their Preferred Concept Descriptions
di: Esfandiarpoor, Reza, et al.
Pubblicazione: (2024)
di: Esfandiarpoor, Reza, et al.
Pubblicazione: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
di: Jie, Shibo, et al.
Pubblicazione: (2024)
di: Jie, Shibo, et al.
Pubblicazione: (2024)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
di: Yoon, Hyungjun, et al.
Pubblicazione: (2024)
di: Yoon, Hyungjun, et al.
Pubblicazione: (2024)
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
The Neglected Tails in Vision-Language Models
di: Parashar, Shubham, et al.
Pubblicazione: (2024)
di: Parashar, Shubham, et al.
Pubblicazione: (2024)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
di: Lin, Zichuan, et al.
Pubblicazione: (2025)
di: Lin, Zichuan, et al.
Pubblicazione: (2025)
Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme
di: Ma, Yan, et al.
Pubblicazione: (2025)
di: Ma, Yan, et al.
Pubblicazione: (2025)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
di: Wang, Zekun, et al.
Pubblicazione: (2025)
di: Wang, Zekun, et al.
Pubblicazione: (2025)
A Vision Check-up for Language Models
di: Sharma, Pratyusha, et al.
Pubblicazione: (2024)
di: Sharma, Pratyusha, et al.
Pubblicazione: (2024)
Calibrated Self-Rewarding Vision Language Models
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
VisualRWKV: Exploring Recurrent Neural Networks for Visual Language Models
di: Hou, Haowen, et al.
Pubblicazione: (2024)
di: Hou, Haowen, et al.
Pubblicazione: (2024)
MouSi: Poly-Visual-Expert Vision-Language Models
di: Fan, Xiaoran, et al.
Pubblicazione: (2024)
di: Fan, Xiaoran, et al.
Pubblicazione: (2024)
Can Visual Encoder Learn to See Arrows?
di: Terashita, Naoyuki, et al.
Pubblicazione: (2025)
di: Terashita, Naoyuki, et al.
Pubblicazione: (2025)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
di: Deng, Ailin, et al.
Pubblicazione: (2024)
di: Deng, Ailin, et al.
Pubblicazione: (2024)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
di: Miranda, Imanol, et al.
Pubblicazione: (2024)
di: Miranda, Imanol, et al.
Pubblicazione: (2024)
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Kiki or Bouba? Sound Symbolism in Vision-and-Language Models
di: Alper, Morris, et al.
Pubblicazione: (2023)
di: Alper, Morris, et al.
Pubblicazione: (2023)
Matryoshka Query Transformer for Large Vision-Language Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
A Survey on Hallucination in Large Vision-Language Models
di: Liu, Hanchao, et al.
Pubblicazione: (2024)
di: Liu, Hanchao, et al.
Pubblicazione: (2024)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
di: Ding, Yi, et al.
Pubblicazione: (2025)
di: Ding, Yi, et al.
Pubblicazione: (2025)
IPO: Interpretable Prompt Optimization for Vision-Language Models
di: Du, Yingjun, et al.
Pubblicazione: (2024)
di: Du, Yingjun, et al.
Pubblicazione: (2024)
Coordinated Robustness Evaluation Framework for Vision-Language Models
di: Babu, Ashwin Ramesh, et al.
Pubblicazione: (2025)
di: Babu, Ashwin Ramesh, et al.
Pubblicazione: (2025)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
di: Lee, Jewon, et al.
Pubblicazione: (2025)
di: Lee, Jewon, et al.
Pubblicazione: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
di: Zang, Yuan, et al.
Pubblicazione: (2024)
di: Zang, Yuan, et al.
Pubblicazione: (2024)
Unifying Specialized Visual Encoders for Video Language Models
di: Chung, Jihoon, et al.
Pubblicazione: (2025)
di: Chung, Jihoon, et al.
Pubblicazione: (2025)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
di: Chen, Yangyi, et al.
Pubblicazione: (2024)
di: Chen, Yangyi, et al.
Pubblicazione: (2024)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
di: Chen, Yang, et al.
Pubblicazione: (2024)
di: Chen, Yang, et al.
Pubblicazione: (2024)
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024)
di: Luo, Grace, et al.
Pubblicazione: (2024)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
di: Zhou, Yiyang, et al.
Pubblicazione: (2023)
di: Zhou, Yiyang, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models
di: Góral, Gracjan, et al.
Pubblicazione: (2025) -
Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024) -
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
di: Li, Sijie, et al.
Pubblicazione: (2026) -
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
di: Lee, Heekyung, et al.
Pubblicazione: (2025) -
Rethinking Misalignment in Vision-Language Model Adaptation from a Causal Perspective
di: Zhang, Yanan, et al.
Pubblicazione: (2024)