Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Nagar, Aishik, Jaiswal, Shantanu, Tan, Cheston |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Learning to Reason Iteratively and Parallelly for Complex Visual Reasoning Scenarios
von: Jaiswal, Shantanu, et al.
Veröffentlicht: (2024)
von: Jaiswal, Shantanu, et al.
Veröffentlicht: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
von: Prasad, Archiki, et al.
Veröffentlicht: (2023)
von: Prasad, Archiki, et al.
Veröffentlicht: (2023)
Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study
von: Wang, Chenguang, et al.
Veröffentlicht: (2024)
von: Wang, Chenguang, et al.
Veröffentlicht: (2024)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
von: Zeng, Yu, et al.
Veröffentlicht: (2026)
von: Zeng, Yu, et al.
Veröffentlicht: (2026)
Commonsense for Zero-Shot Natural Language Video Localization
von: Holla, Meghana, et al.
Veröffentlicht: (2023)
von: Holla, Meghana, et al.
Veröffentlicht: (2023)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
von: Bae, Jiyun, et al.
Veröffentlicht: (2025)
von: Bae, Jiyun, et al.
Veröffentlicht: (2025)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
von: Agarwal, Sakshi, et al.
Veröffentlicht: (2026)
von: Agarwal, Sakshi, et al.
Veröffentlicht: (2026)
Visual Language Models as Zero-Shot Deepfake Detectors
von: Pirogov, Viacheslav
Veröffentlicht: (2025)
von: Pirogov, Viacheslav
Veröffentlicht: (2025)
Zero-Shot Refinement of Buildings' Segmentation Models using SAM
von: Mayladan, Ali, et al.
Veröffentlicht: (2023)
von: Mayladan, Ali, et al.
Veröffentlicht: (2023)
MouSi: Poly-Visual-Expert Vision-Language Models
von: Fan, Xiaoran, et al.
Veröffentlicht: (2024)
von: Fan, Xiaoran, et al.
Veröffentlicht: (2024)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
von: Nguyen, Phu-Vinh, et al.
Veröffentlicht: (2025)
von: Nguyen, Phu-Vinh, et al.
Veröffentlicht: (2025)
VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
von: Ma, Jingkun, et al.
Veröffentlicht: (2024)
von: Ma, Jingkun, et al.
Veröffentlicht: (2024)
Vision-Language Models Can Self-Improve Reasoning via Reflection
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024)
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
von: Villegas, Danae Sánchez, et al.
Veröffentlicht: (2026)
von: Villegas, Danae Sánchez, et al.
Veröffentlicht: (2026)
Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion
von: Rawal, Ishaan Singh, et al.
Veröffentlicht: (2023)
von: Rawal, Ishaan Singh, et al.
Veröffentlicht: (2023)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
von: Lee, Jewon, et al.
Veröffentlicht: (2025)
von: Lee, Jewon, et al.
Veröffentlicht: (2025)
LLMs are not Zero-Shot Reasoners for Biomedical Information Extraction
von: Nagar, Aishik, et al.
Veröffentlicht: (2024)
von: Nagar, Aishik, et al.
Veröffentlicht: (2024)
LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
von: Xiao, Yijia, et al.
Veröffentlicht: (2024)
von: Xiao, Yijia, et al.
Veröffentlicht: (2024)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
von: Huang, Wenxuan, et al.
Veröffentlicht: (2025)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
von: Lagos, Maximiliano Hormazábal, et al.
Veröffentlicht: (2025)
von: Lagos, Maximiliano Hormazábal, et al.
Veröffentlicht: (2025)
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
von: Li, Bangzheng, et al.
Veröffentlicht: (2025)
von: Li, Bangzheng, et al.
Veröffentlicht: (2025)
Fusing Domain-Specific Content from Large Language Models into Knowledge Graphs for Enhanced Zero Shot Object State Classification
von: Gouidis, Filippos, et al.
Veröffentlicht: (2024)
von: Gouidis, Filippos, et al.
Veröffentlicht: (2024)
Zero-Shot Vehicle Model Recognition via Text-Based Retrieval-Augmented Generation
von: Chang, Wei-Chia, et al.
Veröffentlicht: (2025)
von: Chang, Wei-Chia, et al.
Veröffentlicht: (2025)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
von: Guo, Danfeng, et al.
Veröffentlicht: (2024)
von: Guo, Danfeng, et al.
Veröffentlicht: (2024)
ReadBench: Measuring the Dense Text Visual Reading Ability of Vision-Language Models
von: Clavié, Benjamin, et al.
Veröffentlicht: (2025)
von: Clavié, Benjamin, et al.
Veröffentlicht: (2025)
Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images
von: Wu, Shengguang, et al.
Veröffentlicht: (2025)
von: Wu, Shengguang, et al.
Veröffentlicht: (2025)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition
von: Tan, Yuwen, et al.
Veröffentlicht: (2025)
von: Tan, Yuwen, et al.
Veröffentlicht: (2025)
Situational Awareness Matters in 3D Vision Language Reasoning
von: Man, Yunze, et al.
Veröffentlicht: (2024)
von: Man, Yunze, et al.
Veröffentlicht: (2024)
GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks
von: Kang, Haoqiang, et al.
Veröffentlicht: (2025)
von: Kang, Haoqiang, et al.
Veröffentlicht: (2025)
MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models
von: Kim, Soo Yong, et al.
Veröffentlicht: (2025)
von: Kim, Soo Yong, et al.
Veröffentlicht: (2025)
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
von: Lian, Shijie, et al.
Veröffentlicht: (2025)
von: Lian, Shijie, et al.
Veröffentlicht: (2025)
AutoCLIP: Auto-tuning Zero-Shot Classifiers for Vision-Language Models
von: Metzen, Jan Hendrik, et al.
Veröffentlicht: (2023)
von: Metzen, Jan Hendrik, et al.
Veröffentlicht: (2023)
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
von: Wu, Junfei, et al.
Veröffentlicht: (2024)
von: Wu, Junfei, et al.
Veröffentlicht: (2024)
Efficient Benchmarking of Language Models
von: Perlitz, Yotam, et al.
Veröffentlicht: (2023)
von: Perlitz, Yotam, et al.
Veröffentlicht: (2023)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
von: Sinha, Neelabh, et al.
Veröffentlicht: (2024)
von: Sinha, Neelabh, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Learning to Reason Iteratively and Parallelly for Complex Visual Reasoning Scenarios
von: Jaiswal, Shantanu, et al.
Veröffentlicht: (2024) -
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
von: Prasad, Archiki, et al.
Veröffentlicht: (2023) -
Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study
von: Wang, Chenguang, et al.
Veröffentlicht: (2024) -
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
von: Zang, Yuan, et al.
Veröffentlicht: (2024) -
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
von: Zeng, Yu, et al.
Veröffentlicht: (2026)