Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles
Fuente:
arXiv
Salvato in:
| Autori principali: | Lymperaiou, Maria, Karampinis, Vasileios, Filandrianos, Giorgos, Vlachos, Angelos, Zerva, Chrysoula, Voulodimos, Athanasios |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning
di: Vlachos, Angelos, et al.
Pubblicazione: (2025)
di: Vlachos, Angelos, et al.
Pubblicazione: (2025)
HalCECE: A Framework for Explainable Hallucination Detection through Conceptual Counterfactuals in Image Captioning
di: Lymperaiou, Maria, et al.
Pubblicazione: (2025)
di: Lymperaiou, Maria, et al.
Pubblicazione: (2025)
V-CECE: Visual Counterfactual Explanations via Conceptual Edits
di: Spanos, Nikolaos, et al.
Pubblicazione: (2025)
di: Spanos, Nikolaos, et al.
Pubblicazione: (2025)
Fast Post-Hoc Confidence Fusion for 3-Class Open-Set Aerial Object Detection
di: Loukovitis, Spyridon, et al.
Pubblicazione: (2025)
di: Loukovitis, Spyridon, et al.
Pubblicazione: (2025)
Model-Agnostic Open-Set Air-to-Air Visual Object Detection for Reliable UAV Perception
di: Loukovitis, Spyridon, et al.
Pubblicazione: (2025)
di: Loukovitis, Spyridon, et al.
Pubblicazione: (2025)
Automatic Generation of Fashion Images using Prompting in Generative Machine Learning Models
di: Argyrou, Georgia, et al.
Pubblicazione: (2024)
di: Argyrou, Georgia, et al.
Pubblicazione: (2024)
Counterfactual Edits for Generative Evaluation
di: Lymperaiou, Maria, et al.
Pubblicazione: (2023)
di: Lymperaiou, Maria, et al.
Pubblicazione: (2023)
Masked Generative Story Transformer with Character Guidance and Caption Augmentation
di: Papadimitriou, Christos, et al.
Pubblicazione: (2024)
di: Papadimitriou, Christos, et al.
Pubblicazione: (2024)
Common Corruptions for Enhancing and Evaluating Robustness in Air-to-Air Visual Object Detection
di: Arsenos, Anastasios, et al.
Pubblicazione: (2024)
di: Arsenos, Anastasios, et al.
Pubblicazione: (2024)
Prompt2Fashion: An automatically generated fashion dataset
di: Argyrou, Georgia, et al.
Pubblicazione: (2024)
di: Argyrou, Georgia, et al.
Pubblicazione: (2024)
Pitfalls of Scale: Investigating the Inverse Task of Redefinition in Large Language Models
di: Stringli, Elena, et al.
Pubblicazione: (2025)
di: Stringli, Elena, et al.
Pubblicazione: (2025)
Structure Your Data: Towards Semantic Graph Counterfactuals
di: Dimitriou, Angeliki, et al.
Pubblicazione: (2024)
di: Dimitriou, Angeliki, et al.
Pubblicazione: (2024)
U-CECE: A Universal Multi-Resolution Framework for Conceptual Counterfactual Explanations
di: Dimitriou, Angeliki, et al.
Pubblicazione: (2026)
di: Dimitriou, Angeliki, et al.
Pubblicazione: (2026)
ARPA: A Novel Hybrid Model for Advancing Visual Word Disambiguation Using Large Language Models and Transformers
di: Papastavrou, Aristi, et al.
Pubblicazione: (2024)
di: Papastavrou, Aristi, et al.
Pubblicazione: (2024)
Explaining Vision GNNs: A Semantic and Visual Analysis of Graph-based Image Classification
di: Chaidos, Nikolaos, et al.
Pubblicazione: (2025)
di: Chaidos, Nikolaos, et al.
Pubblicazione: (2025)
Puzzle Solving using Reasoning of Large Language Models: A Survey
di: Giadikiaroglou, Panagiotis, et al.
Pubblicazione: (2024)
di: Giadikiaroglou, Panagiotis, et al.
Pubblicazione: (2024)
Ensuring UAV Safety: A Vision-only and Real-time Framework for Collision Avoidance Through Object Detection, Tracking, and Distance Estimation
di: Karampinis, Vasileios, et al.
Pubblicazione: (2024)
di: Karampinis, Vasileios, et al.
Pubblicazione: (2024)
SemEval-2026 Task 6: CLARITY -- Unmasking Political Question Evasions
di: Thomas, Konstantinos, et al.
Pubblicazione: (2026)
di: Thomas, Konstantinos, et al.
Pubblicazione: (2026)
"I Never Said That": A dataset, taxonomy and baselines on response clarity classification
di: Thomas, Konstantinos, et al.
Pubblicazione: (2024)
di: Thomas, Konstantinos, et al.
Pubblicazione: (2024)
AILS-NTUA at SemEval-2026 Task 12: Graph-Based Retrieval and Reflective Prompting for Abductive Event Reasoning
di: Karafyllis, Nikolas, et al.
Pubblicazione: (2026)
di: Karafyllis, Nikolas, et al.
Pubblicazione: (2026)
AILS-NTUA at SemEval-2025 Task 8: Language-to-Code prompting and Error Fixing for Tabular Question Answering
di: Evangelatos, Andreas, et al.
Pubblicazione: (2025)
di: Evangelatos, Andreas, et al.
Pubblicazione: (2025)
CrossFlowDG: Bridging the Modality Gap with Cross-modal Flow Matching for Domain Generalization
di: Kritikos, Antonios, et al.
Pubblicazione: (2026)
di: Kritikos, Antonios, et al.
Pubblicazione: (2026)
AILS-NTUA at SemEval-2025 Task 3: Leveraging Large Language Models and Translation Strategies for Multilingual Hallucination Detection
di: Karkani, Dimitra, et al.
Pubblicazione: (2025)
di: Karkani, Dimitra, et al.
Pubblicazione: (2025)
AILS-NTUA at SemEval-2026 Task 8: Evaluating Multi-Turn RAG Conversations
di: Athanasiou, Dimosthenis, et al.
Pubblicazione: (2026)
di: Athanasiou, Dimosthenis, et al.
Pubblicazione: (2026)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
di: Ren, Yufan, et al.
Pubblicazione: (2025)
di: Ren, Yufan, et al.
Pubblicazione: (2025)
AILS-NTUA at SemEval-2025 Task 4: Parameter-Efficient Unlearning for Large Language Models using Data Chunking
di: Premptis, Iraklis, et al.
Pubblicazione: (2025)
di: Premptis, Iraklis, et al.
Pubblicazione: (2025)
A Conformal Risk Control Framework for Granular Word Assessment and Uncertainty Calibration of CLIPScore Quality Estimates
di: Gomes, Gonçalo, et al.
Pubblicazione: (2025)
di: Gomes, Gonçalo, et al.
Pubblicazione: (2025)
The Contribution of Knowledge in Visiolinguistic Learning: A Survey on Tasks and Challenges
di: Lymperaiou, Maria, et al.
Pubblicazione: (2023)
di: Lymperaiou, Maria, et al.
Pubblicazione: (2023)
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
SCENIR: Visual Semantic Clarity through Unsupervised Scene Graph Retrieval
di: Chaidos, Nikolaos, et al.
Pubblicazione: (2025)
di: Chaidos, Nikolaos, et al.
Pubblicazione: (2025)
AILS-NTUA at SemEval-2026 Task 10: Agentic LLMs for Psycholinguistic Marker Extraction and Conspiracy Endorsement Detection
di: Spanakis, Panagiotis Alexios, et al.
Pubblicazione: (2026)
di: Spanakis, Panagiotis Alexios, et al.
Pubblicazione: (2026)
Fine-Grained ImageNet Classification in the Wild
di: Lymperaiou, Maria, et al.
Pubblicazione: (2023)
di: Lymperaiou, Maria, et al.
Pubblicazione: (2023)
AILS-NTUA at SemEval-2026 Task 3: Efficient Dimensional Aspect-Based Sentiment Analysis
di: Gazetas, Stavros, et al.
Pubblicazione: (2026)
di: Gazetas, Stavros, et al.
Pubblicazione: (2026)
SD-MVSum: Script-Driven Multimodal Video Summarization Method and Datasets
di: Mylonas, Manolis, et al.
Pubblicazione: (2025)
di: Mylonas, Manolis, et al.
Pubblicazione: (2025)
AILS-NTUA at SemEval-2024 Task 9: Cracking Brain Teasers: Transformer Models for Lateral Thinking Puzzles
di: Panagiotopoulos, Ioannis, et al.
Pubblicazione: (2024)
di: Panagiotopoulos, Ioannis, et al.
Pubblicazione: (2024)
Evaluating Counterfactual Strategic Reasoning in Large Language Models
di: Georgousis, Dimitrios, et al.
Pubblicazione: (2026)
di: Georgousis, Dimitrios, et al.
Pubblicazione: (2026)
U-Sketch: An Efficient Approach for Sketch to Image Diffusion Models
di: Mitsouras, Ilias, et al.
Pubblicazione: (2024)
di: Mitsouras, Ilias, et al.
Pubblicazione: (2024)
Probing Conceptual Understanding of Large Visual-Language Models
di: Schiappa, Madeline, et al.
Pubblicazione: (2023)
di: Schiappa, Madeline, et al.
Pubblicazione: (2023)
A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
di: Ye, Weixin, et al.
Pubblicazione: (2026)
di: Ye, Weixin, et al.
Pubblicazione: (2026)
Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning
di: Ghosal, Deepanway, et al.
Pubblicazione: (2024)
di: Ghosal, Deepanway, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning
di: Vlachos, Angelos, et al.
Pubblicazione: (2025) -
HalCECE: A Framework for Explainable Hallucination Detection through Conceptual Counterfactuals in Image Captioning
di: Lymperaiou, Maria, et al.
Pubblicazione: (2025) -
V-CECE: Visual Counterfactual Explanations via Conceptual Edits
di: Spanos, Nikolaos, et al.
Pubblicazione: (2025) -
Fast Post-Hoc Confidence Fusion for 3-Class Open-Set Aerial Object Detection
di: Loukovitis, Spyridon, et al.
Pubblicazione: (2025) -
Model-Agnostic Open-Set Air-to-Air Visual Object Detection for Reliable UAV Perception
di: Loukovitis, Spyridon, et al.
Pubblicazione: (2025)