MTabVQA: Evaluating Multi-Tabular Reasoning of Language Models in Visual Space
Fuente:
arXiv
Guardado en:
| Autores principales: | Singh, Anshul, Biemann, Chris, Strich, Jan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
por: Wang, Xintong, et al.
Publicado: (2024)
por: Wang, Xintong, et al.
Publicado: (2024)
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
por: Shrestha, Robik, et al.
Publicado: (2020)
por: Shrestha, Robik, et al.
Publicado: (2020)
Belief-Aware VLM Model for Human-like Reasoning
por: Nayak, Anshul, et al.
Publicado: (2026)
por: Nayak, Anshul, et al.
Publicado: (2026)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
por: Zhang, Yan, et al.
Publicado: (2025)
por: Zhang, Yan, et al.
Publicado: (2025)
Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge
por: Xu, Yinsong, et al.
Publicado: (2026)
por: Xu, Yinsong, et al.
Publicado: (2026)
Evaluating the Impact of Post-Training Quantization on Reliable VQA with Multimodal LLMs
por: Kurz, Paul Jonas, et al.
Publicado: (2026)
por: Kurz, Paul Jonas, et al.
Publicado: (2026)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
por: Ma, Jiatong, et al.
Publicado: (2026)
por: Ma, Jiatong, et al.
Publicado: (2026)
Monet: Reasoning in Latent Visual Space Beyond Images and Language
por: Wang, Qixun, et al.
Publicado: (2025)
por: Wang, Qixun, et al.
Publicado: (2025)
R^3-VQA: "Read the Room" by Video Social Reasoning
por: Niu, Lixing, et al.
Publicado: (2025)
por: Niu, Lixing, et al.
Publicado: (2025)
VQA$^2$: Visual Question Answering for Video Quality Assessment
por: Jia, Ziheng, et al.
Publicado: (2024)
por: Jia, Ziheng, et al.
Publicado: (2024)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
por: Kim, Yoonshik, et al.
Publicado: (2025)
por: Kim, Yoonshik, et al.
Publicado: (2025)
From Image to Language: A Critical Analysis of Visual Question Answering (VQA) Approaches, Challenges, and Opportunities
por: Ishmam, Md Farhan, et al.
Publicado: (2023)
por: Ishmam, Md Farhan, et al.
Publicado: (2023)
An Evaluation of GPT-4V and Gemini in Online VQA
por: Liu, Mengchen, et al.
Publicado: (2023)
por: Liu, Mengchen, et al.
Publicado: (2023)
Improving Automatic VQA Evaluation Using Large Language Models
por: Mañas, Oscar, et al.
Publicado: (2023)
por: Mañas, Oscar, et al.
Publicado: (2023)
VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning
por: Jia, Zi-Yi, et al.
Publicado: (2026)
por: Jia, Zi-Yi, et al.
Publicado: (2026)
Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring
por: Vu, Sinh Trong, et al.
Publicado: (2025)
por: Vu, Sinh Trong, et al.
Publicado: (2025)
ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images
por: Zhang, Yunfei, et al.
Publicado: (2025)
por: Zhang, Yunfei, et al.
Publicado: (2025)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
por: Chen, Pingyi, et al.
Publicado: (2024)
por: Chen, Pingyi, et al.
Publicado: (2024)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
por: Xue, Haotian, et al.
Publicado: (2025)
por: Xue, Haotian, et al.
Publicado: (2025)
EncouRAGe: Evaluating RAG Local, Fast, and Reliable
por: Strich, Jan, et al.
Publicado: (2025)
por: Strich, Jan, et al.
Publicado: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
por: Jiang, Yanbei, et al.
Publicado: (2025)
por: Jiang, Yanbei, et al.
Publicado: (2025)
R-LLaVA: Improving Med-VQA Understanding through Visual Region of Interest
por: Chen, Xupeng, et al.
Publicado: (2024)
por: Chen, Xupeng, et al.
Publicado: (2024)
TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains
por: Kim, Yoonsik, et al.
Publicado: (2024)
por: Kim, Yoonsik, et al.
Publicado: (2024)
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
por: Mao, Xianwei, et al.
Publicado: (2026)
por: Mao, Xianwei, et al.
Publicado: (2026)
Evaluating Vision-Language Models on Bistable Images
por: Panagopoulou, Artemis, et al.
Publicado: (2024)
por: Panagopoulou, Artemis, et al.
Publicado: (2024)
Dynamic Orchestration of Multi-Agent System for Real-World Multi-Image Agricultural VQA
por: Ke, Yan, et al.
Publicado: (2025)
por: Ke, Yan, et al.
Publicado: (2025)
Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA
por: Karim, A H M Rezaul, et al.
Publicado: (2025)
por: Karim, A H M Rezaul, et al.
Publicado: (2025)
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
por: Fan, Yue, et al.
Publicado: (2024)
por: Fan, Yue, et al.
Publicado: (2024)
Comprehensive Comparison of RAG Methods Across Multi-Domain Conversational QA
por: Alushi, Klejda, et al.
Publicado: (2026)
por: Alushi, Klejda, et al.
Publicado: (2026)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
por: Li, Zhiyuan, et al.
Publicado: (2024)
por: Li, Zhiyuan, et al.
Publicado: (2024)
Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT
por: Dong, Zhuobai, et al.
Publicado: (2025)
por: Dong, Zhuobai, et al.
Publicado: (2025)
OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
por: Xu, Quanxing, et al.
Publicado: (2025)
por: Xu, Quanxing, et al.
Publicado: (2025)
Lost in Translation and Noise: A Deep Dive into the Failure Modes of VLMs on Real-World Tables
por: Singh, Anshul, et al.
Publicado: (2025)
por: Singh, Anshul, et al.
Publicado: (2025)
PlantVillageVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science
por: Sakib, Syed Nazmus, et al.
Publicado: (2025)
por: Sakib, Syed Nazmus, et al.
Publicado: (2025)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
por: Min, Juhong, et al.
Publicado: (2024)
por: Min, Juhong, et al.
Publicado: (2024)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
por: Chen, Yan, et al.
Publicado: (2025)
por: Chen, Yan, et al.
Publicado: (2025)
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
por: Du, Wanjun, et al.
Publicado: (2026)
por: Du, Wanjun, et al.
Publicado: (2026)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
por: Zhou, Pengfei, et al.
Publicado: (2025)
por: Zhou, Pengfei, et al.
Publicado: (2025)
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
por: Liu, Bo, et al.
Publicado: (2025)
por: Liu, Bo, et al.
Publicado: (2025)
Ejemplares similares
-
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
por: Wang, Xintong, et al.
Publicado: (2024) -
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
por: Shrestha, Robik, et al.
Publicado: (2020) -
Belief-Aware VLM Model for Human-like Reasoning
por: Nayak, Anshul, et al.
Publicado: (2026) -
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
por: Zhang, Yan, et al.
Publicado: (2025) -
Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge
por: Xu, Yinsong, et al.
Publicado: (2026)