RealCQA-V2: A Diagnostic Benchmark for Structured Visual Entailment over Scientific Charts
Fuente:
arXiv
Saved in:
| Main Authors: | Ahmed, Saleem, Setlur, Srirangaraj, Govindaraju, Venu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
InterventionLens: A Multi-Agent Framework for Detecting ASD Intervention Strategies in Parent-Child Shared Reading
by: Wang, Xiao, et al.
Published: (2026)
by: Wang, Xiao, et al.
Published: (2026)
LLM Augmented Intervenable Multimodal Adaptor for Post-operative Complication Prediction in Lung Cancer Surgery
by: Pandey, Shubham, et al.
Published: (2026)
by: Pandey, Shubham, et al.
Published: (2026)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
by: Fedorishin, Dennis, et al.
Published: (2024)
by: Fedorishin, Dennis, et al.
Published: (2024)
AutoMisty: A Multi-Agent LLM Framework for Automated Code Generation in the Misty Social Robot
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
Ridgeformer: Mutli-Stage Contrastive Training For Fine-grained Cross-Domain Fingerprint Recognition
by: Pandey, Shubham, et al.
Published: (2025)
by: Pandey, Shubham, et al.
Published: (2025)
Ig3D: Integrating 3D Face Representations in Facial Expression Inference
by: Dong, Lu, et al.
Published: (2024)
by: Dong, Lu, et al.
Published: (2024)
ConfusionBench: An Expert-Validated Benchmark for Confusion Recognition and Localization in Educational Videos
by: Dong, Lu, et al.
Published: (2026)
by: Dong, Lu, et al.
Published: (2026)
Fine-Grained Engine Fault Sound Event Detection Using Multimodal Signals
by: Fedorishin, Dennis, et al.
Published: (2024)
by: Fedorishin, Dennis, et al.
Published: (2024)
SCOT: Self-Supervised Contrastive Pretraining For Zero-Shot Compositional Retrieval
by: Jawade, Bhavin, et al.
Published: (2025)
by: Jawade, Bhavin, et al.
Published: (2025)
MistyPilot: An Agentic Fast-Slow Thinking LLM Framework for Misty Social Robots
by: Wang, Xiao, et al.
Published: (2026)
by: Wang, Xiao, et al.
Published: (2026)
Defeasible Visual Entailment: Benchmark, Evaluator, and Reward-Driven Optimization
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language
by: Jamali, Naghmeh, et al.
Published: (2025)
by: Jamali, Naghmeh, et al.
Published: (2025)
Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics
by: Palani, Srishti, et al.
Published: (2026)
by: Palani, Srishti, et al.
Published: (2026)
ChartDiff: A Large-Scale Benchmark for Comprehending Pairs of Charts
by: Ye, Rongtian
Published: (2026)
by: Ye, Rongtian
Published: (2026)
Chart-HQA: A Benchmark for Hypothetical Question Answering in Charts
by: Chen, Xiangnan, et al.
Published: (2025)
by: Chen, Xiangnan, et al.
Published: (2025)
ChartAnchor: Chart Grounding with Structural-Semantic Fidelity
by: Li, Xinhang, et al.
Published: (2025)
by: Li, Xinhang, et al.
Published: (2025)
ChartGemma: Visual Instruction-tuning for Chart Reasoning in the Wild
by: Masry, Ahmed, et al.
Published: (2024)
by: Masry, Ahmed, et al.
Published: (2024)
CQA-Eval: Designing Reliable Evaluations of Multi-paragraph Clinical QA under Resource Constraints
by: Bologna, Federica, et al.
Published: (2025)
by: Bologna, Federica, et al.
Published: (2025)
Understanding Figurative Meaning through Explainable Visual Entailment
by: Saakyan, Arkadiy, et al.
Published: (2024)
by: Saakyan, Arkadiy, et al.
Published: (2024)
Entailment-Driven Privacy Policy Classification with LLMs
by: Silva, Bhanuka, et al.
Published: (2024)
by: Silva, Bhanuka, et al.
Published: (2024)
AbsPyramid: Benchmarking the Abstraction Ability of Language Models with a Unified Entailment Graph
by: Wang, Zhaowei, et al.
Published: (2023)
by: Wang, Zhaowei, et al.
Published: (2023)
VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment
by: Saravanan, Darshana, et al.
Published: (2024)
by: Saravanan, Darshana, et al.
Published: (2024)
Real-Time Fusion of Visual and Chart Data for Enhanced Maritime Vision
by: Kreis, Marten, et al.
Published: (2025)
by: Kreis, Marten, et al.
Published: (2025)
CHARTOM: A Visual Theory-of-Mind Benchmark for LLMs on Misleading Charts
by: Bharti, Shubham, et al.
Published: (2024)
by: Bharti, Shubham, et al.
Published: (2024)
WikiMixQA: A Multimodal Benchmark for Question Answering over Tables and Charts
by: Foroutan, Negar, et al.
Published: (2025)
by: Foroutan, Negar, et al.
Published: (2025)
SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images
by: Shen, Jialu, et al.
Published: (2026)
by: Shen, Jialu, et al.
Published: (2026)
Probing Vision-Language Understanding through the Visual Entailment Task: promises and pitfalls
by: Pitta, Elena, et al.
Published: (2025)
by: Pitta, Elena, et al.
Published: (2025)
ChartM$^3$: Benchmarking Chart Editing with Multimodal Instructions
by: Yang, Donglu, et al.
Published: (2025)
by: Yang, Donglu, et al.
Published: (2025)
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
by: Chen, Zixin, et al.
Published: (2025)
by: Chen, Zixin, et al.
Published: (2025)
ChartCitor: Multi-Agent Framework for Fine-Grained Chart Visual Attribution
by: Goswami, Kanika, et al.
Published: (2025)
by: Goswami, Kanika, et al.
Published: (2025)
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
by: Xie, Tianchi, et al.
Published: (2025)
by: Xie, Tianchi, et al.
Published: (2025)
Reframing Tax Law Entailment as Analogical Reasoning
by: Zou, Xinrui, et al.
Published: (2024)
by: Zou, Xinrui, et al.
Published: (2024)
Adversarial Attacks and Defense for Conversation Entailment Task
by: Yang, Zhenning, et al.
Published: (2024)
by: Yang, Zhenning, et al.
Published: (2024)
SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code
by: Imani, Shima, et al.
Published: (2025)
by: Imani, Shima, et al.
Published: (2025)
Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models
by: Bai, Yunfei, et al.
Published: (2026)
by: Bai, Yunfei, et al.
Published: (2026)
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
by: Zhang, Situo, et al.
Published: (2026)
by: Zhang, Situo, et al.
Published: (2026)
From Charts to Code: A Hierarchical Benchmark for Multimodal Models
by: Tang, Jiahao, et al.
Published: (2025)
by: Tang, Jiahao, et al.
Published: (2025)
Enhancing Transformers for Generalizable First-Order Logical Entailment
by: Zheng, Tianshi, et al.
Published: (2025)
by: Zheng, Tianshi, et al.
Published: (2025)
PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation
by: Imani, Shima, et al.
Published: (2025)
by: Imani, Shima, et al.
Published: (2025)
WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios
by: Chang, Eun, et al.
Published: (2025)
by: Chang, Eun, et al.
Published: (2025)
Similar Items
-
InterventionLens: A Multi-Agent Framework for Detecting ASD Intervention Strategies in Parent-Child Shared Reading
by: Wang, Xiao, et al.
Published: (2026) -
LLM Augmented Intervenable Multimodal Adaptor for Post-operative Complication Prediction in Lung Cancer Surgery
by: Pandey, Shubham, et al.
Published: (2026) -
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
by: Fedorishin, Dennis, et al.
Published: (2024) -
AutoMisty: A Multi-Agent LLM Framework for Automated Code Generation in the Misty Social Robot
by: Wang, Xiao, et al.
Published: (2025) -
Ridgeformer: Mutli-Stage Contrastive Training For Fine-grained Cross-Domain Fingerprint Recognition
by: Pandey, Shubham, et al.
Published: (2025)