Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chung, Jiwan, Lee, Sungjae, Kim, Minseo, Han, Seungju, Yousefpour, Ashkan, Hessel, Jack, Yu, Youngjae |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
VAGUE: Visual Contexts Clarify Ambiguous Expressions
par: Nam, Heejeong, et autres
Publié: (2024)
par: Nam, Heejeong, et autres
Publié: (2024)
KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts
par: Hwang, Taebaek, et autres
Publié: (2025)
par: Hwang, Taebaek, et autres
Publié: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
par: Zhu, Yingjie, et autres
Publié: (2024)
par: Zhu, Yingjie, et autres
Publié: (2024)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
par: Kim, Youngmin, et autres
Publié: (2025)
par: Kim, Youngmin, et autres
Publié: (2025)
Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation
par: Park, Jaewoo, et autres
Publié: (2025)
par: Park, Jaewoo, et autres
Publié: (2025)
Representation Bending for Large Language Model Safety
par: Yousefpour, Ashkan, et autres
Publié: (2025)
par: Yousefpour, Ashkan, et autres
Publié: (2025)
ELITE: Enhanced Language-Image Toxicity Evaluation for Safety
par: Lee, Wonjun, et autres
Publié: (2025)
par: Lee, Wonjun, et autres
Publié: (2025)
Towards Visual Text Design Transfer Across Languages
par: Choi, Yejin, et autres
Publié: (2024)
par: Choi, Yejin, et autres
Publié: (2024)
What MLLMs Learn about When they Learn about Multimodal Reasoning
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
SMILE: Multimodal Dataset for Understanding Laughter in Video with Language Models
par: Hyun, Lee, et autres
Publié: (2023)
par: Hyun, Lee, et autres
Publié: (2023)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
par: Kim, Geewook, et autres
Publié: (2024)
par: Kim, Geewook, et autres
Publié: (2024)
Aligning Large Language Models by On-Policy Self-Judgment
par: Lee, Sangkyu, et autres
Publié: (2024)
par: Lee, Sangkyu, et autres
Publié: (2024)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
par: Wei, Yana, et autres
Publié: (2025)
par: Wei, Yana, et autres
Publié: (2025)
Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
par: Kamath, Amita, et autres
Publié: (2026)
par: Kamath, Amita, et autres
Publié: (2026)
CANVAS: Commonsense-Aware Navigation System for Intuitive Human-Robot Interaction
par: Choi, Suhwan, et autres
Publié: (2024)
par: Choi, Suhwan, et autres
Publié: (2024)
MASS: Overcoming Language Bias in Image-Text Matching
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
BabyVision: Visual Reasoning Beyond Language
par: Chen, Liang, et autres
Publié: (2026)
par: Chen, Liang, et autres
Publié: (2026)
Do Vision-Language Models Understand Visual Persuasiveness?
par: Park, Gyuwon
Publié: (2025)
par: Park, Gyuwon
Publié: (2025)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
par: Lee, Jewon, et autres
Publié: (2025)
par: Lee, Jewon, et autres
Publié: (2025)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
par: Dong, Shuai, et autres
Publié: (2025)
par: Dong, Shuai, et autres
Publié: (2025)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
par: Ma, Yubo, et autres
Publié: (2024)
par: Ma, Yubo, et autres
Publié: (2024)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
par: Nagar, Aishik, et autres
Publié: (2024)
par: Nagar, Aishik, et autres
Publié: (2024)
Do Vision-Language Models Really Understand Visual Language?
par: Hou, Yifan, et autres
Publié: (2024)
par: Hou, Yifan, et autres
Publié: (2024)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
par: Fang, I-Sheng, et autres
Publié: (2025)
par: Fang, I-Sheng, et autres
Publié: (2025)
Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset designed for LLMs with Psychometrics
par: Lee, Seungbeen, et autres
Publié: (2024)
par: Lee, Seungbeen, et autres
Publié: (2024)
Latent Visual Reasoning
par: Li, Bangzheng, et autres
Publié: (2025)
par: Li, Bangzheng, et autres
Publié: (2025)
Deep Learning based Visually Rich Document Content Understanding: A Survey
par: Ding, Yihao, et autres
Publié: (2024)
par: Ding, Yihao, et autres
Publié: (2024)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
par: Tang, Liyan, et autres
Publié: (2025)
par: Tang, Liyan, et autres
Publié: (2025)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
par: Wei, Yanbin, et autres
Publié: (2026)
par: Wei, Yanbin, et autres
Publié: (2026)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
par: Li, Jiaang, et autres
Publié: (2025)
par: Li, Jiaang, et autres
Publié: (2025)
Selective "Selective Prediction": Reducing Unnecessary Abstention in Vision-Language Reasoning
par: Srinivasan, Tejas, et autres
Publié: (2024)
par: Srinivasan, Tejas, et autres
Publié: (2024)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
par: Zhou, Kaiwen, et autres
Publié: (2023)
par: Zhou, Kaiwen, et autres
Publié: (2023)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
par: Imam, Mohamed Fazli, et autres
Publié: (2025)
par: Imam, Mohamed Fazli, et autres
Publié: (2025)
Internalized Reasoning for Long-Context Visual Document Understanding
par: Veselka, Austin
Publié: (2026)
par: Veselka, Austin
Publié: (2026)
GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance
par: Kim, Junhyeok, et autres
Publié: (2025)
par: Kim, Junhyeok, et autres
Publié: (2025)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
par: Zou, Chengke, et autres
Publié: (2024)
par: Zou, Chengke, et autres
Publié: (2024)
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
par: Azadani, Mozhgan Nasr, et autres
Publié: (2025)
par: Azadani, Mozhgan Nasr, et autres
Publié: (2025)
Edited Media Understanding Frames: Reasoning About the Intent and Implications of Visual Misinformation
par: Da, Jeff, et autres
Publié: (2020)
par: Da, Jeff, et autres
Publié: (2020)
TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
par: Fallah, Forouzan, et autres
Publié: (2025)
par: Fallah, Forouzan, et autres
Publié: (2025)
Documents similaires
-
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025) -
VAGUE: Visual Contexts Clarify Ambiguous Expressions
par: Nam, Heejeong, et autres
Publié: (2024) -
KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts
par: Hwang, Taebaek, et autres
Publié: (2025) -
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
par: Zhu, Yingjie, et autres
Publié: (2024) -
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
par: Kim, Youngmin, et autres
Publié: (2025)