VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information
Fuente:
arXiv
Saved in:
| Main Authors: | Kamoi, Ryo, Zhang, Yusen, Das, Sarkar Snigdha Sarathi, Zhang, Ranran Haoran, Zhang, Rui |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Efficient PRM Training Data Synthesis via Formal Verification
by: Kamoi, Ryo, et al.
Published: (2025)
by: Kamoi, Ryo, et al.
Published: (2025)
GReaTer: Gradients over Reasoning Makes Smaller Language Models Strong Prompt Optimizers
by: Das, Sarkar Snigdha Sarathi, et al.
Published: (2024)
by: Das, Sarkar Snigdha Sarathi, et al.
Published: (2024)
Verbosity $\neq$ Veracity: Demystify Verbosity Compensation Behavior of Large Language Models
by: Zhang, Yusen, et al.
Published: (2024)
by: Zhang, Yusen, et al.
Published: (2024)
Evaluating LLMs at Detecting Errors in LLM Responses
by: Kamoi, Ryo, et al.
Published: (2024)
by: Kamoi, Ryo, et al.
Published: (2024)
When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs
by: Kamoi, Ryo, et al.
Published: (2024)
by: Kamoi, Ryo, et al.
Published: (2024)
HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?
by: Zhang, Yusen, et al.
Published: (2025)
by: Zhang, Yusen, et al.
Published: (2025)
GREATERPROMPT: A Unified, Customizable, and High-Performing Open-Source Toolkit for Prompt Optimization
by: Zheng, Wenliang, et al.
Published: (2025)
by: Zheng, Wenliang, et al.
Published: (2025)
Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation
by: Lu, Xiaoxin, et al.
Published: (2025)
by: Lu, Xiaoxin, et al.
Published: (2025)
Coverage-based Fairness in Multi-document Summarization
by: Li, Haoyuan, et al.
Published: (2024)
by: Li, Haoyuan, et al.
Published: (2024)
Can LLMs Rank the Harmfulness of Smaller LLMs? We are Not There Yet
by: Atil, Berk, et al.
Published: (2025)
by: Atil, Berk, et al.
Published: (2025)
Improving Fairness of Large Language Models in Multi-document Summarization
by: Li, Haoyuan, et al.
Published: (2025)
by: Li, Haoyuan, et al.
Published: (2025)
VisEval: A Benchmark for Data Visualization in the Era of Large Language Models
by: Chen, Nan, et al.
Published: (2024)
by: Chen, Nan, et al.
Published: (2024)
Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction
by: Kamoi, Ryo, et al.
Published: (2026)
by: Kamoi, Ryo, et al.
Published: (2026)
GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding
by: Long, Weicai, et al.
Published: (2026)
by: Long, Weicai, et al.
Published: (2026)
Direct-Inverse Prompting: Analyzing LLMs' Discriminative Capacity in Self-Improving Generation
by: Ahn, Jihyun Janice, et al.
Published: (2024)
by: Ahn, Jihyun Janice, et al.
Published: (2024)
VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models
by: Reilly, Dominick, et al.
Published: (2025)
by: Reilly, Dominick, et al.
Published: (2025)
Fair Abstractive Summarization of Diverse Perspectives
by: Zhang, Yusen, et al.
Published: (2023)
by: Zhang, Yusen, et al.
Published: (2023)
AMO-Bench: Large Language Models Still Struggle in High School Math Competitions
by: An, Shengnan, et al.
Published: (2025)
by: An, Shengnan, et al.
Published: (2025)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
by: Zhang, Juntian, et al.
Published: (2025)
by: Zhang, Juntian, et al.
Published: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
by: Wang, Yanling, et al.
Published: (2025)
by: Wang, Yanling, et al.
Published: (2025)
MisVisFix: An Interactive Dashboard for Detecting, Explaining, and Correcting Misleading Visualizations using Large Language Models
by: Das, Amit Kumar, et al.
Published: (2025)
by: Das, Amit Kumar, et al.
Published: (2025)
Nexus : An Agentic Framework for Time Series Forecasting
by: Das, Sarkar Snigdha Sarathi, et al.
Published: (2026)
by: Das, Sarkar Snigdha Sarathi, et al.
Published: (2026)
Language Models Still Struggle to Zero-shot Reason about Time Series
by: Merrill, Mike A., et al.
Published: (2024)
by: Merrill, Mike A., et al.
Published: (2024)
LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks
by: Kong, Fei, et al.
Published: (2025)
by: Kong, Fei, et al.
Published: (2025)
Prompt4Vis: Prompting Large Language Models with Example Mining and Schema Filtering for Tabular Data Visualization
by: Li, Shuaimin, et al.
Published: (2024)
by: Li, Shuaimin, et al.
Published: (2024)
ChatVis: Automating Scientific Visualization with a Large Language Model
by: Mallick, Tanwi, et al.
Published: (2024)
by: Mallick, Tanwi, et al.
Published: (2024)
Chain of Agents: Large Language Models Collaborating on Long-Context Tasks
by: Zhang, Yusen, et al.
Published: (2024)
by: Zhang, Yusen, et al.
Published: (2024)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
by: Huang, Jen-tse, et al.
Published: (2025)
by: Huang, Jen-tse, et al.
Published: (2025)
VisMin: Visual Minimal-Change Understanding
by: Awal, Rabiul, et al.
Published: (2024)
by: Awal, Rabiul, et al.
Published: (2024)
VisMoDAl: Visual Analytics for Evaluating and Improving Corruption Robustness of Vision-Language Models
by: Wang, Huanchen, et al.
Published: (2025)
by: Wang, Huanchen, et al.
Published: (2025)
The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors
by: Lucy, Li, et al.
Published: (2026)
by: Lucy, Li, et al.
Published: (2026)
VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
by: Yu, Xinlei, et al.
Published: (2025)
by: Yu, Xinlei, et al.
Published: (2025)
VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan
by: Tam, Zhi Rui, et al.
Published: (2025)
by: Tam, Zhi Rui, et al.
Published: (2025)
Large Language Models Still Face Challenges in Multi-Hop Reasoning with External Knowledge
by: Zhang, Haotong
Published: (2024)
by: Zhang, Haotong
Published: (2024)
ChatVis: Large Language Model Agent for Generating Scientific Visualizations
by: Peterka, Tom, et al.
Published: (2025)
by: Peterka, Tom, et al.
Published: (2025)
VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations
by: Xie, Yupeng, et al.
Published: (2025)
by: Xie, Yupeng, et al.
Published: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
by: Zhang, Ce, et al.
Published: (2025)
by: Zhang, Ce, et al.
Published: (2025)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
by: Zhu, Zifeng, et al.
Published: (2024)
by: Zhu, Zifeng, et al.
Published: (2024)
Large Language Models Struggle with Unreasonability in Math Problems
by: Ma, Jingyuan, et al.
Published: (2024)
by: Ma, Jingyuan, et al.
Published: (2024)
VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation
by: Suri, Manan, et al.
Published: (2024)
by: Suri, Manan, et al.
Published: (2024)
Similar Items
-
Efficient PRM Training Data Synthesis via Formal Verification
by: Kamoi, Ryo, et al.
Published: (2025) -
GReaTer: Gradients over Reasoning Makes Smaller Language Models Strong Prompt Optimizers
by: Das, Sarkar Snigdha Sarathi, et al.
Published: (2024) -
Verbosity $\neq$ Veracity: Demystify Verbosity Compensation Behavior of Large Language Models
by: Zhang, Yusen, et al.
Published: (2024) -
Evaluating LLMs at Detecting Errors in LLM Responses
by: Kamoi, Ryo, et al.
Published: (2024) -
When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs
by: Kamoi, Ryo, et al.
Published: (2024)