VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information
Fuente:
arXiv
Guardado en:
| Autores principales: | Kamoi, Ryo, Zhang, Yusen, Das, Sarkar Snigdha Sarathi, Zhang, Ranran Haoran, Zhang, Rui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient PRM Training Data Synthesis via Formal Verification
por: Kamoi, Ryo, et al.
Publicado: (2025)
por: Kamoi, Ryo, et al.
Publicado: (2025)
GReaTer: Gradients over Reasoning Makes Smaller Language Models Strong Prompt Optimizers
por: Das, Sarkar Snigdha Sarathi, et al.
Publicado: (2024)
por: Das, Sarkar Snigdha Sarathi, et al.
Publicado: (2024)
Verbosity $\neq$ Veracity: Demystify Verbosity Compensation Behavior of Large Language Models
por: Zhang, Yusen, et al.
Publicado: (2024)
por: Zhang, Yusen, et al.
Publicado: (2024)
Evaluating LLMs at Detecting Errors in LLM Responses
por: Kamoi, Ryo, et al.
Publicado: (2024)
por: Kamoi, Ryo, et al.
Publicado: (2024)
When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs
por: Kamoi, Ryo, et al.
Publicado: (2024)
por: Kamoi, Ryo, et al.
Publicado: (2024)
HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?
por: Zhang, Yusen, et al.
Publicado: (2025)
por: Zhang, Yusen, et al.
Publicado: (2025)
GREATERPROMPT: A Unified, Customizable, and High-Performing Open-Source Toolkit for Prompt Optimization
por: Zheng, Wenliang, et al.
Publicado: (2025)
por: Zheng, Wenliang, et al.
Publicado: (2025)
Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation
por: Lu, Xiaoxin, et al.
Publicado: (2025)
por: Lu, Xiaoxin, et al.
Publicado: (2025)
Coverage-based Fairness in Multi-document Summarization
por: Li, Haoyuan, et al.
Publicado: (2024)
por: Li, Haoyuan, et al.
Publicado: (2024)
Can LLMs Rank the Harmfulness of Smaller LLMs? We are Not There Yet
por: Atil, Berk, et al.
Publicado: (2025)
por: Atil, Berk, et al.
Publicado: (2025)
Improving Fairness of Large Language Models in Multi-document Summarization
por: Li, Haoyuan, et al.
Publicado: (2025)
por: Li, Haoyuan, et al.
Publicado: (2025)
VisEval: A Benchmark for Data Visualization in the Era of Large Language Models
por: Chen, Nan, et al.
Publicado: (2024)
por: Chen, Nan, et al.
Publicado: (2024)
Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction
por: Kamoi, Ryo, et al.
Publicado: (2026)
por: Kamoi, Ryo, et al.
Publicado: (2026)
GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding
por: Long, Weicai, et al.
Publicado: (2026)
por: Long, Weicai, et al.
Publicado: (2026)
Direct-Inverse Prompting: Analyzing LLMs' Discriminative Capacity in Self-Improving Generation
por: Ahn, Jihyun Janice, et al.
Publicado: (2024)
por: Ahn, Jihyun Janice, et al.
Publicado: (2024)
VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models
por: Reilly, Dominick, et al.
Publicado: (2025)
por: Reilly, Dominick, et al.
Publicado: (2025)
Fair Abstractive Summarization of Diverse Perspectives
por: Zhang, Yusen, et al.
Publicado: (2023)
por: Zhang, Yusen, et al.
Publicado: (2023)
AMO-Bench: Large Language Models Still Struggle in High School Math Competitions
por: An, Shengnan, et al.
Publicado: (2025)
por: An, Shengnan, et al.
Publicado: (2025)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
por: Zhang, Juntian, et al.
Publicado: (2025)
por: Zhang, Juntian, et al.
Publicado: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
por: Wang, Yanling, et al.
Publicado: (2025)
por: Wang, Yanling, et al.
Publicado: (2025)
MisVisFix: An Interactive Dashboard for Detecting, Explaining, and Correcting Misleading Visualizations using Large Language Models
por: Das, Amit Kumar, et al.
Publicado: (2025)
por: Das, Amit Kumar, et al.
Publicado: (2025)
Nexus : An Agentic Framework for Time Series Forecasting
por: Das, Sarkar Snigdha Sarathi, et al.
Publicado: (2026)
por: Das, Sarkar Snigdha Sarathi, et al.
Publicado: (2026)
Language Models Still Struggle to Zero-shot Reason about Time Series
por: Merrill, Mike A., et al.
Publicado: (2024)
por: Merrill, Mike A., et al.
Publicado: (2024)
LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks
por: Kong, Fei, et al.
Publicado: (2025)
por: Kong, Fei, et al.
Publicado: (2025)
Prompt4Vis: Prompting Large Language Models with Example Mining and Schema Filtering for Tabular Data Visualization
por: Li, Shuaimin, et al.
Publicado: (2024)
por: Li, Shuaimin, et al.
Publicado: (2024)
ChatVis: Automating Scientific Visualization with a Large Language Model
por: Mallick, Tanwi, et al.
Publicado: (2024)
por: Mallick, Tanwi, et al.
Publicado: (2024)
Chain of Agents: Large Language Models Collaborating on Long-Context Tasks
por: Zhang, Yusen, et al.
Publicado: (2024)
por: Zhang, Yusen, et al.
Publicado: (2024)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
por: Huang, Jen-tse, et al.
Publicado: (2025)
por: Huang, Jen-tse, et al.
Publicado: (2025)
VisMin: Visual Minimal-Change Understanding
por: Awal, Rabiul, et al.
Publicado: (2024)
por: Awal, Rabiul, et al.
Publicado: (2024)
VisMoDAl: Visual Analytics for Evaluating and Improving Corruption Robustness of Vision-Language Models
por: Wang, Huanchen, et al.
Publicado: (2025)
por: Wang, Huanchen, et al.
Publicado: (2025)
The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors
por: Lucy, Li, et al.
Publicado: (2026)
por: Lucy, Li, et al.
Publicado: (2026)
VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
por: Yu, Xinlei, et al.
Publicado: (2025)
por: Yu, Xinlei, et al.
Publicado: (2025)
VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan
por: Tam, Zhi Rui, et al.
Publicado: (2025)
por: Tam, Zhi Rui, et al.
Publicado: (2025)
Large Language Models Still Face Challenges in Multi-Hop Reasoning with External Knowledge
por: Zhang, Haotong
Publicado: (2024)
por: Zhang, Haotong
Publicado: (2024)
ChatVis: Large Language Model Agent for Generating Scientific Visualizations
por: Peterka, Tom, et al.
Publicado: (2025)
por: Peterka, Tom, et al.
Publicado: (2025)
VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations
por: Xie, Yupeng, et al.
Publicado: (2025)
por: Xie, Yupeng, et al.
Publicado: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
por: Zhang, Ce, et al.
Publicado: (2025)
por: Zhang, Ce, et al.
Publicado: (2025)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
por: Zhu, Zifeng, et al.
Publicado: (2024)
por: Zhu, Zifeng, et al.
Publicado: (2024)
Large Language Models Struggle with Unreasonability in Math Problems
por: Ma, Jingyuan, et al.
Publicado: (2024)
por: Ma, Jingyuan, et al.
Publicado: (2024)
VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation
por: Suri, Manan, et al.
Publicado: (2024)
por: Suri, Manan, et al.
Publicado: (2024)
Ejemplares similares
-
Efficient PRM Training Data Synthesis via Formal Verification
por: Kamoi, Ryo, et al.
Publicado: (2025) -
GReaTer: Gradients over Reasoning Makes Smaller Language Models Strong Prompt Optimizers
por: Das, Sarkar Snigdha Sarathi, et al.
Publicado: (2024) -
Verbosity $\neq$ Veracity: Demystify Verbosity Compensation Behavior of Large Language Models
por: Zhang, Yusen, et al.
Publicado: (2024) -
Evaluating LLMs at Detecting Errors in LLM Responses
por: Kamoi, Ryo, et al.
Publicado: (2024) -
When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs
por: Kamoi, Ryo, et al.
Publicado: (2024)