Unchecked and Overlooked: Addressing the Checkbox Blind Spot in Large Language Models with CheckboxQA
Fuente:
arXiv
Saved in:
| Main Authors: | Turski, Michał, Chiliński, Mateusz, Borchmann, Łukasz |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Break the Checkbox: Challenging Closed-Style Evaluations of Cultural Alignment in LLMs
by: Kabir, Mohsinul, et al.
Published: (2025)
by: Kabir, Mohsinul, et al.
Published: (2025)
Language Models Model Language
by: Borchmann, Łukasz
Published: (2025)
by: Borchmann, Łukasz
Published: (2025)
Notes on Applicability of GPT-4 to Document Understanding
by: Borchmann, Łukasz
Published: (2024)
by: Borchmann, Łukasz
Published: (2024)
Beyond the Checkbox: Strengthening DSA Compliance Through Social Media Algorithmic Auditing
by: Solarova, Sara, et al.
Published: (2026)
by: Solarova, Sara, et al.
Published: (2026)
In Case You Missed It: ARC 'Challenge' Is Not That Challenging
by: Borchmann, Łukasz
Published: (2024)
by: Borchmann, Łukasz
Published: (2024)
Can Models Help Us Create Better Models? Evaluating LLMs as Data Scientists
by: Pietruszka, Michał, et al.
Published: (2024)
by: Pietruszka, Michał, et al.
Published: (2024)
Arctic-Extract Technical Report
by: Chiliński, Mateusz, et al.
Published: (2025)
by: Chiliński, Mateusz, et al.
Published: (2025)
Query and Conquer: Execution-Guided SQL Generation
by: Borchmann, Łukasz, et al.
Published: (2025)
by: Borchmann, Łukasz, et al.
Published: (2025)
Temporal Blind Spots in Large Language Models
by: Wallat, Jonas, et al.
Published: (2024)
by: Wallat, Jonas, et al.
Published: (2024)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
by: Tsui, Ken
Published: (2025)
by: Tsui, Ken
Published: (2025)
Linguistic Blind Spots of Large Language Models
by: Cheng, Jiali, et al.
Published: (2025)
by: Cheng, Jiali, et al.
Published: (2025)
Simple Linguistic Inferences of Large Language Models (LLMs): Blind Spots and Blinds
by: Basmov, Victoria, et al.
Published: (2023)
by: Basmov, Victoria, et al.
Published: (2023)
Blind Spot Navigation in Large Language Model Reasoning with Thought Space Explorer
by: Zhang, Jinghan, et al.
Published: (2024)
by: Zhang, Jinghan, et al.
Published: (2024)
Tackling prediction tasks in relational databases with LLMs
by: Wydmuch, Marek, et al.
Published: (2024)
by: Wydmuch, Marek, et al.
Published: (2024)
Arctic-TILT. Business Document Understanding at Sub-Billion Scale
by: Borchmann, Łukasz, et al.
Published: (2024)
by: Borchmann, Łukasz, et al.
Published: (2024)
Fluent but Unfeeling: The Emotional Blind Spots of Language Models
by: Shu, Bangzhao, et al.
Published: (2025)
by: Shu, Bangzhao, et al.
Published: (2025)
Belief in the Machine: Investigating Epistemological Blind Spots of Language Models
by: Suzgun, Mirac, et al.
Published: (2024)
by: Suzgun, Mirac, et al.
Published: (2024)
Illuminating Blind Spots of Language Models with Targeted Agent-in-the-Loop Synthetic Data
by: Lippmann, Philip, et al.
Published: (2024)
by: Lippmann, Philip, et al.
Published: (2024)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
by: Khan, Mohammed Safi Ur Rahman, et al.
Published: (2026)
by: Khan, Mohammed Safi Ur Rahman, et al.
Published: (2026)
Dynamic Boundary Time Warping for Sub-sequence Matching with Few Examples
by: Borchmann, Łukasz, et al.
Published: (2020)
by: Borchmann, Łukasz, et al.
Published: (2020)
Preservation of Language Understanding Capabilities in Speech-aware Large Language Models
by: Kubis, Marek, et al.
Published: (2025)
by: Kubis, Marek, et al.
Published: (2025)
Large Language Models are Algorithmically Blind
by: Venkatesh, Sohan, et al.
Published: (2026)
by: Venkatesh, Sohan, et al.
Published: (2026)
Forgotten Polygons: Multimodal Large Language Models are Shape-Blind
by: Rudman, William, et al.
Published: (2025)
by: Rudman, William, et al.
Published: (2025)
Finding Blind Spots in Evaluator LLMs with Interpretable Checklists
by: Doddapaneni, Sumanth, et al.
Published: (2024)
by: Doddapaneni, Sumanth, et al.
Published: (2024)
KatotohananQA: Evaluating Truthfulness of Large Language Models in Filipino
by: Nery, Lorenzo Alfred, et al.
Published: (2025)
by: Nery, Lorenzo Alfred, et al.
Published: (2025)
Linguistic Blind Spots in Clinical Decision Extraction
by: Elgaar, Mohamed, et al.
Published: (2026)
by: Elgaar, Mohamed, et al.
Published: (2026)
Addressing Blind Guessing: Calibration of Selection Bias in Multiple-Choice Question Answering by Video Language Models
by: Loginova, Olga, et al.
Published: (2024)
by: Loginova, Olga, et al.
Published: (2024)
From Input Perception to Predictive Insight: Modeling Model Blind Spots Before They Become Errors
by: Mi, Maggie, et al.
Published: (2025)
by: Mi, Maggie, et al.
Published: (2025)
CodeSimpleQA: Scaling Factuality in Code Large Language Models
by: Yang, Jian, et al.
Published: (2025)
by: Yang, Jian, et al.
Published: (2025)
Unipa-GPT: Large Language Models for university-oriented QA in Italian
by: Siragusa, Irene, et al.
Published: (2024)
by: Siragusa, Irene, et al.
Published: (2024)
SportQA: A Benchmark for Sports Understanding in Large Language Models
by: Xia, Haotian, et al.
Published: (2024)
by: Xia, Haotian, et al.
Published: (2024)
Hit the Sweet Spot! Span-Level Ensemble for Large Language Models
by: Xu, Yangyifan, et al.
Published: (2024)
by: Xu, Yangyifan, et al.
Published: (2024)
The Rarity Blind Spot: A Framework for Evaluating Statistical Reasoning in LLMs
by: Maekawa, Seiji, et al.
Published: (2025)
by: Maekawa, Seiji, et al.
Published: (2025)
QA-prompting: Improving Summarization with Large Language Models using Question-Answering
by: Sinha, Neelabh
Published: (2025)
by: Sinha, Neelabh
Published: (2025)
PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models
by: Li, Guangwei, et al.
Published: (2025)
by: Li, Guangwei, et al.
Published: (2025)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
by: He, Yancheng, et al.
Published: (2024)
by: He, Yancheng, et al.
Published: (2024)
Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections
by: Borchmann, Łukasz, et al.
Published: (2026)
by: Borchmann, Łukasz, et al.
Published: (2026)
Addressing Topic Granularity and Hallucination in Large Language Models for Topic Modelling
by: Mu, Yida, et al.
Published: (2024)
by: Mu, Yida, et al.
Published: (2024)
Spot the BlindSpots: Systematic Identification and Quantification of Fine-Grained LLM Biases in Contact Center Summaries
by: Mayilvaghanan, Kawin, et al.
Published: (2025)
by: Mayilvaghanan, Kawin, et al.
Published: (2025)
Mind the Blind Spots: A Focus-Level Evaluation Framework for LLM Reviews
by: Shin, Hyungyu, et al.
Published: (2025)
by: Shin, Hyungyu, et al.
Published: (2025)
Similar Items
-
Break the Checkbox: Challenging Closed-Style Evaluations of Cultural Alignment in LLMs
by: Kabir, Mohsinul, et al.
Published: (2025) -
Language Models Model Language
by: Borchmann, Łukasz
Published: (2025) -
Notes on Applicability of GPT-4 to Document Understanding
by: Borchmann, Łukasz
Published: (2024) -
Beyond the Checkbox: Strengthening DSA Compliance Through Social Media Algorithmic Auditing
by: Solarova, Sara, et al.
Published: (2026) -
In Case You Missed It: ARC 'Challenge' Is Not That Challenging
by: Borchmann, Łukasz
Published: (2024)