Evaluating Spatial Understanding of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yamada, Yutaro, Bao, Yihan, Lampinen, Andrew K., Kasai, Jungo, Yildirim, Ilker |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
When are Lemons Purple? The Concept Association Bias of Vision-Language Models
by: Yamada, Yutaro, et al.
Published: (2022)
by: Yamada, Yutaro, et al.
Published: (2022)
Fine-tuning Transformer-based Encoder for Turkish Language Understanding Tasks
by: Yildirim, Savas
Published: (2024)
by: Yildirim, Savas
Published: (2024)
Context Structure Reshapes the Representational Geometry of Language Models
by: Hosseini, Eghbal A., et al.
Published: (2026)
by: Hosseini, Eghbal A., et al.
Published: (2026)
Evaluating List Construction and Temporal Understanding capabilities of Large Language Models
by: Dumitru, Alexandru, et al.
Published: (2025)
by: Dumitru, Alexandru, et al.
Published: (2025)
Evaluating Semantic and Syntactic Understanding in Large Language Models for Payroll Systems
by: Maclean, Hendrika, et al.
Published: (2026)
by: Maclean, Hendrika, et al.
Published: (2026)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
by: Zhang, Yazhou, et al.
Published: (2024)
by: Zhang, Yazhou, et al.
Published: (2024)
Distinct Computations Emerge From Compositional Curricula in In-Context Learning
by: Lee, Jin Hwa, et al.
Published: (2025)
by: Lee, Jin Hwa, et al.
Published: (2025)
Multimodality and Attention Increase Alignment in Natural Language Prediction Between Humans and Computational Models
by: Kewenig, Viktor, et al.
Published: (2023)
by: Kewenig, Viktor, et al.
Published: (2023)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
by: Zhu, Jie, et al.
Published: (2024)
by: Zhu, Jie, et al.
Published: (2024)
Understanding Performance Collapse in Layer-Pruned Large Language Models via Decision Representation Transitions
by: Shi, Boyu, et al.
Published: (2026)
by: Shi, Boyu, et al.
Published: (2026)
Potemkin Understanding in Large Language Models
by: Mancoridis, Marina, et al.
Published: (2025)
by: Mancoridis, Marina, et al.
Published: (2025)
Just-in-time and distributed task representations in language models
by: Li, Yuxuan, et al.
Published: (2025)
by: Li, Yuxuan, et al.
Published: (2025)
Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish
by: Er, Yakup Abrek, et al.
Published: (2025)
by: Er, Yakup Abrek, et al.
Published: (2025)
L3GO: Language Agents with Chain-of-3D-Thoughts for Generating Unconventional Objects
by: Yamada, Yutaro, et al.
Published: (2024)
by: Yamada, Yutaro, et al.
Published: (2024)
Do They Understand Them? An Updated Evaluation on Nonbinary Pronoun Handling in Large Language Models
by: Tang, Xushuo, et al.
Published: (2025)
by: Tang, Xushuo, et al.
Published: (2025)
Delta Knowledge Distillation for Large Language Models
by: Cao, Yihan, et al.
Published: (2025)
by: Cao, Yihan, et al.
Published: (2025)
Assessing and Understanding Creativity in Large Language Models
by: Zhao, Yunpu, et al.
Published: (2024)
by: Zhao, Yunpu, et al.
Published: (2024)
Understanding the Dilemma of Unlearning for Large Language Models
by: Zhang, Qingjie, et al.
Published: (2025)
by: Zhang, Qingjie, et al.
Published: (2025)
Mechanistic Indicators of Understanding in Large Language Models
by: Beckmann, Pierre, et al.
Published: (2025)
by: Beckmann, Pierre, et al.
Published: (2025)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
by: Yu, Yongan, et al.
Published: (2025)
by: Yu, Yongan, et al.
Published: (2025)
DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation
by: Doris, Anna C., et al.
Published: (2024)
by: Doris, Anna C., et al.
Published: (2024)
Show, Don't Tell: Evaluating Large Language Models Beyond Textual Understanding with ChildPlay
by: de Carvalho, Gonçalo Hora, et al.
Published: (2024)
by: de Carvalho, Gonçalo Hora, et al.
Published: (2024)
Multilingual Pretraining for Pixel Language Models
by: Kesen, Ilker, et al.
Published: (2025)
by: Kesen, Ilker, et al.
Published: (2025)
Mitigating Hallucination in Large Language Models (LLMs): An Application-Oriented Survey on RAG, Reasoning, and Agentic Systems
by: Li, Yihan, et al.
Published: (2025)
by: Li, Yihan, et al.
Published: (2025)
Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark
by: Choi, Minje, et al.
Published: (2023)
by: Choi, Minje, et al.
Published: (2023)
MemeArena: Automating Context-Aware Unbiased Evaluation of Harmfulness Understanding for Multimodal Large Language Models
by: Chen, Zixin, et al.
Published: (2025)
by: Chen, Zixin, et al.
Published: (2025)
Metacognitive Prompting Improves Understanding in Large Language Models
by: Wang, Yuqing, et al.
Published: (2023)
by: Wang, Yuqing, et al.
Published: (2023)
"Understanding AI": Semantic Grounding in Large Language Models
by: Lyre, Holger
Published: (2024)
by: Lyre, Holger
Published: (2024)
Do Large Language Models Understand Word Senses?
by: Meconi, Domenico, et al.
Published: (2025)
by: Meconi, Domenico, et al.
Published: (2025)
Large Language Models Understanding: an Inherent Ambiguity Barrier
by: Nissani, Daniel N.
Published: (2025)
by: Nissani, Daniel N.
Published: (2025)
Using Large Language Models to Understand Telecom Standards
by: Karapantelakis, Athanasios, et al.
Published: (2024)
by: Karapantelakis, Athanasios, et al.
Published: (2024)
An Efficient Inference Framework for Early-exit Large Language Models
by: Miao, Ruijie, et al.
Published: (2024)
by: Miao, Ruijie, et al.
Published: (2024)
Preservation of Language Understanding Capabilities in Speech-aware Large Language Models
by: Kubis, Marek, et al.
Published: (2025)
by: Kubis, Marek, et al.
Published: (2025)
Stuck in the Matrix: Probing Spatial Reasoning in Large Language Models
by: Bai, Maggie, et al.
Published: (2025)
by: Bai, Maggie, et al.
Published: (2025)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
by: Du, Mengfei, et al.
Published: (2024)
by: Du, Mengfei, et al.
Published: (2024)
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
by: Khandekar, Nikhil, et al.
Published: (2024)
by: Khandekar, Nikhil, et al.
Published: (2024)
Evaluating Quantized Large Language Models
by: Li, Shiyao, et al.
Published: (2024)
by: Li, Shiyao, et al.
Published: (2024)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
by: Cao, Yihan, et al.
Published: (2023)
by: Cao, Yihan, et al.
Published: (2023)
Modeling Understanding of Story-Based Analogies Using Large Language Models
by: Inani, Kalit, et al.
Published: (2025)
by: Inani, Kalit, et al.
Published: (2025)
Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
by: Ball, Sarah, et al.
Published: (2025)
by: Ball, Sarah, et al.
Published: (2025)
Similar Items
-
When are Lemons Purple? The Concept Association Bias of Vision-Language Models
by: Yamada, Yutaro, et al.
Published: (2022) -
Fine-tuning Transformer-based Encoder for Turkish Language Understanding Tasks
by: Yildirim, Savas
Published: (2024) -
Context Structure Reshapes the Representational Geometry of Language Models
by: Hosseini, Eghbal A., et al.
Published: (2026) -
Evaluating List Construction and Temporal Understanding capabilities of Large Language Models
by: Dumitru, Alexandru, et al.
Published: (2025) -
Evaluating Semantic and Syntactic Understanding in Large Language Models for Payroll Systems
by: Maclean, Hendrika, et al.
Published: (2026)