Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Liuchang, Zhao, Shuo, Lin, Qingming, Chen, Luyao, Luo, Qianqian, Wu, Sensen, Ye, Xinyue, Feng, Hailin, Du, Zhenhong |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GeoJSON Agents:A Multi-Agent LLM Architecture for Geospatial Analysis-Function Calling vs Code Generation
by: Luo, Qianqian, et al.
Published: (2025)
by: Luo, Qianqian, et al.
Published: (2025)
ShapefileGPT: A Multi-Agent Large Language Model Framework for Automated Shapefile Processing
by: Lin, Qingming, et al.
Published: (2024)
by: Lin, Qingming, et al.
Published: (2024)
From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis
by: Zhou, Fangshuo, et al.
Published: (2024)
by: Zhou, Fangshuo, et al.
Published: (2024)
Evaluating Large Language Models in Theory of Mind Tasks
by: Kosinski, Michal
Published: (2023)
by: Kosinski, Michal
Published: (2023)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
by: Kabir, Mohsinul, et al.
Published: (2026)
by: Kabir, Mohsinul, et al.
Published: (2026)
A Systematic Review on the Evaluation of Large Language Models in Theory of Mind Tasks
by: Sarıtaş, Karahan, et al.
Published: (2025)
by: Sarıtaş, Karahan, et al.
Published: (2025)
Benchmark on Peer Review Toxic Detection: A Challenging Task with a New Dataset
by: Luo, Man, et al.
Published: (2025)
by: Luo, Man, et al.
Published: (2025)
For the Misgendered Chinese in Gender Bias Research: Multi-Task Learning with Knowledge Distillation for Pinyin Name-Gender Prediction
by: Du, Xiaocong, et al.
Published: (2024)
by: Du, Xiaocong, et al.
Published: (2024)
The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks
by: Majithia, Neil, et al.
Published: (2026)
by: Majithia, Neil, et al.
Published: (2026)
Human Simulacra: Benchmarking the Personification of Large Language Models
by: Xie, Qiuejie, et al.
Published: (2024)
by: Xie, Qiuejie, et al.
Published: (2024)
Dependency-Aware Task Offloading in Multi-UAV Assisted Collaborative Mobile Edge Computing
by: Zhao, Zhenyu, et al.
Published: (2025)
by: Zhao, Zhenyu, et al.
Published: (2025)
Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional Chinese
by: Lyu, Hanjia, et al.
Published: (2025)
by: Lyu, Hanjia, et al.
Published: (2025)
WorldValuesBench: A Large-Scale Benchmark Dataset for Multi-Cultural Value Awareness of Language Models
by: Zhao, Wenlong, et al.
Published: (2024)
by: Zhao, Wenlong, et al.
Published: (2024)
Correctness Comparison of ChatGPT-4, Gemini, Claude-3, and Copilot for Spatial Tasks
by: Hochmair, Hartwig H., et al.
Published: (2024)
by: Hochmair, Hartwig H., et al.
Published: (2024)
Evaluating Large Language Model Capabilities in Assessing Spatial Econometrics Research
by: Arbia, Giuseppe, et al.
Published: (2025)
by: Arbia, Giuseppe, et al.
Published: (2025)
Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework
by: Jain, Shomik, et al.
Published: (2025)
by: Jain, Shomik, et al.
Published: (2025)
Evaluating Proactive Risk Awareness of Large Language Models
by: Luo, Xuan, et al.
Published: (2026)
by: Luo, Xuan, et al.
Published: (2026)
Leveraging Large Language Models for Sentiment Analysis: Multi-Modal Analysis of Decentraland's MANA Token
by: Wu, Xintong, et al.
Published: (2026)
by: Wu, Xintong, et al.
Published: (2026)
Societal Impacts Research Requires Benchmarks for Creative Composition Tasks
by: Shen, Judy Hanwen, et al.
Published: (2025)
by: Shen, Judy Hanwen, et al.
Published: (2025)
Bilingual Bias in Large Language Models: A Taiwan Sovereignty Benchmark Study
by: Ko, Ju-Chun
Published: (2026)
by: Ko, Ju-Chun
Published: (2026)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
by: Du, Mengfei, et al.
Published: (2024)
by: Du, Mengfei, et al.
Published: (2024)
TaCIE: Enhancing Instruction Comprehension in Large Language Models through Task-Centred Instruction Evolution
by: Yang, Jiuding, et al.
Published: (2024)
by: Yang, Jiuding, et al.
Published: (2024)
Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models
by: Ibrahim, Lujain, et al.
Published: (2025)
by: Ibrahim, Lujain, et al.
Published: (2025)
MAGPIE: Multi-Task Media-Bias Analysis Generalization for Pre-Trained Identification of Expressions
by: Horych, Tomáš, et al.
Published: (2024)
by: Horych, Tomáš, et al.
Published: (2024)
A Pluggable Multi-Task Learning Framework for Sentiment-Aware Financial Relation Extraction
by: Luo, Jinming, et al.
Published: (2025)
by: Luo, Jinming, et al.
Published: (2025)
Biothreat Benchmark Generation Framework for Evaluating Frontier AI Models I: The Task-Query Architecture
by: Ackerman, Gary, et al.
Published: (2025)
by: Ackerman, Gary, et al.
Published: (2025)
Adapting Large Language Models to Mitigate Skin Tone Biases in Clinical Dermatology Tasks: A Mixed-Methods Study
by: Nijjer, Kiran, et al.
Published: (2025)
by: Nijjer, Kiran, et al.
Published: (2025)
Fane at SemEval-2025 Task 10: Zero-Shot Entity Framing with Large Language Models
by: Fane, Enfa, et al.
Published: (2025)
by: Fane, Enfa, et al.
Published: (2025)
Fairness in Multi-Task Learning via Wasserstein Barycenters
by: Hu, François, et al.
Published: (2023)
by: Hu, François, et al.
Published: (2023)
Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language Models
by: Chen, Yuyan, et al.
Published: (2024)
by: Chen, Yuyan, et al.
Published: (2024)
Evaluating Psychological Safety of Large Language Models
by: Li, Xingxuan, et al.
Published: (2022)
by: Li, Xingxuan, et al.
Published: (2022)
Human-Level and Beyond: Benchmarking Large Language Models Against Clinical Pharmacists in Prescription Review
by: Yang, Yan, et al.
Published: (2025)
by: Yang, Yan, et al.
Published: (2025)
LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models
by: Jiao, Junfeng, et al.
Published: (2025)
by: Jiao, Junfeng, et al.
Published: (2025)
The Configuration of Space: Probing the Way Social Interaction and Perception are Affected by Task-Specific Spatial Representations in Online Video Communication
by: Chen, Yihuan, et al.
Published: (2026)
by: Chen, Yihuan, et al.
Published: (2026)
Should There be a Teacher In-the-Loop? A Study of Generative AI Personalized Tasks Middle School
by: Walkington, Candace, et al.
Published: (2026)
by: Walkington, Candace, et al.
Published: (2026)
SoK: Stablecoins for Digital Transformation -- Design, Metrics, and Application with Real World Asset Tokenization as a Case Study
by: Zhang, Luyao
Published: (2025)
by: Zhang, Luyao
Published: (2025)
The Parrot Dilemma: Human-Labeled vs. LLM-augmented Data in Classification Tasks
by: Møller, Anders Giovanni, et al.
Published: (2023)
by: Møller, Anders Giovanni, et al.
Published: (2023)
Interleaving Natural Language Prompting with Code Editing for Solving Programming Tasks with Generative AI Models
by: Pădurean, Victor-Alexandru, et al.
Published: (2025)
by: Pădurean, Victor-Alexandru, et al.
Published: (2025)
Evaluating Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards
by: Liu, Geng, et al.
Published: (2025)
by: Liu, Geng, et al.
Published: (2025)
Democratizing Federated Learning with Blockchain and Multi-Task Peer Prediction
by: Witt, Leon, et al.
Published: (2026)
by: Witt, Leon, et al.
Published: (2026)
Similar Items
-
GeoJSON Agents:A Multi-Agent LLM Architecture for Geospatial Analysis-Function Calling vs Code Generation
by: Luo, Qianqian, et al.
Published: (2025) -
ShapefileGPT: A Multi-Agent Large Language Model Framework for Automated Shapefile Processing
by: Lin, Qingming, et al.
Published: (2024) -
From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis
by: Zhou, Fangshuo, et al.
Published: (2024) -
Evaluating Large Language Models in Theory of Mind Tasks
by: Kosinski, Michal
Published: (2023) -
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
by: Kabir, Mohsinul, et al.
Published: (2026)