GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Krechetova, Varvara, Kochedykov, Denis |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ArgBench: Benchmarking LLMs on Computational Argumentation Tasks
por: Ajjour, Yamen, et al.
Publicado: (2026)
por: Ajjour, Yamen, et al.
Publicado: (2026)
PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry
por: Fouda, Aya E., et al.
Publicado: (2025)
por: Fouda, Aya E., et al.
Publicado: (2025)
Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean
por: Park, Chanwoo, et al.
Publicado: (2025)
por: Park, Chanwoo, et al.
Publicado: (2025)
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
por: Lin, Bill Yuchen, et al.
Publicado: (2024)
por: Lin, Bill Yuchen, et al.
Publicado: (2024)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
por: Kabir, Mohsinul, et al.
Publicado: (2026)
por: Kabir, Mohsinul, et al.
Publicado: (2026)
VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
por: He, Wei, et al.
Publicado: (2025)
por: He, Wei, et al.
Publicado: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
por: Shen, Yongliang, et al.
Publicado: (2023)
por: Shen, Yongliang, et al.
Publicado: (2023)
GeoResponder: Towards Building Geospatial LLMs for Time-Critical Disaster Response
por: Zguir, Ahmed El Fekih, et al.
Publicado: (2025)
por: Zguir, Ahmed El Fekih, et al.
Publicado: (2025)
GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving
por: Zhang, Jiaxin, et al.
Publicado: (2024)
por: Zhang, Jiaxin, et al.
Publicado: (2024)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
por: Song, Yuanyi, et al.
Publicado: (2025)
por: Song, Yuanyi, et al.
Publicado: (2025)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
por: Li, Youquan, et al.
Publicado: (2024)
por: Li, Youquan, et al.
Publicado: (2024)
TopoBench: Benchmarking LLMs on Hard Topological Reasoning
por: Maniparambil, Mayug, et al.
Publicado: (2026)
por: Maniparambil, Mayug, et al.
Publicado: (2026)
AgentBench: Evaluating LLMs as Agents
por: Liu, Xiao, et al.
Publicado: (2023)
por: Liu, Xiao, et al.
Publicado: (2023)
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
por: Pires, Ramon, et al.
Publicado: (2026)
por: Pires, Ramon, et al.
Publicado: (2026)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
por: Jiang, Zhuohang, et al.
Publicado: (2025)
por: Jiang, Zhuohang, et al.
Publicado: (2025)
Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
por: Shen, Yiting, et al.
Publicado: (2026)
por: Shen, Yiting, et al.
Publicado: (2026)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
por: Long, Xiang, et al.
Publicado: (2026)
por: Long, Xiang, et al.
Publicado: (2026)
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
por: Liu, Yujie, et al.
Publicado: (2025)
por: Liu, Yujie, et al.
Publicado: (2025)
DentalBench: Benchmarking and Advancing LLMs Capability for Bilingual Dentistry Understanding
por: Zhu, Hengchuan, et al.
Publicado: (2025)
por: Zhu, Hengchuan, et al.
Publicado: (2025)
CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics
por: Agarwal, Parth, et al.
Publicado: (2025)
por: Agarwal, Parth, et al.
Publicado: (2025)
FaithBench: A Diverse Hallucination Benchmark for Summarization by Modern LLMs
por: Bao, Forrest Sheng, et al.
Publicado: (2024)
por: Bao, Forrest Sheng, et al.
Publicado: (2024)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
por: Deng, Shihan, et al.
Publicado: (2024)
por: Deng, Shihan, et al.
Publicado: (2024)
ClawBench: Can AI Agents Complete Everyday Online Tasks?
por: Zhang, Yuxuan, et al.
Publicado: (2026)
por: Zhang, Yuxuan, et al.
Publicado: (2026)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
por: Tang, Xiangru, et al.
Publicado: (2025)
por: Tang, Xiangru, et al.
Publicado: (2025)
FHIR-AgentBench: Benchmarking LLM Agents for Realistic Interoperable EHR Question Answering
por: Lee, Gyubok, et al.
Publicado: (2025)
por: Lee, Gyubok, et al.
Publicado: (2025)
GraphicBench: A Planning Benchmark for Graphic Design with Language Agents
por: Ki, Dayeon, et al.
Publicado: (2025)
por: Ki, Dayeon, et al.
Publicado: (2025)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
por: Jing, Huihao, et al.
Publicado: (2025)
por: Jing, Huihao, et al.
Publicado: (2025)
ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences
por: Nguyen, Bang, et al.
Publicado: (2026)
por: Nguyen, Bang, et al.
Publicado: (2026)
KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs
por: Kim, Haechan, et al.
Publicado: (2026)
por: Kim, Haechan, et al.
Publicado: (2026)
ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
por: Li, Minghao, et al.
Publicado: (2025)
por: Li, Minghao, et al.
Publicado: (2025)
SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks
por: Orlanski, Gabriel, et al.
Publicado: (2026)
por: Orlanski, Gabriel, et al.
Publicado: (2026)
LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning
por: Gao, Zihan, et al.
Publicado: (2025)
por: Gao, Zihan, et al.
Publicado: (2025)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
por: Lin, Zicheng, et al.
Publicado: (2024)
por: Lin, Zicheng, et al.
Publicado: (2024)
QuantumBench: A Benchmark for Quantum Problem Solving
por: Minami, Shunya, et al.
Publicado: (2025)
por: Minami, Shunya, et al.
Publicado: (2025)
BenchAgents: Multi-Agent Systems for Structured Benchmark Creation
por: Butt, Natasha, et al.
Publicado: (2024)
por: Butt, Natasha, et al.
Publicado: (2024)
ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code
por: Hua, Tianyu, et al.
Publicado: (2025)
por: Hua, Tianyu, et al.
Publicado: (2025)
SciRerankBench: Benchmarking Rerankers Towards Scientific Retrieval-Augmented Generated LLMs
por: Chen, Haotian, et al.
Publicado: (2025)
por: Chen, Haotian, et al.
Publicado: (2025)
SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia
por: Liu, Chaoqun, et al.
Publicado: (2025)
por: Liu, Chaoqun, et al.
Publicado: (2025)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
por: Liu, Zhiqiang, et al.
Publicado: (2025)
por: Liu, Zhiqiang, et al.
Publicado: (2025)
oMeBench: Towards Robust Benchmarking of LLMs in Organic Mechanism Elucidation and Reasoning
por: Xu, Ruiling, et al.
Publicado: (2025)
por: Xu, Ruiling, et al.
Publicado: (2025)
Ejemplares similares
-
ArgBench: Benchmarking LLMs on Computational Argumentation Tasks
por: Ajjour, Yamen, et al.
Publicado: (2026) -
PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry
por: Fouda, Aya E., et al.
Publicado: (2025) -
Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean
por: Park, Chanwoo, et al.
Publicado: (2025) -
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
por: Lin, Bill Yuchen, et al.
Publicado: (2024) -
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
por: Kabir, Mohsinul, et al.
Publicado: (2026)