GameTraversalBenchmark: Evaluating Planning Abilities Of Large Language Models Through Traversing 2D Game Maps
Fuente:
arXiv
Saved in:
| Main Authors: | Nasir, Muhammad Umair, James, Steven, Togelius, Julian |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Word2Minecraft: Generating 3D Game Levels through Large Language Models
by: Huang, Shuo, et al.
Published: (2025)
by: Huang, Shuo, et al.
Published: (2025)
Word2World: Generating Stories and Worlds through Large Language Models
by: Nasir, Muhammad U., et al.
Published: (2024)
by: Nasir, Muhammad U., et al.
Published: (2024)
GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games
by: Li, Yuchen, et al.
Published: (2025)
by: Li, Yuchen, et al.
Published: (2025)
LLMatic: Neural Architecture Search via Large Language Models and Quality Diversity Optimization
by: Nasir, Muhammad U., et al.
Published: (2023)
by: Nasir, Muhammad U., et al.
Published: (2023)
ScriptDoctor: Automatic Generation of PuzzleScript Games via Large Language Models and Tree Search
by: Earle, Sam, et al.
Published: (2025)
by: Earle, Sam, et al.
Published: (2025)
Large Language Models and Games: A Survey and Roadmap
by: Gallotta, Roberto, et al.
Published: (2024)
by: Gallotta, Roberto, et al.
Published: (2024)
Mortar: Evolving Mechanics for Automatic Game Design
by: Nasir, Muhammad U., et al.
Published: (2025)
by: Nasir, Muhammad U., et al.
Published: (2025)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
by: Gui, Jiayi, et al.
Published: (2024)
by: Gui, Jiayi, et al.
Published: (2024)
WebWalker: Benchmarking LLMs in Web Traversal
by: Wu, Jialong, et al.
Published: (2025)
by: Wu, Jialong, et al.
Published: (2025)
Making New Connections: LLMs as Puzzle Generators for The New York Times' Connections Word Game
by: Merino, Tim, et al.
Published: (2024)
by: Merino, Tim, et al.
Published: (2024)
Missed Connections: Lateral Thinking Puzzles for Large Language Models
by: Todd, Graham, et al.
Published: (2024)
by: Todd, Graham, et al.
Published: (2024)
MANGO: A Benchmark for Evaluating Mapping and Navigation Abilities of Large Language Models
by: Ding, Peng, et al.
Published: (2024)
by: Ding, Peng, et al.
Published: (2024)
Evaluating Language Models' Evaluations of Games
by: Collins, Katherine M., et al.
Published: (2025)
by: Collins, Katherine M., et al.
Published: (2025)
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
by: Costarelli, Anthony, et al.
Published: (2024)
by: Costarelli, Anthony, et al.
Published: (2024)
TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games
by: Mishra, Prakamya, et al.
Published: (2025)
by: Mishra, Prakamya, et al.
Published: (2025)
RPGBENCH: Evaluating Large Language Models as Role-Playing Game Engines
by: Yu, Pengfei, et al.
Published: (2025)
by: Yu, Pengfei, et al.
Published: (2025)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
by: Kim, Dongjun, et al.
Published: (2025)
by: Kim, Dongjun, et al.
Published: (2025)
Evaluating the Efficacy of Large Language Models in Identifying Phishing Attempts
by: Patel, Het, et al.
Published: (2024)
by: Patel, Het, et al.
Published: (2024)
Persuasion Games using Large Language Models
by: Ramani, Ganesh Prasath, et al.
Published: (2024)
by: Ramani, Ganesh Prasath, et al.
Published: (2024)
Reinforcement Learning Improves Traversal of Hierarchical Knowledge in LLMs
by: Zhang, Renfei, et al.
Published: (2025)
by: Zhang, Renfei, et al.
Published: (2025)
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
by: Li, Haoyang, et al.
Published: (2025)
by: Li, Haoyang, et al.
Published: (2025)
Autoverse: An Evolvable Game Language for Learning Robust Embodied Agents
by: Earle, Sam, et al.
Published: (2024)
by: Earle, Sam, et al.
Published: (2024)
How Different AI Chatbots Behave? Benchmarking Large Language Models in Behavioral Economics Games
by: Xie, Yutong, et al.
Published: (2024)
by: Xie, Yutong, et al.
Published: (2024)
Traversal Verification for Speculative Tree Decoding
by: Weng, Yepeng, et al.
Published: (2025)
by: Weng, Yepeng, et al.
Published: (2025)
Enhance Reasoning for Large Language Models in the Game Werewolf
by: Wu, Shuang, et al.
Published: (2024)
by: Wu, Shuang, et al.
Published: (2024)
Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games
by: Malik, Saumya
Published: (2024)
by: Malik, Saumya
Published: (2024)
Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
GameDevBench: Evaluating Agentic Capabilities Through Game Development
by: Chi, Wayne, et al.
Published: (2026)
by: Chi, Wayne, et al.
Published: (2026)
Advancing Spatial Reasoning in Large Language Models: An In-Depth Evaluation and Enhancement Using the StepGame Benchmark
by: Li, Fangjun, et al.
Published: (2024)
by: Li, Fangjun, et al.
Published: (2024)
Evaluating Large Language Models with Grid-Based Game Competitions: An Extensible LLM Benchmark and Leaderboard
by: Topsakal, Oguzhan, et al.
Published: (2024)
by: Topsakal, Oguzhan, et al.
Published: (2024)
Exploring Large Language Models for Word Games:Who is the Spy?
by: Wei, Chentian, et al.
Published: (2025)
by: Wei, Chentian, et al.
Published: (2025)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
by: Zheng, Yu, et al.
Published: (2025)
by: Zheng, Yu, et al.
Published: (2025)
FinDABench: Benchmarking Financial Data Analysis Ability of Large Language Models
by: Liu, Shu, et al.
Published: (2024)
by: Liu, Shu, et al.
Published: (2024)
How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments
by: Huang, Jen-tse, et al.
Published: (2024)
by: Huang, Jen-tse, et al.
Published: (2024)
Helmsman of the Masses? Evaluate the Opinion Leadership of Large Language Models in the Werewolf Game
by: Du, Silin, et al.
Published: (2024)
by: Du, Silin, et al.
Published: (2024)
Eliciting Trustworthiness Priors of Large Language Models via Economic Games
by: Yan, Siyu, et al.
Published: (2026)
by: Yan, Siyu, et al.
Published: (2026)
Mastering Board Games by External and Internal Planning with Language Models
by: Schultz, John, et al.
Published: (2024)
by: Schultz, John, et al.
Published: (2024)
"Hunt Takes Hare": Theming Games Through Game-Word Vector Translation
by: Younès, Rabii, et al.
Published: (2024)
by: Younès, Rabii, et al.
Published: (2024)
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
by: Wang, Zekun Moore, et al.
Published: (2023)
by: Wang, Zekun Moore, et al.
Published: (2023)
Breaking the Static Graph: Context-Aware Traversal for Robust Retrieval-Augmented Generation
by: Lau, Kwun Hang, et al.
Published: (2026)
by: Lau, Kwun Hang, et al.
Published: (2026)
Similar Items
-
Word2Minecraft: Generating 3D Game Levels through Large Language Models
by: Huang, Shuo, et al.
Published: (2025) -
Word2World: Generating Stories and Worlds through Large Language Models
by: Nasir, Muhammad U., et al.
Published: (2024) -
GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games
by: Li, Yuchen, et al.
Published: (2025) -
LLMatic: Neural Architecture Search via Large Language Models and Quality Diversity Optimization
by: Nasir, Muhammad U., et al.
Published: (2023) -
ScriptDoctor: Automatic Generation of PuzzleScript Games via Large Language Models and Tree Search
by: Earle, Sam, et al.
Published: (2025)