MazeEval: A Benchmark for Testing Sequential Decision-Making in Language Models
Fuente:
arXiv
Saved in:
| Main Author: | Einarsson, Hafsteinn |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Hotter and Colder: A New Approach to Annotating Sentiment, Emotions, and Bias in Icelandic Blog Comments
by: Friðriksdóttir, Steinunn Rut, et al.
Published: (2025)
by: Friðriksdóttir, Steinunn Rut, et al.
Published: (2025)
EconEvals: Benchmarks and Litmus Tests for Economic Decision-Making by LLM Agents
by: Fish, Sara, et al.
Published: (2025)
by: Fish, Sara, et al.
Published: (2025)
On the Modeling Capabilities of Large Language Models for Sequential Decision Making
by: Klissarov, Martin, et al.
Published: (2024)
by: Klissarov, Martin, et al.
Published: (2024)
Agentick: A Unified Benchmark for General Sequential Decision-Making Agents
by: Castanyer, Roger Creus, et al.
Published: (2026)
by: Castanyer, Roger Creus, et al.
Published: (2026)
KellyBench: A Benchmark for Long-Horizon Sequential Decision Making
by: Grady, Thomas, et al.
Published: (2026)
by: Grady, Thomas, et al.
Published: (2026)
A Sequential Decision-Making Model for Perimeter Identification
by: Taitler, Ayal
Published: (2024)
by: Taitler, Ayal
Published: (2024)
MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
by: Vasilev, Kiril, et al.
Published: (2025)
by: Vasilev, Kiril, et al.
Published: (2025)
DLM: Unified Decision Language Models for Offline Multi-Agent Sequential Decision Making
by: Zhang, Zhuohui, et al.
Published: (2026)
by: Zhang, Zhuohui, et al.
Published: (2026)
Assessing Consciousness-Related Behaviors in Large Language Models Using the Maze Test
by: Pimenta, Rui A., et al.
Published: (2025)
by: Pimenta, Rui A., et al.
Published: (2025)
Reinforced Language Models for Sequential Decision Making
by: Dilkes, Jim, et al.
Published: (2025)
by: Dilkes, Jim, et al.
Published: (2025)
Assessing AI Utility: The Random Guesser Test for Sequential Decision-Making Systems
by: Ide, Shun, et al.
Published: (2024)
by: Ide, Shun, et al.
Published: (2024)
What Makes a Maze Look Like a Maze?
by: Hsu, Joy, et al.
Published: (2024)
by: Hsu, Joy, et al.
Published: (2024)
BioMaze: Benchmarking and Enhancing Large Language Models for Biological Pathway Reasoning
by: Zhao, Haiteng, et al.
Published: (2025)
by: Zhao, Haiteng, et al.
Published: (2025)
MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents
by: Rosen, Simon, et al.
Published: (2026)
by: Rosen, Simon, et al.
Published: (2026)
Responsibility Gap and Diffusion in Sequential Decision-Making Mechanisms
by: Jiang, Junli, et al.
Published: (2025)
by: Jiang, Junli, et al.
Published: (2025)
PRISM: Perception Reasoning Interleaved for Sequential Decision Making
by: Aissi, Mohamed Salim, et al.
Published: (2026)
by: Aissi, Mohamed Salim, et al.
Published: (2026)
Online Sequential Decision-Making with Unknown Delays
by: Wu, Ping, et al.
Published: (2024)
by: Wu, Ping, et al.
Published: (2024)
Reward Design for Justifiable Sequential Decision-Making
by: Sukovic, Aleksa, et al.
Published: (2024)
by: Sukovic, Aleksa, et al.
Published: (2024)
Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning
by: Zhang, Minmin, et al.
Published: (2026)
by: Zhang, Minmin, et al.
Published: (2026)
Translating the Rashomon Effect to Sequential Decision-Making Tasks
by: Gross, Dennis, et al.
Published: (2025)
by: Gross, Dennis, et al.
Published: (2025)
SkillGen: Learning Domain Skills for In-Context Sequential Decision Making
by: Ding, Ruomeng, et al.
Published: (2025)
by: Ding, Ruomeng, et al.
Published: (2025)
Unifying and Optimizing Data Values for Selection via Sequential Decision-Making
by: Chi, Hongliang, et al.
Published: (2025)
by: Chi, Hongliang, et al.
Published: (2025)
Verifying Memoryless Sequential Decision-making of Large Language Models
by: Gross, Dennis, et al.
Published: (2025)
by: Gross, Dennis, et al.
Published: (2025)
O3D: Offline Data-driven Discovery and Distillation for Sequential Decision-Making with Large Language Models
by: Xiao, Yuchen, et al.
Published: (2023)
by: Xiao, Yuchen, et al.
Published: (2023)
Decision Transformer vs. Decision Mamba: Analysing the Complexity of Sequential Decision Making in Atari Games
by: Yan, Ke
Published: (2024)
by: Yan, Ke
Published: (2024)
FoQA: A Faroese Question-Answering Dataset
by: Simonsen, Annika, et al.
Published: (2025)
by: Simonsen, Annika, et al.
Published: (2025)
Optimizing Sensor Redundancy in Sequential Decision-Making Problems
by: Nüßlein, Jonas, et al.
Published: (2024)
by: Nüßlein, Jonas, et al.
Published: (2024)
Towards a Unified Framework for Sequential Decision Making
by: Núñez-Molina, Carlos, et al.
Published: (2023)
by: Núñez-Molina, Carlos, et al.
Published: (2023)
Understanding the Training and Generalization of Pretrained Transformer for Sequential Decision Making
by: Wang, Hanzhao, et al.
Published: (2024)
by: Wang, Hanzhao, et al.
Published: (2024)
Counterfactual Effect Decomposition in Multi-Agent Sequential Decision Making
by: Triantafyllou, Stelios, et al.
Published: (2024)
by: Triantafyllou, Stelios, et al.
Published: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
by: Yu, Linhao, et al.
Published: (2024)
by: Yu, Linhao, et al.
Published: (2024)
CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks
by: Qian, Zhaozhi, et al.
Published: (2024)
by: Qian, Zhaozhi, et al.
Published: (2024)
Adversarial Testing in LLMs: Insights into Decision-Making Vulnerabilities
by: Zhang, Lili, et al.
Published: (2025)
by: Zhang, Lili, et al.
Published: (2025)
EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing
by: Wang, Shengbo, et al.
Published: (2025)
by: Wang, Shengbo, et al.
Published: (2025)
Optimal Sequential Decision-Making in Geosteering: A Reinforcement Learning Approach
by: Muhammad, Ressi Bonti, et al.
Published: (2023)
by: Muhammad, Ressi Bonti, et al.
Published: (2023)
On Emotion-Sensitive Decision Making of Small Language Model Agents
by: Lin, Jiaju, et al.
Published: (2026)
by: Lin, Jiaju, et al.
Published: (2026)
VIPER: Visual Perception and Explainable Reasoning for Sequential Decision-Making
by: Aissi, Mohamed Salim, et al.
Published: (2025)
by: Aissi, Mohamed Salim, et al.
Published: (2025)
AccessEval: Benchmarking Disability Bias in Large Language Models
by: Panda, Srikant, et al.
Published: (2025)
by: Panda, Srikant, et al.
Published: (2025)
OpsEval: A Comprehensive IT Operations Benchmark Suite for Large Language Models
by: Liu, Yuhe, et al.
Published: (2023)
by: Liu, Yuhe, et al.
Published: (2023)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
by: Zhang, Tanghaoran, et al.
Published: (2026)
by: Zhang, Tanghaoran, et al.
Published: (2026)
Similar Items
-
Hotter and Colder: A New Approach to Annotating Sentiment, Emotions, and Bias in Icelandic Blog Comments
by: Friðriksdóttir, Steinunn Rut, et al.
Published: (2025) -
EconEvals: Benchmarks and Litmus Tests for Economic Decision-Making by LLM Agents
by: Fish, Sara, et al.
Published: (2025) -
On the Modeling Capabilities of Large Language Models for Sequential Decision Making
by: Klissarov, Martin, et al.
Published: (2024) -
Agentick: A Unified Benchmark for General Sequential Decision-Making Agents
by: Castanyer, Roger Creus, et al.
Published: (2026) -
KellyBench: A Benchmark for Long-Horizon Sequential Decision Making
by: Grady, Thomas, et al.
Published: (2026)