KellyBench: A Benchmark for Long-Horizon Sequential Decision Making
Fuente:
arXiv
Guardado en:
| Autores principales: | Grady, Thomas, Parker, Kip, Zarov, Iliyan, Course, Henry, Taylor, Chengxi, Taylor, Ross |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LifeBench: A Benchmark for Long-Horizon Multi-Source Memory
por: Cheng, Zihao, et al.
Publicado: (2026)
por: Cheng, Zihao, et al.
Publicado: (2026)
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
por: Zhang, Linghua, et al.
Publicado: (2026)
por: Zhang, Linghua, et al.
Publicado: (2026)
Agentick: A Unified Benchmark for General Sequential Decision-Making Agents
por: Castanyer, Roger Creus, et al.
Publicado: (2026)
por: Castanyer, Roger Creus, et al.
Publicado: (2026)
ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering
por: Imajuku, Yuki, et al.
Publicado: (2025)
por: Imajuku, Yuki, et al.
Publicado: (2025)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
por: Gao, Yuxuan, et al.
Publicado: (2026)
por: Gao, Yuxuan, et al.
Publicado: (2026)
HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds
por: Anokhin, Petr, et al.
Publicado: (2025)
por: Anokhin, Petr, et al.
Publicado: (2025)
MazeEval: A Benchmark for Testing Sequential Decision-Making in Language Models
por: Einarsson, Hafsteinn
Publicado: (2025)
por: Einarsson, Hafsteinn
Publicado: (2025)
MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
por: Vasilev, Kiril, et al.
Publicado: (2025)
por: Vasilev, Kiril, et al.
Publicado: (2025)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
por: Li, Shuyue Stella, et al.
Publicado: (2026)
por: Li, Shuyue Stella, et al.
Publicado: (2026)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
por: Shen, Yuanzhe, et al.
Publicado: (2026)
por: Shen, Yuanzhe, et al.
Publicado: (2026)
A Sequential Decision-Making Model for Perimeter Identification
por: Taitler, Ayal
Publicado: (2024)
por: Taitler, Ayal
Publicado: (2024)
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
por: Zhang, Haoran, et al.
Publicado: (2025)
por: Zhang, Haoran, et al.
Publicado: (2025)
DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management
por: Cardei, Maria Ana, et al.
Publicado: (2025)
por: Cardei, Maria Ana, et al.
Publicado: (2025)
DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation
por: Xie, Sixiong, et al.
Publicado: (2026)
por: Xie, Sixiong, et al.
Publicado: (2026)
MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents
por: Rosen, Simon, et al.
Publicado: (2026)
por: Rosen, Simon, et al.
Publicado: (2026)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
por: Song, Yuanyi, et al.
Publicado: (2025)
por: Song, Yuanyi, et al.
Publicado: (2025)
PRISM: Perception Reasoning Interleaved for Sequential Decision Making
por: Aissi, Mohamed Salim, et al.
Publicado: (2026)
por: Aissi, Mohamed Salim, et al.
Publicado: (2026)
Responsibility Gap and Diffusion in Sequential Decision-Making Mechanisms
por: Jiang, Junli, et al.
Publicado: (2025)
por: Jiang, Junli, et al.
Publicado: (2025)
Optimizing Sensor Redundancy in Sequential Decision-Making Problems
por: Nüßlein, Jonas, et al.
Publicado: (2024)
por: Nüßlein, Jonas, et al.
Publicado: (2024)
LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios
por: Chen, Tianyu, et al.
Publicado: (2026)
por: Chen, Tianyu, et al.
Publicado: (2026)
Online Sequential Decision-Making with Unknown Delays
por: Wu, Ping, et al.
Publicado: (2024)
por: Wu, Ping, et al.
Publicado: (2024)
Reward Design for Justifiable Sequential Decision-Making
por: Sukovic, Aleksa, et al.
Publicado: (2024)
por: Sukovic, Aleksa, et al.
Publicado: (2024)
Verifiable Benchmarking of Long-Horizon Spatial Biology
por: Diks, Ian, et al.
Publicado: (2026)
por: Diks, Ian, et al.
Publicado: (2026)
Implicit Strategic Optimization: Rethinking Long-Horizon Decision-Making in Adversarial Poker Environments
por: Xia, Boyang, et al.
Publicado: (2026)
por: Xia, Boyang, et al.
Publicado: (2026)
On the Modeling Capabilities of Large Language Models for Sequential Decision Making
por: Klissarov, Martin, et al.
Publicado: (2024)
por: Klissarov, Martin, et al.
Publicado: (2024)
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
por: Zhao, Yujie, et al.
Publicado: (2026)
por: Zhao, Yujie, et al.
Publicado: (2026)
$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
por: Zhang, Haoran, et al.
Publicado: (2026)
por: Zhang, Haoran, et al.
Publicado: (2026)
SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models
por: Monti, Sebastiano, et al.
Publicado: (2026)
por: Monti, Sebastiano, et al.
Publicado: (2026)
Translating the Rashomon Effect to Sequential Decision-Making Tasks
por: Gross, Dennis, et al.
Publicado: (2025)
por: Gross, Dennis, et al.
Publicado: (2025)
SkillGen: Learning Domain Skills for In-Context Sequential Decision Making
por: Ding, Ruomeng, et al.
Publicado: (2025)
por: Ding, Ruomeng, et al.
Publicado: (2025)
Unifying and Optimizing Data Values for Selection via Sequential Decision-Making
por: Chi, Hongliang, et al.
Publicado: (2025)
por: Chi, Hongliang, et al.
Publicado: (2025)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
por: Luo, Haotian, et al.
Publicado: (2025)
por: Luo, Haotian, et al.
Publicado: (2025)
SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks
por: Orlanski, Gabriel, et al.
Publicado: (2026)
por: Orlanski, Gabriel, et al.
Publicado: (2026)
Decision Transformer vs. Decision Mamba: Analysing the Complexity of Sequential Decision Making in Atari Games
por: Yan, Ke
Publicado: (2024)
por: Yan, Ke
Publicado: (2024)
Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents
por: Srininvasan, Vasundra
Publicado: (2026)
por: Srininvasan, Vasundra
Publicado: (2026)
LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks
por: Chandwani, Abhishek, et al.
Publicado: (2026)
por: Chandwani, Abhishek, et al.
Publicado: (2026)
Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
por: Wang, Zehong, et al.
Publicado: (2026)
por: Wang, Zehong, et al.
Publicado: (2026)
Towards a Unified Framework for Sequential Decision Making
por: Núñez-Molina, Carlos, et al.
Publicado: (2023)
por: Núñez-Molina, Carlos, et al.
Publicado: (2023)
LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning
por: Motwani, Sumeet Ramesh, et al.
Publicado: (2026)
por: Motwani, Sumeet Ramesh, et al.
Publicado: (2026)
LongGenBench: Long-context Generation Benchmark
por: Liu, Xiang, et al.
Publicado: (2024)
por: Liu, Xiang, et al.
Publicado: (2024)
Ejemplares similares
-
LifeBench: A Benchmark for Long-Horizon Multi-Source Memory
por: Cheng, Zihao, et al.
Publicado: (2026) -
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
por: Zhang, Linghua, et al.
Publicado: (2026) -
Agentick: A Unified Benchmark for General Sequential Decision-Making Agents
por: Castanyer, Roger Creus, et al.
Publicado: (2026) -
ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering
por: Imajuku, Yuki, et al.
Publicado: (2025) -
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
por: Gao, Yuxuan, et al.
Publicado: (2026)