Salvato in:
| Autori principali: | Diks, Ian, Muralidharan, Harihara, Proctor, Tim, Workman, Kenny |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.28065 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SpatialBench: Can Agents Analyze Real-World Spatial Biology Data?
di: Workman, Kenny, et al.
Pubblicazione: (2025)
di: Workman, Kenny, et al.
Pubblicazione: (2025)
scBench: Evaluating AI Agents on Single-Cell RNA-seq Analysis
di: Workman, Kenny, et al.
Pubblicazione: (2026)
di: Workman, Kenny, et al.
Pubblicazione: (2026)
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
di: Zhang, Yinger, et al.
Pubblicazione: (2026)
di: Zhang, Yinger, et al.
Pubblicazione: (2026)
NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks
di: Zheng, Zihan, et al.
Pubblicazione: (2025)
di: Zheng, Zihan, et al.
Pubblicazione: (2025)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
di: Luo, Haotian, et al.
Pubblicazione: (2025)
di: Luo, Haotian, et al.
Pubblicazione: (2025)
Spatially Grounded Long-Horizon Task Planning in the Wild
di: Jung, Sehun, et al.
Pubblicazione: (2026)
di: Jung, Sehun, et al.
Pubblicazione: (2026)
LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2026)
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2026)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
di: Zhang, Zijing, et al.
Pubblicazione: (2025)
di: Zhang, Zijing, et al.
Pubblicazione: (2025)
LifeBench: A Benchmark for Long-Horizon Multi-Source Memory
di: Cheng, Zihao, et al.
Pubblicazione: (2026)
di: Cheng, Zihao, et al.
Pubblicazione: (2026)
AgentLAB: Benchmarking LLM Agents against Long-Horizon Attacks
di: Jiang, Tanqiu, et al.
Pubblicazione: (2026)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2026)
KellyBench: A Benchmark for Long-Horizon Sequential Decision Making
di: Grady, Thomas, et al.
Pubblicazione: (2026)
di: Grady, Thomas, et al.
Pubblicazione: (2026)
Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue
di: Lin, Jingjie, et al.
Pubblicazione: (2026)
di: Lin, Jingjie, et al.
Pubblicazione: (2026)
MinePlanner: A Benchmark for Long-Horizon Planning in Large Minecraft Worlds
di: Hill, William, et al.
Pubblicazione: (2023)
di: Hill, William, et al.
Pubblicazione: (2023)
ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering
di: Imajuku, Yuki, et al.
Pubblicazione: (2025)
di: Imajuku, Yuki, et al.
Pubblicazione: (2025)
LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
di: Xiao, Zikai, et al.
Pubblicazione: (2025)
di: Xiao, Zikai, et al.
Pubblicazione: (2025)
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
di: Jiayang, Cheng, et al.
Pubblicazione: (2026)
di: Jiayang, Cheng, et al.
Pubblicazione: (2026)
HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds
di: Anokhin, Petr, et al.
Pubblicazione: (2025)
di: Anokhin, Petr, et al.
Pubblicazione: (2025)
When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents
di: Yan, Lu, et al.
Pubblicazione: (2026)
di: Yan, Lu, et al.
Pubblicazione: (2026)
Can LLM Agents Be CFOs? Benchmarking Long-Horizon Resource Allocation in an Uncertain Enterprise Environment
di: Han, Yi, et al.
Pubblicazione: (2026)
di: Han, Yi, et al.
Pubblicazione: (2026)
When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution
di: Zhu, Zilin, et al.
Pubblicazione: (2026)
di: Zhu, Zilin, et al.
Pubblicazione: (2026)
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
di: Li, Xuzhao, et al.
Pubblicazione: (2025)
di: Li, Xuzhao, et al.
Pubblicazione: (2025)
BOSS: Benchmark for Observation Space Shift in Long-Horizon Task
di: Yang, Yue, et al.
Pubblicazione: (2025)
di: Yang, Yue, et al.
Pubblicazione: (2025)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
di: Li, Shuyue Stella, et al.
Pubblicazione: (2026)
di: Li, Shuyue Stella, et al.
Pubblicazione: (2026)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
di: Shen, Yuanzhe, et al.
Pubblicazione: (2026)
di: Shen, Yuanzhe, et al.
Pubblicazione: (2026)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
di: Li, Junlong, et al.
Pubblicazione: (2025)
di: Li, Junlong, et al.
Pubblicazione: (2025)
λ: A Benchmark for Data-Efficiency in Long-Horizon Indoor Mobile Manipulation Robotics
di: Jaafar, Ahmed, et al.
Pubblicazione: (2024)
di: Jaafar, Ahmed, et al.
Pubblicazione: (2024)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
di: Zheng, Xinyi, et al.
Pubblicazione: (2026)
di: Zheng, Xinyi, et al.
Pubblicazione: (2026)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents
di: Lu, Yijun, et al.
Pubblicazione: (2026)
di: Lu, Yijun, et al.
Pubblicazione: (2026)
Can Lessons From Human Teams Be Applied to Multi-Agent Systems? The Role of Structure, Diversity, and Interaction Dynamics
di: Muralidharan, Rasika, et al.
Pubblicazione: (2025)
di: Muralidharan, Rasika, et al.
Pubblicazione: (2025)
DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation
di: Xie, Sixiong, et al.
Pubblicazione: (2026)
di: Xie, Sixiong, et al.
Pubblicazione: (2026)
LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios
di: Chen, Tianyu, et al.
Pubblicazione: (2026)
di: Chen, Tianyu, et al.
Pubblicazione: (2026)
Active Inference in Discrete State Spaces from First Principles
di: Kenny, Patrick
Pubblicazione: (2025)
di: Kenny, Patrick
Pubblicazione: (2025)
PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models
di: Zhang, Ruizhi, et al.
Pubblicazione: (2026)
di: Zhang, Ruizhi, et al.
Pubblicazione: (2026)
HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents
di: Zhang, Ningning, et al.
Pubblicazione: (2026)
di: Zhang, Ningning, et al.
Pubblicazione: (2026)
Learning Long-Horizon Predictions for Quadrotor Dynamics
di: Rao, Pratyaksh Prabhav, et al.
Pubblicazione: (2024)
di: Rao, Pratyaksh Prabhav, et al.
Pubblicazione: (2024)
STRUCTUREDAGENT: Planning with AND/OR Trees for Long-Horizon Web Tasks
di: Lobo, ELita, et al.
Pubblicazione: (2026)
di: Lobo, ELita, et al.
Pubblicazione: (2026)
LEAD: Breaking the No-Recovery Bottleneck in Long-Horizon Reasoning
di: Pushkin, Denys, et al.
Pubblicazione: (2026)
di: Pushkin, Denys, et al.
Pubblicazione: (2026)
PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media
di: Kachwala, Zoher, et al.
Pubblicazione: (2026)
di: Kachwala, Zoher, et al.
Pubblicazione: (2026)
CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations
di: Gao, Huan-ang, et al.
Pubblicazione: (2025)
di: Gao, Huan-ang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SpatialBench: Can Agents Analyze Real-World Spatial Biology Data?
di: Workman, Kenny, et al.
Pubblicazione: (2025) -
scBench: Evaluating AI Agents on Single-Cell RNA-seq Analysis
di: Workman, Kenny, et al.
Pubblicazione: (2026) -
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
di: Zhang, Yinger, et al.
Pubblicazione: (2026) -
NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks
di: Zheng, Zihan, et al.
Pubblicazione: (2025) -
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
di: Luo, Haotian, et al.
Pubblicazione: (2025)