Verifiable Benchmarking of Long-Horizon Spatial Biology
Fuente:
arXiv
Guardado en:
| Autores principales: | Diks, Ian, Muralidharan, Harihara, Proctor, Tim, Workman, Kenny |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpatialBench: Can Agents Analyze Real-World Spatial Biology Data?
por: Workman, Kenny, et al.
Publicado: (2025)
por: Workman, Kenny, et al.
Publicado: (2025)
scBench: Evaluating AI Agents on Single-Cell RNA-seq Analysis
por: Workman, Kenny, et al.
Publicado: (2026)
por: Workman, Kenny, et al.
Publicado: (2026)
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
por: Zhang, Yinger, et al.
Publicado: (2026)
por: Zhang, Yinger, et al.
Publicado: (2026)
NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks
por: Zheng, Zihan, et al.
Publicado: (2025)
por: Zheng, Zihan, et al.
Publicado: (2025)
Spatially Grounded Long-Horizon Task Planning in the Wild
por: Jung, Sehun, et al.
Publicado: (2026)
por: Jung, Sehun, et al.
Publicado: (2026)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
por: Luo, Haotian, et al.
Publicado: (2025)
por: Luo, Haotian, et al.
Publicado: (2025)
LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning
por: Motwani, Sumeet Ramesh, et al.
Publicado: (2026)
por: Motwani, Sumeet Ramesh, et al.
Publicado: (2026)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
por: Zhang, Zijing, et al.
Publicado: (2025)
por: Zhang, Zijing, et al.
Publicado: (2025)
LifeBench: A Benchmark for Long-Horizon Multi-Source Memory
por: Cheng, Zihao, et al.
Publicado: (2026)
por: Cheng, Zihao, et al.
Publicado: (2026)
AgentLAB: Benchmarking LLM Agents against Long-Horizon Attacks
por: Jiang, Tanqiu, et al.
Publicado: (2026)
por: Jiang, Tanqiu, et al.
Publicado: (2026)
KellyBench: A Benchmark for Long-Horizon Sequential Decision Making
por: Grady, Thomas, et al.
Publicado: (2026)
por: Grady, Thomas, et al.
Publicado: (2026)
MinePlanner: A Benchmark for Long-Horizon Planning in Large Minecraft Worlds
por: Hill, William, et al.
Publicado: (2023)
por: Hill, William, et al.
Publicado: (2023)
ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering
por: Imajuku, Yuki, et al.
Publicado: (2025)
por: Imajuku, Yuki, et al.
Publicado: (2025)
Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue
por: Lin, Jingjie, et al.
Publicado: (2026)
por: Lin, Jingjie, et al.
Publicado: (2026)
HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds
por: Anokhin, Petr, et al.
Publicado: (2025)
por: Anokhin, Petr, et al.
Publicado: (2025)
LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
por: Xiao, Zikai, et al.
Publicado: (2025)
por: Xiao, Zikai, et al.
Publicado: (2025)
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
por: Jiayang, Cheng, et al.
Publicado: (2026)
por: Jiayang, Cheng, et al.
Publicado: (2026)
Can LLM Agents Be CFOs? Benchmarking Long-Horizon Resource Allocation in an Uncertain Enterprise Environment
por: Han, Yi, et al.
Publicado: (2026)
por: Han, Yi, et al.
Publicado: (2026)
When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution
por: Zhu, Zilin, et al.
Publicado: (2026)
por: Zhu, Zilin, et al.
Publicado: (2026)
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
por: Li, Xuzhao, et al.
Publicado: (2025)
por: Li, Xuzhao, et al.
Publicado: (2025)
When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents
por: Yan, Lu, et al.
Publicado: (2026)
por: Yan, Lu, et al.
Publicado: (2026)
BOSS: Benchmark for Observation Space Shift in Long-Horizon Task
por: Yang, Yue, et al.
Publicado: (2025)
por: Yang, Yue, et al.
Publicado: (2025)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
por: Li, Shuyue Stella, et al.
Publicado: (2026)
por: Li, Shuyue Stella, et al.
Publicado: (2026)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
por: Shen, Yuanzhe, et al.
Publicado: (2026)
por: Shen, Yuanzhe, et al.
Publicado: (2026)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
por: Li, Junlong, et al.
Publicado: (2025)
por: Li, Junlong, et al.
Publicado: (2025)
LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents
por: Lu, Yijun, et al.
Publicado: (2026)
por: Lu, Yijun, et al.
Publicado: (2026)
DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation
por: Xie, Sixiong, et al.
Publicado: (2026)
por: Xie, Sixiong, et al.
Publicado: (2026)
LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios
por: Chen, Tianyu, et al.
Publicado: (2026)
por: Chen, Tianyu, et al.
Publicado: (2026)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
por: Song, Yuanyi, et al.
Publicado: (2025)
por: Song, Yuanyi, et al.
Publicado: (2025)
λ: A Benchmark for Data-Efficiency in Long-Horizon Indoor Mobile Manipulation Robotics
por: Jaafar, Ahmed, et al.
Publicado: (2024)
por: Jaafar, Ahmed, et al.
Publicado: (2024)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
por: Zheng, Xinyi, et al.
Publicado: (2026)
por: Zheng, Xinyi, et al.
Publicado: (2026)
HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents
por: Zhang, Ningning, et al.
Publicado: (2026)
por: Zhang, Ningning, et al.
Publicado: (2026)
STRUCTUREDAGENT: Planning with AND/OR Trees for Long-Horizon Web Tasks
por: Lobo, ELita, et al.
Publicado: (2026)
por: Lobo, ELita, et al.
Publicado: (2026)
LEAD: Breaking the No-Recovery Bottleneck in Long-Horizon Reasoning
por: Pushkin, Denys, et al.
Publicado: (2026)
por: Pushkin, Denys, et al.
Publicado: (2026)
Learning Long-Horizon Predictions for Quadrotor Dynamics
por: Rao, Pratyaksh Prabhav, et al.
Publicado: (2024)
por: Rao, Pratyaksh Prabhav, et al.
Publicado: (2024)
PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models
por: Zhang, Ruizhi, et al.
Publicado: (2026)
por: Zhang, Ruizhi, et al.
Publicado: (2026)
Active Inference in Discrete State Spaces from First Principles
por: Kenny, Patrick
Publicado: (2025)
por: Kenny, Patrick
Publicado: (2025)
Episodic-Semantic Memory Architecture for Long-Horizon Scientific Agents
por: Milosevic, Nikola
Publicado: (2026)
por: Milosevic, Nikola
Publicado: (2026)
Can LLM Agents Sustain Long-Horizon Organizational Dynamics?
por: Zhu, Xuancheng, et al.
Publicado: (2026)
por: Zhu, Xuancheng, et al.
Publicado: (2026)
Parallel Context Compaction for Long-Horizon LLM Agent Serving
por: Cim, Musa, et al.
Publicado: (2026)
por: Cim, Musa, et al.
Publicado: (2026)
Ejemplares similares
-
SpatialBench: Can Agents Analyze Real-World Spatial Biology Data?
por: Workman, Kenny, et al.
Publicado: (2025) -
scBench: Evaluating AI Agents on Single-Cell RNA-seq Analysis
por: Workman, Kenny, et al.
Publicado: (2026) -
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
por: Zhang, Yinger, et al.
Publicado: (2026) -
NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks
por: Zheng, Zihan, et al.
Publicado: (2025) -
Spatially Grounded Long-Horizon Task Planning in the Wild
por: Jung, Sehun, et al.
Publicado: (2026)