EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Xavier, Xia, Jinxiang, Xu, Shengze, Song, Kangqi, Yuan, Yishuo, Zhang, Guibin, Ren, JinCheng, Feng, Boyu, Lu, Li, Zeng, Tieyong, Liu, Jiaheng, Liu, Minghao, Zhu, He, Jiang, Yuchen Eleanor, Wang, Wei, Zhou, Wangchunshu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DGNN: A Neural PDE Solver Induced by Discontinuous Galerkin Methods
por: Chen, Guanyu, et al.
Publicado: (2025)
por: Chen, Guanyu, et al.
Publicado: (2025)
An Improved Optimal Proximal Gradient Algorithm for Non-Blind Image Deblurring
por: Wang, Qingsong, et al.
Publicado: (2025)
por: Wang, Qingsong, et al.
Publicado: (2025)
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization
por: Chen, Qianben, et al.
Publicado: (2026)
por: Chen, Qianben, et al.
Publicado: (2026)
Flash-Searcher: Fast and Effective Web Agents via DAG-Based Parallel Execution
por: Qin, Tianrui, et al.
Publicado: (2025)
por: Qin, Tianrui, et al.
Publicado: (2025)
O-Mem: Omni Memory System for Personalized, Long Horizon, Self-Evolving Agents
por: Wang, Piaohong, et al.
Publicado: (2025)
por: Wang, Piaohong, et al.
Publicado: (2025)
The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs
por: Sinha, Akshit, et al.
Publicado: (2025)
por: Sinha, Akshit, et al.
Publicado: (2025)
PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models
por: Zhang, Ruizhi, et al.
Publicado: (2026)
por: Zhang, Ruizhi, et al.
Publicado: (2026)
How Far Are We from Genuinely Useful Deep Research Agents?
por: Zhang, Dingling, et al.
Publicado: (2025)
por: Zhang, Dingling, et al.
Publicado: (2025)
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
por: Jiayang, Cheng, et al.
Publicado: (2026)
por: Jiayang, Cheng, et al.
Publicado: (2026)
AlphaCrafter: A Full-Stack Multi-Agent Framework for Cross-Sectional Quantitative Trading
por: Yuan, Yishuo, et al.
Publicado: (2026)
por: Yuan, Yishuo, et al.
Publicado: (2026)
ACADREASON: Exploring the Limits of Reasoning Models with Academic Research Problems
por: Gui, Xin, et al.
Publicado: (2025)
por: Gui, Xin, et al.
Publicado: (2025)
AI PERSONA: Towards Life-long Personalization of LLMs
por: Wang, Tiannan, et al.
Publicado: (2024)
por: Wang, Tiannan, et al.
Publicado: (2024)
The Illusion of Procedural Reasoning: Measuring Long-Horizon FSM Execution in LLMs
por: Samiei, Mahdi, et al.
Publicado: (2025)
por: Samiei, Mahdi, et al.
Publicado: (2025)
Strict Subgoal Execution: Reliable Long-Horizon Planning in Hierarchical Reinforcement Learning
por: Hwang, Jaebak, et al.
Publicado: (2025)
por: Hwang, Jaebak, et al.
Publicado: (2025)
A-MapReduce: Executing Wide Search via Agentic MapReduce
por: Chen, Mingju, et al.
Publicado: (2026)
por: Chen, Mingju, et al.
Publicado: (2026)
Long-Horizon Plan Execution in Large Tool Spaces through Entropy-Guided Branching
por: Wei, Rongzhe, et al.
Publicado: (2026)
por: Wei, Rongzhe, et al.
Publicado: (2026)
GEM: A Gym for Agentic LLMs
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
Empowering LLMs with Parameterized Skills for Adversarial Long-Horizon Planning
por: Cui, Sijia, et al.
Publicado: (2025)
por: Cui, Sijia, et al.
Publicado: (2025)
AutoAct: Automatic Agent Learning from Scratch for QA via Self-Planning
por: Qiao, Shuofei, et al.
Publicado: (2024)
por: Qiao, Shuofei, et al.
Publicado: (2024)
From Dialogue to Execution: Mixture-of-Agents Assisted Interactive Planning for Behavior Tree-Based Long-Horizon Robot Execution
por: Suzuki, Kanata, et al.
Publicado: (2026)
por: Suzuki, Kanata, et al.
Publicado: (2026)
Scaling Test-time Compute for LLM Agents
por: Zhu, King, et al.
Publicado: (2025)
por: Zhu, King, et al.
Publicado: (2025)
OAgents: An Empirical Study of Building Effective Agents
por: Zhu, He, et al.
Publicado: (2025)
por: Zhu, He, et al.
Publicado: (2025)
Efficient Agents: Building Effective Agents While Reducing Cost
por: Wang, Ningning, et al.
Publicado: (2025)
por: Wang, Ningning, et al.
Publicado: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Human and AI Perceptual Differences in Image Classification Errors
por: Liu, Minghao, et al.
Publicado: (2023)
por: Liu, Minghao, et al.
Publicado: (2023)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
por: Wang, Chengyao, et al.
Publicado: (2025)
por: Wang, Chengyao, et al.
Publicado: (2025)
MiCoTA: Bridging the Learnability Gap with Intermediate CoT and Teacher Assistants
por: Ding, Dongyi, et al.
Publicado: (2025)
por: Ding, Dongyi, et al.
Publicado: (2025)
PersonaFeedback: A Large-scale Human-annotated Benchmark For Personalization
por: Tao, Meiling, et al.
Publicado: (2025)
por: Tao, Meiling, et al.
Publicado: (2025)
Towards Faithful and Controllable Personalization via Critique-Post-Edit Reinforcement Learning
por: Zhu, Chenghao, et al.
Publicado: (2025)
por: Zhu, Chenghao, et al.
Publicado: (2025)
Can GRPO Help LLMs Transcend Their Pretraining Origin?
por: Ni, Kangqi, et al.
Publicado: (2025)
por: Ni, Kangqi, et al.
Publicado: (2025)
Long-Horizon Manipulation via Trace-Conditioned VLA Planning
por: Liu, Isabella, et al.
Publicado: (2026)
por: Liu, Isabella, et al.
Publicado: (2026)
Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
por: Deng, Zehao, et al.
Publicado: (2025)
por: Deng, Zehao, et al.
Publicado: (2025)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
por: Li, Junlong, et al.
Publicado: (2025)
por: Li, Junlong, et al.
Publicado: (2025)
AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
por: Zhang, Guibin, et al.
Publicado: (2025)
por: Zhang, Guibin, et al.
Publicado: (2025)
TaskCraft: Automated Generation of Agentic Tasks
por: Shi, Dingfeng, et al.
Publicado: (2025)
por: Shi, Dingfeng, et al.
Publicado: (2025)
Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection
por: Liu, Zhen, et al.
Publicado: (2026)
por: Liu, Zhen, et al.
Publicado: (2026)
When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution
por: Zhu, Zilin, et al.
Publicado: (2026)
por: Zhu, Zilin, et al.
Publicado: (2026)
PersonaGym: Evaluating Persona Agents and LLMs
por: Samuel, Vinay, et al.
Publicado: (2024)
por: Samuel, Vinay, et al.
Publicado: (2024)
Gym-V: A Unified Vision Environment System for Agentic Vision Research
por: Meng, Fanqing, et al.
Publicado: (2026)
por: Meng, Fanqing, et al.
Publicado: (2026)
Double-P: Hierarchical Top-P Sparse Attention for Long-Context LLMs
por: Ni, Wentao, et al.
Publicado: (2026)
por: Ni, Wentao, et al.
Publicado: (2026)
Ejemplares similares
-
DGNN: A Neural PDE Solver Induced by Discontinuous Galerkin Methods
por: Chen, Guanyu, et al.
Publicado: (2025) -
An Improved Optimal Proximal Gradient Algorithm for Non-Blind Image Deblurring
por: Wang, Qingsong, et al.
Publicado: (2025) -
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization
por: Chen, Qianben, et al.
Publicado: (2026) -
Flash-Searcher: Fast and Effective Web Agents via DAG-Based Parallel Execution
por: Qin, Tianrui, et al.
Publicado: (2025) -
O-Mem: Omni Memory System for Personalized, Long Horizon, Self-Evolving Agents
por: Wang, Piaohong, et al.
Publicado: (2025)