Reinforcement Learning for Long-Horizon Interactive LLM Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Kevin, Cusumano-Towner, Marco, Huval, Brody, Petrenko, Aleksei, Hamburger, Jackson, Koltun, Vladlen, Krähenbühl, Philipp |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Robust Autonomy Emerges from Self-Play
por: Cusumano-Towner, Marco, et al.
Publicado: (2025)
por: Cusumano-Towner, Marco, et al.
Publicado: (2025)
Entropy-Preserving Reinforcement Learning
por: Petrenko, Aleksei, et al.
Publicado: (2026)
por: Petrenko, Aleksei, et al.
Publicado: (2026)
Cut Your Losses in Large-Vocabulary Language Models
por: Wijmans, Erik, et al.
Publicado: (2024)
por: Wijmans, Erik, et al.
Publicado: (2024)
Do multimodal models imagine electric sheep?
por: Ramakrishnan, Santhosh Kumar, et al.
Publicado: (2026)
por: Ramakrishnan, Santhosh Kumar, et al.
Publicado: (2026)
Does Spatial Cognition Emerge in Frontier Models?
por: Ramakrishnan, Santhosh Kumar, et al.
Publicado: (2024)
por: Ramakrishnan, Santhosh Kumar, et al.
Publicado: (2024)
OpenBot-Fleet: A System for Collective Learning with Real Robots
por: Müller, Matthias, et al.
Publicado: (2024)
por: Müller, Matthias, et al.
Publicado: (2024)
Proximal Policy Gradient Arborescence for Quality Diversity Reinforcement Learning
por: Batra, Sumeet, et al.
Publicado: (2023)
por: Batra, Sumeet, et al.
Publicado: (2023)
Hindsight Credit Assignment for Long-Horizon LLM Agents
por: Tan, Hui-Ze, et al.
Publicado: (2026)
por: Tan, Hui-Ze, et al.
Publicado: (2026)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
por: Zhang, Zijing, et al.
Publicado: (2025)
por: Zhang, Zijing, et al.
Publicado: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Trust Region Masking for Long-Horizon LLM Reinforcement Learning
por: Li, Yingru, et al.
Publicado: (2025)
por: Li, Yingru, et al.
Publicado: (2025)
HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents
por: Jin, Hongbo, et al.
Publicado: (2026)
por: Jin, Hongbo, et al.
Publicado: (2026)
Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents
por: Gao, Heyang, et al.
Publicado: (2025)
por: Gao, Heyang, et al.
Publicado: (2025)
Interactive Post-Training for Vision-Language-Action Models
por: Tan, Shuhan, et al.
Publicado: (2025)
por: Tan, Shuhan, et al.
Publicado: (2025)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
por: Shen, Yuanzhe, et al.
Publicado: (2026)
por: Shen, Yuanzhe, et al.
Publicado: (2026)
Intrinsic Credit Assignment for Long Horizon Interaction
por: Auzina, Ilze Amanda, et al.
Publicado: (2026)
por: Auzina, Ilze Amanda, et al.
Publicado: (2026)
Can We Rely on LLM Agents to Draft Long-Horizon Plans? Let's Take TravelPlanner as an Example
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
A Subgoal-driven Framework for Improving Long-Horizon LLM Agents
por: Wang, Taiyi, et al.
Publicado: (2026)
por: Wang, Taiyi, et al.
Publicado: (2026)
Tree Search for LLM Agent Reinforcement Learning
por: Ji, Yuxiang, et al.
Publicado: (2025)
por: Ji, Yuxiang, et al.
Publicado: (2025)
Strict Subgoal Execution: Reliable Long-Horizon Planning in Hierarchical Reinforcement Learning
por: Hwang, Jaebak, et al.
Publicado: (2025)
por: Hwang, Jaebak, et al.
Publicado: (2025)
Horizon Generalization in Reinforcement Learning
por: Myers, Vivek, et al.
Publicado: (2025)
por: Myers, Vivek, et al.
Publicado: (2025)
Conformation Generation using Transformer Flows
por: Shah, Sohil Atul, et al.
Publicado: (2024)
por: Shah, Sohil Atul, et al.
Publicado: (2024)
On the Effective Horizon of Inverse Reinforcement Learning
por: Xu, Yiqing, et al.
Publicado: (2023)
por: Xu, Yiqing, et al.
Publicado: (2023)
Planning Transformer: Long-Horizon Offline Reinforcement Learning with Planning Tokens
por: Clinton, Joseph, et al.
Publicado: (2024)
por: Clinton, Joseph, et al.
Publicado: (2024)
SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks
por: Wen, Yongyan, et al.
Publicado: (2024)
por: Wen, Yongyan, et al.
Publicado: (2024)
Deep Active Inference Agents for Delayed and Long-Horizon Environments
por: Yeganeh, Yavar Taheri, et al.
Publicado: (2025)
por: Yeganeh, Yavar Taheri, et al.
Publicado: (2025)
Random Policy Enables In-Context Reinforcement Learning within Trust Horizons
por: Chen, Weiqin, et al.
Publicado: (2024)
por: Chen, Weiqin, et al.
Publicado: (2024)
AgentFold: Long-Horizon Web Agents with Proactive Context Management
por: Ye, Rui, et al.
Publicado: (2025)
por: Ye, Rui, et al.
Publicado: (2025)
Offline Reinforcement Learning with Universal Horizon Models
por: Chung, Hojun, et al.
Publicado: (2026)
por: Chung, Hojun, et al.
Publicado: (2026)
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
por: Li, Yingru, et al.
Publicado: (2026)
por: Li, Yingru, et al.
Publicado: (2026)
Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
por: Wang, Zehong, et al.
Publicado: (2026)
por: Wang, Zehong, et al.
Publicado: (2026)
Interaction Pattern Disentangling for Multi-Agent Reinforcement Learning
por: Liu, Shunyu, et al.
Publicado: (2022)
por: Liu, Shunyu, et al.
Publicado: (2022)
Learning Multi-Agent Loco-Manipulation for Long-Horizon Quadrupedal Pushing
por: Feng, Yuming, et al.
Publicado: (2024)
por: Feng, Yuming, et al.
Publicado: (2024)
SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training
por: He, Zhongyu, et al.
Publicado: (2026)
por: He, Zhongyu, et al.
Publicado: (2026)
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
por: Liu, Zexi, et al.
Publicado: (2025)
por: Liu, Zexi, et al.
Publicado: (2025)
FoldAct: Efficient and Stable Context Folding for Long-Horizon Search Agents
por: Shao, Jiaqi, et al.
Publicado: (2025)
por: Shao, Jiaqi, et al.
Publicado: (2025)
ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents
por: Pang, Cong, et al.
Publicado: (2026)
por: Pang, Cong, et al.
Publicado: (2026)
Toward Cost-efficient Adaptive Clinical Trials in Knee Osteoarthritis with Reinforcement Learning
por: Nguyen, Khanh, et al.
Publicado: (2024)
por: Nguyen, Khanh, et al.
Publicado: (2024)
Long-term Traffic Simulation with Interleaved Autoregressive Motion and Scenario Generation
por: Yang, Xiuyu, et al.
Publicado: (2025)
por: Yang, Xiuyu, et al.
Publicado: (2025)
Agent AI: Surveying the Horizons of Multimodal Interaction
por: Durante, Zane, et al.
Publicado: (2024)
por: Durante, Zane, et al.
Publicado: (2024)
Ejemplares similares
-
Robust Autonomy Emerges from Self-Play
por: Cusumano-Towner, Marco, et al.
Publicado: (2025) -
Entropy-Preserving Reinforcement Learning
por: Petrenko, Aleksei, et al.
Publicado: (2026) -
Cut Your Losses in Large-Vocabulary Language Models
por: Wijmans, Erik, et al.
Publicado: (2024) -
Do multimodal models imagine electric sheep?
por: Ramakrishnan, Santhosh Kumar, et al.
Publicado: (2026) -
Does Spatial Cognition Emerge in Frontier Models?
por: Ramakrishnan, Santhosh Kumar, et al.
Publicado: (2024)