Imitation Learning for Multi-turn LM Agents via On-policy Expert Corrections
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lauffer, Niklas, Deng, Xiang, Kundurthy, Srivatsa, Kenstler, Brad, Da, Jeff |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Symbolic Task Decompositions for Multi-Agent Teams
par: Shah, Ameesh, et autres
Publié: (2025)
par: Shah, Ameesh, et autres
Publié: (2025)
Provably Correct Automata Embeddings for Optimal Automata-Conditioned Reinforcement Learning
par: Yalcinkaya, Beyazit, et autres
Publié: (2025)
par: Yalcinkaya, Beyazit, et autres
Publié: (2025)
Learning with Expert Abstractions for Efficient Multi-Task Continuous Control
par: Jewett, Jeff, et autres
Publié: (2025)
par: Jewett, Jeff, et autres
Publié: (2025)
Causal Imitation Learning under Expert-Observable and Expert-Unobservable Confounding
par: Shao, Daqian, et autres
Publié: (2025)
par: Shao, Daqian, et autres
Publié: (2025)
Thought Cloning: Learning to Think while Acting by Imitating Human Thinking
par: Hu, Shengran, et autres
Publié: (2023)
par: Hu, Shengran, et autres
Publié: (2023)
SpreadsheetArena: Decomposing Preference in LLM Generation of Spreadsheet Workbooks
par: Kundurthy, Srivatsa, et autres
Publié: (2026)
par: Kundurthy, Srivatsa, et autres
Publié: (2026)
Using Non-Expert Data to Robustify Imitation Learning via Offline Reinforcement Learning
par: Huang, Kevin, et autres
Publié: (2025)
par: Huang, Kevin, et autres
Publié: (2025)
IDIL: Imitation Learning of Intent-Driven Expert Behavior
par: Seo, Sangwon, et autres
Publié: (2024)
par: Seo, Sangwon, et autres
Publié: (2024)
Sample-Efficient Expert Query Control in Active Imitation Learning via Conformal Prediction
par: Firouzkouhi, Arad, et autres
Publié: (2025)
par: Firouzkouhi, Arad, et autres
Publié: (2025)
Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization
par: Li, Yu, et autres
Publié: (2026)
par: Li, Yu, et autres
Publié: (2026)
Learning Strategy Representation for Imitation Learning in Multi-Agent Games
par: Lei, Shiqi, et autres
Publié: (2024)
par: Lei, Shiqi, et autres
Publié: (2024)
Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration
par: Zhao, Heyang, et autres
Publié: (2025)
par: Zhao, Heyang, et autres
Publié: (2025)
Coupled Distributional Random Expert Distillation for World Model Online Imitation Learning
par: Li, Shangzhe, et autres
Publié: (2025)
par: Li, Shangzhe, et autres
Publié: (2025)
Compositional Automata Embeddings for Goal-Conditioned Reinforcement Learning
par: Yalcinkaya, Beyazit, et autres
Publié: (2024)
par: Yalcinkaya, Beyazit, et autres
Publié: (2024)
MAPF-GPT: Imitation Learning for Multi-Agent Pathfinding at Scale
par: Andreychuk, Anton, et autres
Publié: (2024)
par: Andreychuk, Anton, et autres
Publié: (2024)
SENSOR: Imitate Third-Person Expert's Behaviors via Active Sensoring
par: Huang, Kaichen, et autres
Publié: (2024)
par: Huang, Kaichen, et autres
Publié: (2024)
Scaling Laws for Imitation Learning in Single-Agent Games
par: Tuyls, Jens, et autres
Publié: (2023)
par: Tuyls, Jens, et autres
Publié: (2023)
TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
par: Wang, Jiaqi, et autres
Publié: (2026)
par: Wang, Jiaqi, et autres
Publié: (2026)
Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations
par: Hoang, Huy, et autres
Publié: (2025)
par: Hoang, Huy, et autres
Publié: (2025)
Imitation Learning via Focused Satisficing
par: Shah, Rushit N., et autres
Publié: (2025)
par: Shah, Rushit N., et autres
Publié: (2025)
Boolean Satisfiability via Imitation Learning
par: Zhang, Zewei, et autres
Publié: (2025)
par: Zhang, Zewei, et autres
Publié: (2025)
Adversarial Imitation Learning via Boosting
par: Chang, Jonathan D., et autres
Publié: (2024)
par: Chang, Jonathan D., et autres
Publié: (2024)
Identifying the Risks of LM Agents with an LM-Emulated Sandbox
par: Ruan, Yangjun, et autres
Publié: (2023)
par: Ruan, Yangjun, et autres
Publié: (2023)
AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents
par: Ma, Chang, et autres
Publié: (2024)
par: Ma, Chang, et autres
Publié: (2024)
Learning Representations in Video Game Agents with Supervised Contrastive Imitation Learning
par: Celemin, Carlos, et autres
Publié: (2025)
par: Celemin, Carlos, et autres
Publié: (2025)
Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting
par: Hu, Michael Y., et autres
Publié: (2025)
par: Hu, Michael Y., et autres
Publié: (2025)
Reinforcement Learning via Implicit Imitation Guidance
par: Dong, Perry, et autres
Publié: (2025)
par: Dong, Perry, et autres
Publié: (2025)
Unveiling the Role of Expert Guidance: A Comparative Analysis of User-centered Imitation Learning and Traditional Reinforcement Learning
par: Gomaa, Amr, et autres
Publié: (2024)
par: Gomaa, Amr, et autres
Publié: (2024)
DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning
par: Guo, Ke, et autres
Publié: (2025)
par: Guo, Ke, et autres
Publié: (2025)
Offline Imitation of Badminton Player Behavior via Experiential Contexts and Brownian Motion
par: Wang, Kuang-Da, et autres
Publié: (2024)
par: Wang, Kuang-Da, et autres
Publié: (2024)
SpectR: Dynamically Composing LM Experts with Spectral Routing
par: Fleshman, William, et autres
Publié: (2025)
par: Fleshman, William, et autres
Publié: (2025)
Imitation Learning Datasets: A Toolkit For Creating Datasets, Training Agents and Benchmarking
par: Gavenski, Nathan, et autres
Publié: (2024)
par: Gavenski, Nathan, et autres
Publié: (2024)
Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation
par: Li, Pengxiang, et autres
Publié: (2025)
par: Li, Pengxiang, et autres
Publié: (2025)
Learning Soft Driving Constraints from Vectorized Scene Embeddings while Imitating Expert Trajectories
par: Mobarakeh, Niloufar Saeidi, et autres
Publié: (2024)
par: Mobarakeh, Niloufar Saeidi, et autres
Publié: (2024)
Error-Feedback Model for Output Correction in Bilateral Control-Based Imitation Learning
par: Sato, Hiroshi, et autres
Publié: (2024)
par: Sato, Hiroshi, et autres
Publié: (2024)
Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning
par: Castagna, Alberto
Publié: (2025)
par: Castagna, Alberto
Publié: (2025)
Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Imitation Learning from Suboptimal Demonstrations via Meta-Learning An Action Ranker
par: Fan, Jiangdong, et autres
Publié: (2024)
par: Fan, Jiangdong, et autres
Publié: (2024)
Quantifying Generalisation in Imitation Learning
par: Gavenski, Nathan, et autres
Publié: (2025)
par: Gavenski, Nathan, et autres
Publié: (2025)
Imitation Bootstrapped Reinforcement Learning
par: Hu, Hengyuan, et autres
Publié: (2023)
par: Hu, Hengyuan, et autres
Publié: (2023)
Documents similaires
-
Learning Symbolic Task Decompositions for Multi-Agent Teams
par: Shah, Ameesh, et autres
Publié: (2025) -
Provably Correct Automata Embeddings for Optimal Automata-Conditioned Reinforcement Learning
par: Yalcinkaya, Beyazit, et autres
Publié: (2025) -
Learning with Expert Abstractions for Efficient Multi-Task Continuous Control
par: Jewett, Jeff, et autres
Publié: (2025) -
Causal Imitation Learning under Expert-Observable and Expert-Unobservable Confounding
par: Shao, Daqian, et autres
Publié: (2025) -
Thought Cloning: Learning to Think while Acting by Imitating Human Thinking
par: Hu, Shengran, et autres
Publié: (2023)