Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Kongcheng, Yao, Qi, Liu, Shunyu, Zhang, Wenjian, Cen, Min, Zhou, Yang, Fang, Wenkai, Zhao, Yiru, Lai, Baisheng, Song, Mingli |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Reasoning with Reinforced Functional Token Tuning
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs
by: Zhang, Wenjian, et al.
Published: (2026)
by: Zhang, Wenjian, et al.
Published: (2026)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
by: Fang, Wenkai, et al.
Published: (2025)
by: Fang, Wenkai, et al.
Published: (2025)
Odyssey: Empowering Minecraft Agents with Open-World Skills
by: Liu, Shunyu, et al.
Published: (2024)
by: Liu, Shunyu, et al.
Published: (2024)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
by: Zhou, Yang, et al.
Published: (2025)
by: Zhou, Yang, et al.
Published: (2025)
A Survey of Direct Preference Optimization
by: Liu, Shunyu, et al.
Published: (2025)
by: Liu, Shunyu, et al.
Published: (2025)
Reinforced Model Merging
by: Han, Jiaqi, et al.
Published: (2025)
by: Han, Jiaqi, et al.
Published: (2025)
Interaction Pattern Disentangling for Multi-Agent Reinforcement Learning
by: Liu, Shunyu, et al.
Published: (2022)
by: Liu, Shunyu, et al.
Published: (2022)
Contextual Experience Replay for Self-Improvement of Language Agents
by: Liu, Yitao, et al.
Published: (2025)
by: Liu, Yitao, et al.
Published: (2025)
A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges
by: Qing, Yunpeng, et al.
Published: (2022)
by: Qing, Yunpeng, et al.
Published: (2022)
A2PO: Towards Effective Offline Reinforcement Learning from an Advantage-aware Perspective
by: Qing, Yunpeng, et al.
Published: (2024)
by: Qing, Yunpeng, et al.
Published: (2024)
Sample Efficient Experience Replay in Non-stationary Environments
by: Duan, Tianyang, et al.
Published: (2025)
by: Duan, Tianyang, et al.
Published: (2025)
Parallelized Planning-Acting for Efficient LLM-based Multi-Agent Systems in Minecraft
by: Li, Yaoru, et al.
Published: (2025)
by: Li, Yaoru, et al.
Published: (2025)
Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning
by: Xu, Linjie, et al.
Published: (2024)
by: Xu, Linjie, et al.
Published: (2024)
RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
by: Zhang, Hongzhi, et al.
Published: (2025)
by: Zhang, Hongzhi, et al.
Published: (2025)
Transmission Interface Power Flow Adjustment: A Deep Reinforcement Learning Approach based on Multi-task Attribution Map
by: Liu, Shunyu, et al.
Published: (2024)
by: Liu, Shunyu, et al.
Published: (2024)
Bi-level Mean Field: Dynamic Grouping for Large-Scale MARL
by: Zheng, Yuxuan, et al.
Published: (2025)
by: Zheng, Yuxuan, et al.
Published: (2025)
Temporal Prototype-Aware Learning for Active Voltage Control on Power Distribution Networks
by: Xu, Feiyang, et al.
Published: (2024)
by: Xu, Feiyang, et al.
Published: (2024)
Unveiling Global Interactive Patterns across Graphs: Towards Interpretable Graph Neural Networks
by: Wang, Yuwen, et al.
Published: (2024)
by: Wang, Yuwen, et al.
Published: (2024)
COLA: Cross-city Mobility Transformer for Human Trajectory Simulation
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
Efficient Reinforcement Learning using Linear Koopman Dynamics for Nonlinear Robotic Systems
by: Hao, Wenjian, et al.
Published: (2026)
by: Hao, Wenjian, et al.
Published: (2026)
Efficient Diversity-based Experience Replay for Deep Reinforcement Learning
by: Zhao, Kaiyan, et al.
Published: (2024)
by: Zhao, Kaiyan, et al.
Published: (2024)
Is Centralized Training with Decentralized Execution Framework Centralized Enough for MARL?
by: Zhou, Yihe, et al.
Published: (2023)
by: Zhou, Yihe, et al.
Published: (2023)
EFRame: Deeper Reasoning via Exploration-Filter-Replay Reinforcement Learning Framework
by: Wang, Chen, et al.
Published: (2025)
by: Wang, Chen, et al.
Published: (2025)
Notes on solvable models of many-body quantum chaos
by: Yao, Shunyu
Published: (2024)
by: Yao, Shunyu
Published: (2024)
Ask-AC: An Initiative Advisor-in-the-Loop Actor-Critic Framework
by: Liu, Shunyu, et al.
Published: (2022)
by: Liu, Shunyu, et al.
Published: (2022)
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
by: Peng, Hao, et al.
Published: (2025)
by: Peng, Hao, et al.
Published: (2025)
Sample-efficient LLM Optimization with Reset Replay
by: Liu, Zichuan, et al.
Published: (2025)
by: Liu, Zichuan, et al.
Published: (2025)
Exploration of Enterprise Big Data Microservice Architecture Based on Domain-Driven Design (DDD)
by: Zhang, Yiru
Published: (2025)
by: Zhang, Yiru
Published: (2025)
GeRe: Towards Efficient Anti-Forgetting in Continual Learning of LLM via General Samples Replay
by: Zhang, Yunan, et al.
Published: (2025)
by: Zhang, Yunan, et al.
Published: (2025)
Powerformer: A Section-adaptive Transformer for Power Flow Adjustment
by: Chen, Kaixuan, et al.
Published: (2024)
by: Chen, Kaixuan, et al.
Published: (2024)
Dancing in Chains: Reconciling Instruction Following and Faithfulness in Language Models
by: Wu, Zhengxuan, et al.
Published: (2024)
by: Wu, Zhengxuan, et al.
Published: (2024)
Adaptive Replay Buffer for Offline-to-Online Reinforcement Learning
by: Song, Chihyeon, et al.
Published: (2025)
by: Song, Chihyeon, et al.
Published: (2025)
Learning a Mini-batch Graph Transformer via Two-stage Interaction Augmentation
by: Li, Wenda, et al.
Published: (2024)
by: Li, Wenda, et al.
Published: (2024)
Simple Graph Condensation
by: Xiao, Zhenbang, et al.
Published: (2024)
by: Xiao, Zhenbang, et al.
Published: (2024)
Parrot: Enhancing Multi-Turn Instruction Following for Large Language Models
by: Sun, Yuchong, et al.
Published: (2023)
by: Sun, Yuchong, et al.
Published: (2023)
Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling
by: Qi, Han, et al.
Published: (2025)
by: Qi, Han, et al.
Published: (2025)
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
by: Zhang, Xinyao, et al.
Published: (2026)
by: Zhang, Xinyao, et al.
Published: (2026)
Improved Regret for Bandit Convex Optimization with Delayed Feedback
by: Wan, Yuanyu, et al.
Published: (2024)
by: Wan, Yuanyu, et al.
Published: (2024)
Similar Items
-
Reasoning with Reinforced Functional Token Tuning
by: Zhang, Kongcheng, et al.
Published: (2025) -
Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs
by: Zhang, Wenjian, et al.
Published: (2026) -
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
by: Zhang, Kongcheng, et al.
Published: (2025) -
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
by: Fang, Wenkai, et al.
Published: (2025) -
Odyssey: Empowering Minecraft Agents with Open-World Skills
by: Liu, Shunyu, et al.
Published: (2024)