Learning from Failures in Multi-Attempt Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Chung, Stephen, Du, Wenyu, Fu, Jie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Thinker: Learning to Think Fast and Slow
di: Chung, Stephen, et al.
Pubblicazione: (2025)
di: Chung, Stephen, et al.
Pubblicazione: (2025)
Unlocking Continual Learning Abilities in Language Models
di: Du, Wenyu, et al.
Pubblicazione: (2024)
di: Du, Wenyu, et al.
Pubblicazione: (2024)
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
Reinforcement Learning with Rubric Anchors
di: Huang, Zenan, et al.
Pubblicazione: (2025)
di: Huang, Zenan, et al.
Pubblicazione: (2025)
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024)
di: Feng, Xidong, et al.
Pubblicazione: (2024)
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024)
di: Feng, Xidong, et al.
Pubblicazione: (2024)
GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
di: Yin, Shangjian, et al.
Pubblicazione: (2026)
di: Yin, Shangjian, et al.
Pubblicazione: (2026)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models
di: Yeh, Cheng-Kai, et al.
Pubblicazione: (2025)
di: Yeh, Cheng-Kai, et al.
Pubblicazione: (2025)
Teaching Language Models to Critique via Reinforcement Learning
di: Xie, Zhihui, et al.
Pubblicazione: (2025)
di: Xie, Zhihui, et al.
Pubblicazione: (2025)
Learning to Hint for Reinforcement Learning
di: Xia, Yu, et al.
Pubblicazione: (2026)
di: Xia, Yu, et al.
Pubblicazione: (2026)
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
di: Wang, Ruiyi, et al.
Pubblicazione: (2025)
di: Wang, Ruiyi, et al.
Pubblicazione: (2025)
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
Reinforcement Learning Enhanced LLMs: A Survey
di: Wang, Shuhe, et al.
Pubblicazione: (2024)
di: Wang, Shuhe, et al.
Pubblicazione: (2024)
Knowledge Graph Reasoning with Self-supervised Reinforcement Learning
di: Ma, Ying, et al.
Pubblicazione: (2024)
di: Ma, Ying, et al.
Pubblicazione: (2024)
Forging the Forger: An Attempt to Improve Authorship Verification via Data Augmentation
di: Corbara, Silvia, et al.
Pubblicazione: (2024)
di: Corbara, Silvia, et al.
Pubblicazione: (2024)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
di: Sun, Zetian, et al.
Pubblicazione: (2025)
di: Sun, Zetian, et al.
Pubblicazione: (2025)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
di: Liu, Wei, et al.
Pubblicazione: (2025)
di: Liu, Wei, et al.
Pubblicazione: (2025)
Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought
di: Ildiz, Muhammed Emrullah, et al.
Pubblicazione: (2026)
di: Ildiz, Muhammed Emrullah, et al.
Pubblicazione: (2026)
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
di: Zhang, Kaiyi, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyi, et al.
Pubblicazione: (2025)
Reinforcement Learning with Backtracking Feedback
di: Sel, Bilgehan, et al.
Pubblicazione: (2026)
di: Sel, Bilgehan, et al.
Pubblicazione: (2026)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
di: Wu, Peilin, et al.
Pubblicazione: (2026)
di: Wu, Peilin, et al.
Pubblicazione: (2026)
EMORL: Ensemble Multi-Objective Reinforcement Learning for Efficient and Flexible LLM Fine-Tuning
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
di: Dong, Guanting, et al.
Pubblicazione: (2025)
di: Dong, Guanting, et al.
Pubblicazione: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning
di: Beutel, Alex, et al.
Pubblicazione: (2024)
di: Beutel, Alex, et al.
Pubblicazione: (2024)
Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling
di: Guo, Yiran, et al.
Pubblicazione: (2026)
di: Guo, Yiran, et al.
Pubblicazione: (2026)
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
di: Zheng, Yuxiang, et al.
Pubblicazione: (2025)
di: Zheng, Yuxiang, et al.
Pubblicazione: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
di: Lu, Yao, et al.
Pubblicazione: (2026)
di: Lu, Yao, et al.
Pubblicazione: (2026)
Parameter Efficient Reinforcement Learning from Human Feedback
di: Sidahmed, Hakim, et al.
Pubblicazione: (2024)
di: Sidahmed, Hakim, et al.
Pubblicazione: (2024)
Are Large Language Models Chameleons? An Attempt to Simulate Social Surveys
di: Geng, Mingmeng, et al.
Pubblicazione: (2024)
di: Geng, Mingmeng, et al.
Pubblicazione: (2024)
SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
di: Liu, Bo, et al.
Pubblicazione: (2025)
di: Liu, Bo, et al.
Pubblicazione: (2025)
Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
di: Zhang, Haozhen, et al.
Pubblicazione: (2025)
di: Zhang, Haozhen, et al.
Pubblicazione: (2025)
MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning
di: Chen, Guoxin, et al.
Pubblicazione: (2025)
di: Chen, Guoxin, et al.
Pubblicazione: (2025)
Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning
di: Li, Junsong, et al.
Pubblicazione: (2025)
di: Li, Junsong, et al.
Pubblicazione: (2025)
HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning
di: Lu, Zhicong, et al.
Pubblicazione: (2026)
di: Lu, Zhicong, et al.
Pubblicazione: (2026)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
di: Wang, Yiping, et al.
Pubblicazione: (2025)
di: Wang, Yiping, et al.
Pubblicazione: (2025)
Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
di: Wu, Mingqi, et al.
Pubblicazione: (2025)
di: Wu, Mingqi, et al.
Pubblicazione: (2025)
Reinforcement Learning on Pre-Training Data
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Thinker: Learning to Think Fast and Slow
di: Chung, Stephen, et al.
Pubblicazione: (2025) -
Unlocking Continual Learning Abilities in Language Models
di: Du, Wenyu, et al.
Pubblicazione: (2024) -
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025) -
Reinforcement Learning with Rubric Anchors
di: Huang, Zenan, et al.
Pubblicazione: (2025) -
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024)