ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Ruiyang, Li, Shuozhe, Zhang, Amy, Leqi, Liu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models
von: Li, Shuozhe, et al.
Veröffentlicht: (2026)
von: Li, Shuozhe, et al.
Veröffentlicht: (2026)
ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection
von: Mei, Jingbiao, et al.
Veröffentlicht: (2025)
von: Mei, Jingbiao, et al.
Veröffentlicht: (2025)
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
von: Pathak, Manas, et al.
Veröffentlicht: (2026)
von: Pathak, Manas, et al.
Veröffentlicht: (2026)
A Learnable Wavelet Transformer for Long-Short Equity Trading and Risk-Adjusted Return Optimization
von: Li, Shuozhe, et al.
Veröffentlicht: (2026)
von: Li, Shuozhe, et al.
Veröffentlicht: (2026)
Personalized Language Modeling from Personalized Human Feedback
von: Li, Xinyu, et al.
Veröffentlicht: (2024)
von: Li, Xinyu, et al.
Veröffentlicht: (2024)
Learning Robust Reasoning through Guided Adversarial Self-Play
von: Li, Shuozhe, et al.
Veröffentlicht: (2026)
von: Li, Shuozhe, et al.
Veröffentlicht: (2026)
Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention
von: Chang, Shuochen, et al.
Veröffentlicht: (2026)
von: Chang, Shuochen, et al.
Veröffentlicht: (2026)
Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
von: Parashar, Shubham, et al.
Veröffentlicht: (2025)
von: Parashar, Shubham, et al.
Veröffentlicht: (2025)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
von: Deng, Wenhao, et al.
Veröffentlicht: (2025)
von: Deng, Wenhao, et al.
Veröffentlicht: (2025)
Learn Hard Problems During RL with Reference Guided Fine-tuning
von: Wu, Yangzhen, et al.
Veröffentlicht: (2026)
von: Wu, Yangzhen, et al.
Veröffentlicht: (2026)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
von: Wu, Jinyang, et al.
Veröffentlicht: (2025)
von: Wu, Jinyang, et al.
Veröffentlicht: (2025)
S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning
von: Ma, Ruotian, et al.
Veröffentlicht: (2025)
von: Ma, Ruotian, et al.
Veröffentlicht: (2025)
SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
ExGRPO: Learning to Reason from Experience
von: Zhan, Runzhe, et al.
Veröffentlicht: (2025)
von: Zhan, Runzhe, et al.
Veröffentlicht: (2025)
Guiding Through Complexity: What Makes Good Supervision for Hard Math Reasoning Tasks?
von: He, Xuan, et al.
Veröffentlicht: (2024)
von: He, Xuan, et al.
Veröffentlicht: (2024)
Knowledge Graph Reasoning with Self-supervised Reinforcement Learning
von: Ma, Ying, et al.
Veröffentlicht: (2024)
von: Ma, Ying, et al.
Veröffentlicht: (2024)
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
von: Wu, Xixi, et al.
Veröffentlicht: (2026)
von: Wu, Xixi, et al.
Veröffentlicht: (2026)
Hypothesis Testing for Quantifying LLM-Human Misalignment in Multiple Choice Settings
von: Hong, Harbin, et al.
Veröffentlicht: (2025)
von: Hong, Harbin, et al.
Veröffentlicht: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
von: Chen, Huayu, et al.
Veröffentlicht: (2025)
von: Chen, Huayu, et al.
Veröffentlicht: (2025)
Reinforcing General Reasoning without Verifiers
von: Zhou, Xiangxin, et al.
Veröffentlicht: (2025)
von: Zhou, Xiangxin, et al.
Veröffentlicht: (2025)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
von: Deng, Hexuan, et al.
Veröffentlicht: (2025)
von: Deng, Hexuan, et al.
Veröffentlicht: (2025)
Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
von: Liu, Hanbing, et al.
Veröffentlicht: (2025)
von: Liu, Hanbing, et al.
Veröffentlicht: (2025)
Table-r1: Self-supervised and Reinforcement Learning for Program-based Table Reasoning in Small Language Models
von: Jin, Rihui, et al.
Veröffentlicht: (2025)
von: Jin, Rihui, et al.
Veröffentlicht: (2025)
Simple Mechanistic Explanations for Out-Of-Context Reasoning
von: Wang, Atticus, et al.
Veröffentlicht: (2025)
von: Wang, Atticus, et al.
Veröffentlicht: (2025)
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning
von: Li, Ran, et al.
Veröffentlicht: (2026)
von: Li, Ran, et al.
Veröffentlicht: (2026)
Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs
von: Li, Xueyan, et al.
Veröffentlicht: (2025)
von: Li, Xueyan, et al.
Veröffentlicht: (2025)
LiPO: Listwise Preference Optimization through Learning-to-Rank
von: Liu, Tianqi, et al.
Veröffentlicht: (2024)
von: Liu, Tianqi, et al.
Veröffentlicht: (2024)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
von: Hou, Zhenyu, et al.
Veröffentlicht: (2025)
von: Hou, Zhenyu, et al.
Veröffentlicht: (2025)
A Survey of Reinforcement Learning for Large Reasoning Models
von: Zhang, Kaiyan, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiyan, et al.
Veröffentlicht: (2025)
Reasoning-Grounded Natural Language Explanations for Language Models
von: Cahlik, Vojtech, et al.
Veröffentlicht: (2025)
von: Cahlik, Vojtech, et al.
Veröffentlicht: (2025)
Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code
von: Bao, Keqin, et al.
Veröffentlicht: (2025)
von: Bao, Keqin, et al.
Veröffentlicht: (2025)
An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning
von: Xu, Haoran, et al.
Veröffentlicht: (2025)
von: Xu, Haoran, et al.
Veröffentlicht: (2025)
Multilingual Safety Alignment via Self-Distillation
von: Qin, Ruiyang, et al.
Veröffentlicht: (2026)
von: Qin, Ruiyang, et al.
Veröffentlicht: (2026)
DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization
von: She, Shuaijie, et al.
Veröffentlicht: (2025)
von: She, Shuaijie, et al.
Veröffentlicht: (2025)
Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
von: Liu, Chi, et al.
Veröffentlicht: (2025)
von: Liu, Chi, et al.
Veröffentlicht: (2025)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
von: Cui, Ganqu, et al.
Veröffentlicht: (2025)
von: Cui, Ganqu, et al.
Veröffentlicht: (2025)
NPG-Muse: Scaling Long Chain-of-Thought Reasoning with NP-Hard Graph Problems
von: Wang, Yuyao, et al.
Veröffentlicht: (2025)
von: Wang, Yuyao, et al.
Veröffentlicht: (2025)
Eliciting Medical Reasoning with Knowledge-enhanced Data Synthesis: A Semi-Supervised Reinforcement Learning Approach
von: Li, Haolin, et al.
Veröffentlicht: (2026)
von: Li, Haolin, et al.
Veröffentlicht: (2026)
One Sample to Rule Them All: Extreme Data Efficiency in Multidiscipline Reasoning with Reinforcement Learning
von: Li, Yiyuan, et al.
Veröffentlicht: (2026)
von: Li, Yiyuan, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models
von: Li, Shuozhe, et al.
Veröffentlicht: (2026) -
ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection
von: Mei, Jingbiao, et al.
Veröffentlicht: (2025) -
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
von: Pathak, Manas, et al.
Veröffentlicht: (2026) -
A Learnable Wavelet Transformer for Long-Short Equity Trading and Risk-Adjusted Return Optimization
von: Li, Shuozhe, et al.
Veröffentlicht: (2026) -
Personalized Language Modeling from Personalized Human Feedback
von: Li, Xinyu, et al.
Veröffentlicht: (2024)