The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Xinyu, Xia, Mengzhou, Wei, Zhepei, Chen, Wei-Lin, Chen, Danqi, Meng, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SimPO: Simple Preference Optimization with a Reference-Free Reward
par: Meng, Yu, et autres
Publié: (2024)
par: Meng, Yu, et autres
Publié: (2024)
InstructRAG: Instructing Retrieval-Augmented Generation via Self-Synthesized Rationales
par: Wei, Zhepei, et autres
Publié: (2024)
par: Wei, Zhepei, et autres
Publié: (2024)
You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
par: Wei, Zhepei, et autres
Publié: (2026)
par: Wei, Zhepei, et autres
Publié: (2026)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
par: Zhong, Zexuan, et autres
Publié: (2024)
par: Zhong, Zexuan, et autres
Publié: (2024)
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
par: Xia, Mengzhou, et autres
Publié: (2023)
par: Xia, Mengzhou, et autres
Publié: (2023)
Do LLM Evaluators Prefer Themselves for a Reason?
par: Chen, Wei-Lin, et autres
Publié: (2025)
par: Chen, Wei-Lin, et autres
Publié: (2025)
AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism
par: Wei, Zhepei, et autres
Publié: (2025)
par: Wei, Zhepei, et autres
Publié: (2025)
LESS: Selecting Influential Data for Targeted Instruction Tuning
par: Xia, Mengzhou, et autres
Publié: (2024)
par: Xia, Mengzhou, et autres
Publié: (2024)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
par: Lin, Zihan, et autres
Publié: (2026)
par: Lin, Zihan, et autres
Publié: (2026)
How to Train Long-Context Language Models (Effectively)
par: Gao, Tianyu, et autres
Publié: (2024)
par: Gao, Tianyu, et autres
Publié: (2024)
LitSearch: A Retrieval Benchmark for Scientific Literature Search
par: Ajith, Anirudh, et autres
Publié: (2024)
par: Ajith, Anirudh, et autres
Publié: (2024)
Aligning Large Language Models via Fully Self-Synthetic Data
par: Yin, Shangjian, et autres
Publié: (2025)
par: Yin, Shangjian, et autres
Publié: (2025)
Detecting Pretraining Data from Large Language Models
par: Shi, Weijia, et autres
Publié: (2023)
par: Shi, Weijia, et autres
Publié: (2023)
Rethinking Mixture-of-Agents: Is Mixing Different Large Language Models Beneficial?
par: Li, Wenzhe, et autres
Publié: (2025)
par: Li, Wenzhe, et autres
Publié: (2025)
DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning
par: Wang, Yaxuan, et autres
Publié: (2025)
par: Wang, Yaxuan, et autres
Publié: (2025)
Evaluating Large Language Models at Evaluating Instruction Following
par: Zeng, Zhiyuan, et autres
Publié: (2023)
par: Zeng, Zhiyuan, et autres
Publié: (2023)
The Heuristic Core: Understanding Subnetwork Generalization in Pretrained Language Models
par: Bhaskar, Adithya, et autres
Publié: (2024)
par: Bhaskar, Adithya, et autres
Publié: (2024)
How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning
par: Tian, Minghao, et autres
Publié: (2026)
par: Tian, Minghao, et autres
Publié: (2026)
Trainable Transformer in Transformer
par: Panigrahi, Abhishek, et autres
Publié: (2023)
par: Panigrahi, Abhishek, et autres
Publié: (2023)
Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
par: Chen, Howard, et autres
Publié: (2025)
par: Chen, Howard, et autres
Publié: (2025)
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
par: Wang, Shenzhi, et autres
Publié: (2025)
par: Wang, Shenzhi, et autres
Publié: (2025)
MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning
par: Liang, Yiqing, et autres
Publié: (2025)
par: Liang, Yiqing, et autres
Publié: (2025)
CultureLLM: Incorporating Cultural Differences into Large Language Models
par: Li, Cheng, et autres
Publié: (2024)
par: Li, Cheng, et autres
Publié: (2024)
Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code
par: Bao, Keqin, et autres
Publié: (2025)
par: Bao, Keqin, et autres
Publié: (2025)
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
par: Yu, Qiying, et autres
Publié: (2025)
par: Yu, Qiying, et autres
Publié: (2025)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
par: Guo, Zhenyuan, et autres
Publié: (2026)
par: Guo, Zhenyuan, et autres
Publié: (2026)
CLUE: Conflict-guided Localization for LLM Unlearning Framework
par: Chen, Hang, et autres
Publié: (2025)
par: Chen, Hang, et autres
Publié: (2025)
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
par: Wei, Zhepei, et autres
Publié: (2025)
par: Wei, Zhepei, et autres
Publié: (2025)
Extracting Rule-based Descriptions of Attention Features in Transformers
par: Friedman, Dan, et autres
Publié: (2025)
par: Friedman, Dan, et autres
Publié: (2025)
QuRating: Selecting High-Quality Data for Training Language Models
par: Wettig, Alexander, et autres
Publié: (2024)
par: Wettig, Alexander, et autres
Publié: (2024)
Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning
par: Xu, Shuyao, et autres
Publié: (2025)
par: Xu, Shuyao, et autres
Publié: (2025)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
par: Xu, Ran, et autres
Publié: (2025)
par: Xu, Ran, et autres
Publié: (2025)
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
par: Wei, Zhepei, et autres
Publié: (2025)
par: Wei, Zhepei, et autres
Publié: (2025)
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
par: Chen, Huayu, et autres
Publié: (2025)
par: Chen, Huayu, et autres
Publié: (2025)
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
par: Liu, Haolin, et autres
Publié: (2026)
par: Liu, Haolin, et autres
Publié: (2026)
Representing Rule-based Chatbots with Transformers
par: Friedman, Dan, et autres
Publié: (2024)
par: Friedman, Dan, et autres
Publié: (2024)
ReMix: Reinforcement routing for mixtures of LoRAs in LLM finetuning
par: Qiu, Ruizhong, et autres
Publié: (2026)
par: Qiu, Ruizhong, et autres
Publié: (2026)
On Designing Effective RL Reward at Training Time for LLM Reasoning
par: Gao, Jiaxuan, et autres
Publié: (2024)
par: Gao, Jiaxuan, et autres
Publié: (2024)
C3oT: Generating Shorter Chain-of-Thought without Compromising Effectiveness
par: Kang, Yu, et autres
Publié: (2024)
par: Kang, Yu, et autres
Publié: (2024)
Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning
par: Zhang, Ruiqi, et autres
Publié: (2024)
par: Zhang, Ruiqi, et autres
Publié: (2024)
Documents similaires
-
SimPO: Simple Preference Optimization with a Reference-Free Reward
par: Meng, Yu, et autres
Publié: (2024) -
InstructRAG: Instructing Retrieval-Augmented Generation via Self-Synthesized Rationales
par: Wei, Zhepei, et autres
Publié: (2024) -
You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
par: Wei, Zhepei, et autres
Publié: (2026) -
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
par: Zhong, Zexuan, et autres
Publié: (2024) -
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
par: Xia, Mengzhou, et autres
Publié: (2023)