Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Chujie, Dang, Kai, Yu, Bowen, Li, Mingze, Jiang, Huiqiang, Lin, Junrong, Liu, Yuqiong, Lin, Hao, Wu, Chencan, Hu, Feng, Yang, An, Zhou, Jingren, Lin, Junyang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Group Sequence Policy Optimization
by: Zheng, Chujie, et al.
Published: (2025)
by: Zheng, Chujie, et al.
Published: (2025)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
by: Zhang, Zhenru, et al.
Published: (2025)
by: Zhang, Zhenru, et al.
Published: (2025)
Soft Adaptive Policy Optimization
by: Gao, Chang, et al.
Published: (2025)
by: Gao, Chang, et al.
Published: (2025)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
by: Zheng, Chujie, et al.
Published: (2024)
by: Zheng, Chujie, et al.
Published: (2024)
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
by: Wang, Shenzhi, et al.
Published: (2025)
by: Wang, Shenzhi, et al.
Published: (2025)
MARGE: Improving Math Reasoning for LLMs with Guided Exploration
by: Gao, Jingyue, et al.
Published: (2025)
by: Gao, Jingyue, et al.
Published: (2025)
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
by: Xiang, Hao, et al.
Published: (2025)
by: Xiang, Hao, et al.
Published: (2025)
P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs
by: Zhang, Yidan, et al.
Published: (2024)
by: Zhang, Yidan, et al.
Published: (2024)
Research Landscape and Emerging Trends in Herbal Medicine for Pediatric Respiratory Tract Infections: A CiteSpace‐Based Bibliometric Analysis
by: Chencan Chi, et al.
Published: (2026)
by: Chencan Chi, et al.
Published: (2026)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
by: Xiang, Hao, et al.
Published: (2024)
by: Xiang, Hao, et al.
Published: (2024)
WorldPM: Scaling Human Preference Modeling
by: Wang, Binghai, et al.
Published: (2025)
by: Wang, Binghai, et al.
Published: (2025)
Rethinking Data Selection at Scale: Random Selection is Almost All You Need
by: Xia, Tingyu, et al.
Published: (2024)
by: Xia, Tingyu, et al.
Published: (2024)
Language Models can Self-Lengthen to Generate Long Texts
by: Quan, Shanghaoran, et al.
Published: (2024)
by: Quan, Shanghaoran, et al.
Published: (2024)
RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback
by: Shu, Junyang, et al.
Published: (2025)
by: Shu, Junyang, et al.
Published: (2025)
Rotated Runtime Smooth: Training-Free Activation Smoother for accurate INT4 inference
by: Yi, Ke, et al.
Published: (2024)
by: Yi, Ke, et al.
Published: (2024)
LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression
by: Jiang, Huiqiang, et al.
Published: (2023)
by: Jiang, Huiqiang, et al.
Published: (2023)
SegMo: Segment-aligned Text to 3D Human Motion Generation
by: Dang, Bowen, et al.
Published: (2025)
by: Dang, Bowen, et al.
Published: (2025)
Large Language Models are Superpositions of All Characters: Attaining Arbitrary Role-play via Self-Alignment
by: Lu, Keming, et al.
Published: (2024)
by: Lu, Keming, et al.
Published: (2024)
RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback
by: Tang, Qiaoyu, et al.
Published: (2025)
by: Tang, Qiaoyu, et al.
Published: (2025)
Efficient Long Context Fine-tuning with Chunk Flow
by: Yuan, Xiulong, et al.
Published: (2025)
by: Yuan, Xiulong, et al.
Published: (2025)
Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective
by: Mao, Liyuan, et al.
Published: (2026)
by: Mao, Liyuan, et al.
Published: (2026)
Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning
by: Wu, Mingze, et al.
Published: (2026)
by: Wu, Mingze, et al.
Published: (2026)
Inverter Redistribution through Self-Dual and Self-Anti-Dual Function Transformation
by: Wang, Jingren, et al.
Published: (2026)
by: Wang, Jingren, et al.
Published: (2026)
The Treatment of Ovalbumin‐Induced Asthma by a Novel Curcumin Green‐Formulated Ag NPs in Wistar Rats
by: Jing Yu, et al.
Published: (2025)
by: Jing Yu, et al.
Published: (2025)
Synthesizing Text-to-SQL Data from Weak and Strong LLMs
by: Yang, Jiaxi, et al.
Published: (2024)
by: Yang, Jiaxi, et al.
Published: (2024)
IoT-Brain: Grounding LLMs for Semantic-Spatial Sensor Scheduling
by: Zhou, Zhaomeng, et al.
Published: (2026)
by: Zhou, Zhaomeng, et al.
Published: (2026)
A$^2$Search: Ambiguity-Aware Question Answering with Reinforcement Learning
by: Zhang, Fengji, et al.
Published: (2025)
by: Zhang, Fengji, et al.
Published: (2025)
WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning
by: Yu, Xinmiao, et al.
Published: (2026)
by: Yu, Xinmiao, et al.
Published: (2026)
Large Language Models Are Not Robust Multiple Choice Selectors
by: Zheng, Chujie, et al.
Published: (2023)
by: Zheng, Chujie, et al.
Published: (2023)
Neural Correlates of Dual‐Functional Local Dynamic Stability in Older Adults
by: Sa Zhou, et al.
Published: (2024)
by: Sa Zhou, et al.
Published: (2024)
One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning
by: He, Bowen, et al.
Published: (2026)
by: He, Bowen, et al.
Published: (2026)
Training LLMs for EHR-Based Reasoning Tasks via Reinforcement Learning
by: Lin, Jiacheng, et al.
Published: (2025)
by: Lin, Jiacheng, et al.
Published: (2025)
FastEddy data for the pressure waves
by: Lin, Yi, et al.
Published: (2025)
by: Lin, Yi, et al.
Published: (2025)
Demons in the Detail: On Implementing Load Balancing Loss for Training Specialized Mixture-of-Expert Models
by: Qiu, Zihan, et al.
Published: (2025)
by: Qiu, Zihan, et al.
Published: (2025)
SMARTFEAT: Efficient Feature Construction through Feature-Level Foundation Model Interactions
by: Lin, Yin, et al.
Published: (2023)
by: Lin, Yin, et al.
Published: (2023)
Plasma‐Based Genomic Features Influencing Outcomes of T790M ‐Positive Non–Small Cell Lung Cancer Receiving Osimertinib
by: Heng Liu, et al.
Published: (2025)
by: Heng Liu, et al.
Published: (2025)
Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
by: Yang, An, et al.
Published: (2024)
by: Yang, An, et al.
Published: (2024)
DeepInnovator: Triggering the Innovative Capabilities of LLMs
by: Fan, Tianyu, et al.
Published: (2026)
by: Fan, Tianyu, et al.
Published: (2026)
Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
by: Zhang, Yanzhao, et al.
Published: (2025)
by: Zhang, Yanzhao, et al.
Published: (2025)
Breast Ultrasound Tumor Generation via Mask Generator and Text-Guided Network:A Clinically Controllable Framework with Downstream Evaluation
by: Pan, Haoyu, et al.
Published: (2025)
by: Pan, Haoyu, et al.
Published: (2025)
Similar Items
-
Group Sequence Policy Optimization
by: Zheng, Chujie, et al.
Published: (2025) -
The Lessons of Developing Process Reward Models in Mathematical Reasoning
by: Zhang, Zhenru, et al.
Published: (2025) -
Soft Adaptive Policy Optimization
by: Gao, Chang, et al.
Published: (2025) -
ProcessBench: Identifying Process Errors in Mathematical Reasoning
by: Zheng, Chujie, et al.
Published: (2024) -
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
by: Wang, Shenzhi, et al.
Published: (2025)