Effective Reinforcement Learning for Reasoning in Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Lianghuan, Li, Shuo, Anupam, Sagnik, Lee, Insup, Bastani, Osbert |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RAPID: An Efficient Reinforcement Learning Algorithm for Small Language Models
by: Huang, Lianghuan, et al.
Published: (2025)
by: Huang, Lianghuan, et al.
Published: (2025)
Policy-Guided Stepwise Model Routing for Cost-Effective Reasoning
by: Si, Wenwen, et al.
Published: (2026)
by: Si, Wenwen, et al.
Published: (2026)
TRAQ: Trustworthy Retrieval Augmented Question Answering via Conformal Prediction
by: Li, Shuo, et al.
Published: (2023)
by: Li, Shuo, et al.
Published: (2023)
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
by: Si, Wenwen, et al.
Published: (2025)
by: Si, Wenwen, et al.
Published: (2025)
BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks
by: Anupam, Sagnik, et al.
Published: (2025)
by: Anupam, Sagnik, et al.
Published: (2025)
Uncertainty in Language Models: Assessment through Rank-Calibration
by: Huang, Xinmeng, et al.
Published: (2024)
by: Huang, Xinmeng, et al.
Published: (2024)
WST: Weak-to-Strong Knowledge Transfer via Reinforcement Learning
by: Ge, Haosen, et al.
Published: (2025)
by: Ge, Haosen, et al.
Published: (2025)
Are AI Capabilities Increasing Exponentially? A Competing Hypothesis
by: Ge, Haosen, et al.
Published: (2026)
by: Ge, Haosen, et al.
Published: (2026)
LLM Program Optimization via Retrieval Augmented Search
by: Anupam, Sagnik, et al.
Published: (2025)
by: Anupam, Sagnik, et al.
Published: (2025)
One-Shot Safety Alignment for Large Language Models via Optimal Dualization
by: Huang, Xinmeng, et al.
Published: (2024)
by: Huang, Xinmeng, et al.
Published: (2024)
Diversity By Design: Leveraging Distribution Matching for Offline Model-Based Optimization
by: Yao, Michael S., et al.
Published: (2025)
by: Yao, Michael S., et al.
Published: (2025)
Decaf: Improving Neural Decompilation with Automatic Feedback and Search
by: Shypula, Alexander, et al.
Published: (2026)
by: Shypula, Alexander, et al.
Published: (2026)
Generative Adversarial Model-Based Optimization via Source Critic Regularization
by: Yao, Michael S., et al.
Published: (2024)
by: Yao, Michael S., et al.
Published: (2024)
Evaluating the Diversity and Quality of LLM Generated Content
by: Shypula, Alexander, et al.
Published: (2025)
by: Shypula, Alexander, et al.
Published: (2025)
Knowledgeable Language Models as Black-Box Optimizers for Personalized Medicine
by: Yao, Michael S., et al.
Published: (2025)
by: Yao, Michael S., et al.
Published: (2025)
Eurekaverse: Environment Curriculum Generation via Large Language Models
by: Liang, William, et al.
Published: (2024)
by: Liang, William, et al.
Published: (2024)
A Fast, Reliable, and Secure Programming Language for LLM Agents with Code Actions
by: Mell, Stephen, et al.
Published: (2025)
by: Mell, Stephen, et al.
Published: (2025)
RICL: Adding In-Context Adaptability to Pre-Trained Vision-Language-Action Models
by: Sridhar, Kaustubh, et al.
Published: (2025)
by: Sridhar, Kaustubh, et al.
Published: (2025)
Eureka: Human-Level Reward Design via Coding Large Language Models
by: Ma, Yecheng Jason, et al.
Published: (2023)
by: Ma, Yecheng Jason, et al.
Published: (2023)
DrEureka: Language Model Guided Sim-To-Real Transfer
by: Ma, Yecheng Jason, et al.
Published: (2024)
by: Ma, Yecheng Jason, et al.
Published: (2024)
Improving Human Sequential Decision-Making with Reinforcement Learning
by: Bastani, Hamsa, et al.
Published: (2021)
by: Bastani, Hamsa, et al.
Published: (2021)
PopPy: Opportunistically Exploiting Parallelism in Python Compound AI Applications
by: Mell, Stephen, et al.
Published: (2026)
by: Mell, Stephen, et al.
Published: (2026)
Asymptotic Normality of Generalized Low-Rank Matrix Sensing via Riemannian Geometry
by: Bastani, Osbert
Published: (2024)
by: Bastani, Osbert
Published: (2024)
REGENT: A Retrieval-Augmented Generalist Agent That Can Act In-Context in New Environments
by: Sridhar, Kaustubh, et al.
Published: (2024)
by: Sridhar, Kaustubh, et al.
Published: (2024)
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
by: Liu, Yihao, et al.
Published: (2025)
by: Liu, Yihao, et al.
Published: (2025)
AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models
by: Yeh, Cheng-Kai, et al.
Published: (2025)
by: Yeh, Cheng-Kai, et al.
Published: (2025)
Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning
by: Wan, Xu, et al.
Published: (2026)
by: Wan, Xu, et al.
Published: (2026)
Conformal Structured Prediction
by: Zhang, Botong, et al.
Published: (2024)
by: Zhang, Botong, et al.
Published: (2024)
Tether: Autonomous Functional Play with Correspondence-Driven Trajectory Warping
by: Liang, William, et al.
Published: (2026)
by: Liang, William, et al.
Published: (2026)
Memory-Consistent Neural Networks for Imitation Learning
by: Sridhar, Kaustubh, et al.
Published: (2023)
by: Sridhar, Kaustubh, et al.
Published: (2023)
Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning
by: Chen, Zhipeng, et al.
Published: (2026)
by: Chen, Zhipeng, et al.
Published: (2026)
InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning
by: Xie, Congkai, et al.
Published: (2025)
by: Xie, Congkai, et al.
Published: (2025)
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
by: Liao, Yi, et al.
Published: (2025)
by: Liao, Yi, et al.
Published: (2025)
GALAX: Graph-Augmented Language Model for Explainable Reinforcement-Guided Subgraph Reasoning in Precision Medicine
by: Zhang, Heming, et al.
Published: (2025)
by: Zhang, Heming, et al.
Published: (2025)
Learning to Draw ASCII Improves Spatial Reasoning in Language Models
by: Huang, Shiyuan, et al.
Published: (2026)
by: Huang, Shiyuan, et al.
Published: (2026)
SeekerGym: A Benchmark for Reliable Information Seeking
by: Kim, Remy, et al.
Published: (2026)
by: Kim, Remy, et al.
Published: (2026)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
by: Cui, Ganqu, et al.
Published: (2025)
by: Cui, Ganqu, et al.
Published: (2025)
Coupled Variational Reinforcement Learning for Language Model General Reasoning
by: Wen, Xueru, et al.
Published: (2025)
by: Wen, Xueru, et al.
Published: (2025)
Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router
by: Shao, Chenyang, et al.
Published: (2025)
by: Shao, Chenyang, et al.
Published: (2025)
Effective and Efficient Representation Learning for Flight Trajectories
by: Liu, Shuo, et al.
Published: (2024)
by: Liu, Shuo, et al.
Published: (2024)
Similar Items
-
RAPID: An Efficient Reinforcement Learning Algorithm for Small Language Models
by: Huang, Lianghuan, et al.
Published: (2025) -
Policy-Guided Stepwise Model Routing for Cost-Effective Reasoning
by: Si, Wenwen, et al.
Published: (2026) -
TRAQ: Trustworthy Retrieval Augmented Question Answering via Conformal Prediction
by: Li, Shuo, et al.
Published: (2023) -
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
by: Si, Wenwen, et al.
Published: (2025) -
BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks
by: Anupam, Sagnik, et al.
Published: (2025)