Reinforcement Learning Enhanced LLMs: A Survey
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Shuhe, Zhang, Shengyu, Zhang, Jie, Hu, Runyi, Li, Xiaoya, Zhang, Tianwei, Li, Jiwei, Wu, Fei, Wang, Guoyin, Hovy, Eduard |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Instruction Tuning for Large Language Models: A Survey
by: Zhang, Shengyu, et al.
Published: (2023)
by: Zhang, Shengyu, et al.
Published: (2023)
Turn That Frown Upside Down: FaceID Customization via Cross-Training Data
by: Wang, Shuhe, et al.
Published: (2025)
by: Wang, Shuhe, et al.
Published: (2025)
Packing Analysis: Packing Is More Appropriate for Large Models or Datasets in Supervised Fine-tuning
by: Wang, Shuhe, et al.
Published: (2024)
by: Wang, Shuhe, et al.
Published: (2024)
Picky LLMs and Unreliable RMs: An Empirical Study on Safety Alignment after Instruction Tuning
by: Li, Guanlin, et al.
Published: (2025)
by: Li, Guanlin, et al.
Published: (2025)
FaceID-6M: A Large-Scale, Open-Source FaceID Customization Dataset
by: Wang, Shuhe, et al.
Published: (2025)
by: Wang, Shuhe, et al.
Published: (2025)
CRINN: Contrastive Reinforcement Learning for Approximate Nearest Neighbor Search
by: Li, Xiaoya, et al.
Published: (2025)
by: Li, Xiaoya, et al.
Published: (2025)
Similarity-based Neighbor Selection for Graph LLMs
by: Li, Rui, et al.
Published: (2024)
by: Li, Rui, et al.
Published: (2024)
Template-assisted Contrastive Learning of Task-oriented Dialogue Sentence Embeddings
by: Oh, Minsik, et al.
Published: (2023)
by: Oh, Minsik, et al.
Published: (2023)
Are Human-generated Demonstrations Necessary for In-context Learning?
by: Li, Rui, et al.
Published: (2023)
by: Li, Rui, et al.
Published: (2023)
Inference-time Alignment via Sparse Junction Steering
by: Hu, Runyi, et al.
Published: (2026)
by: Hu, Runyi, et al.
Published: (2026)
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
by: Zhang, Kaiyi, et al.
Published: (2025)
by: Zhang, Kaiyi, et al.
Published: (2025)
Cascaded Self-Evaluation Augmented Training for Lightweight Multimodal LLMs
by: Lv, Zheqi, et al.
Published: (2025)
by: Lv, Zheqi, et al.
Published: (2025)
RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
by: Zhang, Jinghao, et al.
Published: (2025)
by: Zhang, Jinghao, et al.
Published: (2025)
CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning
by: Su, Songqiao, et al.
Published: (2025)
by: Su, Songqiao, et al.
Published: (2025)
Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach
by: Zhang, Xinnan, et al.
Published: (2025)
by: Zhang, Xinnan, et al.
Published: (2025)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
by: Li, Kunxi, et al.
Published: (2025)
by: Li, Kunxi, et al.
Published: (2025)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
by: Zhang, Guibin, et al.
Published: (2025)
by: Zhang, Guibin, et al.
Published: (2025)
GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning
by: DeepReinforce Team, et al.
Published: (2026)
by: DeepReinforce Team, et al.
Published: (2026)
A Sentiment Consolidation Framework for Meta-Review Generation
by: Li, Miao, et al.
Published: (2024)
by: Li, Miao, et al.
Published: (2024)
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
by: Li, Xiaoya, et al.
Published: (2025)
by: Li, Xiaoya, et al.
Published: (2025)
ModelGPT: Unleashing LLM's Capabilities for Tailored Model Generation
by: Tang, Zihao, et al.
Published: (2024)
by: Tang, Zihao, et al.
Published: (2024)
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
by: Wan, Ziyu, et al.
Published: (2025)
by: Wan, Ziyu, et al.
Published: (2025)
A Survey of Reinforcement Learning for Large Reasoning Models
by: Zhang, Kaiyan, et al.
Published: (2025)
by: Zhang, Kaiyan, et al.
Published: (2025)
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
by: Dong, Yihong, et al.
Published: (2025)
by: Dong, Yihong, et al.
Published: (2025)
Graph Learning in the Era of LLMs: A Survey from the Perspective of Data, Models, and Tasks
by: Li, Xunkai, et al.
Published: (2024)
by: Li, Xunkai, et al.
Published: (2024)
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
by: Zheng, Chujie, et al.
Published: (2025)
by: Zheng, Chujie, et al.
Published: (2025)
Enhancing the General Agent Capabilities of Low-Parameter LLMs through Tuning and Multi-Branch Reasoning
by: Zhou, Qinhao, et al.
Published: (2024)
by: Zhou, Qinhao, et al.
Published: (2024)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
by: Xu, Hongling, et al.
Published: (2025)
by: Xu, Hongling, et al.
Published: (2025)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
by: DeepSeek-AI, et al.
Published: (2025)
by: DeepSeek-AI, et al.
Published: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use
by: Hu, Xueyu, et al.
Published: (2025)
by: Hu, Xueyu, et al.
Published: (2025)
True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning
by: Tan, Weihao, et al.
Published: (2024)
by: Tan, Weihao, et al.
Published: (2024)
Cloud Model Characteristic Function Auto-Encoder: Integrating Cloud Model Theory with MMD Regularization for Enhanced Generative Modeling
by: Hu, Biao, et al.
Published: (2025)
by: Hu, Biao, et al.
Published: (2025)
LoraRetriever: Input-Aware LoRA Retrieval and Composition for Mixed Tasks in the Wild
by: Zhao, Ziyu, et al.
Published: (2024)
by: Zhao, Ziyu, et al.
Published: (2024)
LASP: Surveying the State-of-the-Art in Large Language Model-Assisted AI Planning
by: Li, Haoming, et al.
Published: (2024)
by: Li, Haoming, et al.
Published: (2024)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
by: Tao, Yongding, et al.
Published: (2025)
by: Tao, Yongding, et al.
Published: (2025)
Reward Is Enough: LLMs Are In-Context Reinforcement Learners
by: Song, Kefan, et al.
Published: (2025)
by: Song, Kefan, et al.
Published: (2025)
Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality
by: Li, Junliang, et al.
Published: (2025)
by: Li, Junliang, et al.
Published: (2025)
A Note on Hybrid Online Reinforcement and Imitation Learning for LLMs: Formulations and Algorithms
by: Li, Yingru, et al.
Published: (2025)
by: Li, Yingru, et al.
Published: (2025)
Knowledge Conflicts for LLMs: A Survey
by: Xu, Rongwu, et al.
Published: (2024)
by: Xu, Rongwu, et al.
Published: (2024)
Similar Items
-
Instruction Tuning for Large Language Models: A Survey
by: Zhang, Shengyu, et al.
Published: (2023) -
Turn That Frown Upside Down: FaceID Customization via Cross-Training Data
by: Wang, Shuhe, et al.
Published: (2025) -
Packing Analysis: Packing Is More Appropriate for Large Models or Datasets in Supervised Fine-tuning
by: Wang, Shuhe, et al.
Published: (2024) -
Picky LLMs and Unreliable RMs: An Empirical Study on Safety Alignment after Instruction Tuning
by: Li, Guanlin, et al.
Published: (2025) -
FaceID-6M: A Large-Scale, Open-Source FaceID Customization Dataset
by: Wang, Shuhe, et al.
Published: (2025)