Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Mingze, Anand, Abhinav, Verma, Shweta, Mezini, Mira |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CodeSSM: Towards State Space Models for Code Understanding
di: Verma, Shweta, et al.
Pubblicazione: (2025)
di: Verma, Shweta, et al.
Pubblicazione: (2025)
A Critical Study of What Code-LLMs (Do Not) Learn
di: Anand, Abhinav, et al.
Pubblicazione: (2024)
di: Anand, Abhinav, et al.
Pubblicazione: (2024)
Towards Understanding What State Space Models Learn About Code
di: Wu, Jiali, et al.
Pubblicazione: (2026)
di: Wu, Jiali, et al.
Pubblicazione: (2026)
Integrating Symbolic Execution into the Fine-Tuning of Code-Generating LLMs
di: Sakharova, Marina, et al.
Pubblicazione: (2025)
di: Sakharova, Marina, et al.
Pubblicazione: (2025)
Analysis of Long Range Dependency Understanding in State Space Models
di: Ravikumar, Srividya, et al.
Pubblicazione: (2026)
di: Ravikumar, Srividya, et al.
Pubblicazione: (2026)
Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards
di: Jolfaei, Erfan Aghadavoodi, et al.
Pubblicazione: (2026)
di: Jolfaei, Erfan Aghadavoodi, et al.
Pubblicazione: (2026)
Automating the Refinement of Reinforcement Learning Specifications
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2025)
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2025)
Pre-training with Synthetic Data Helps Offline Reinforcement Learning
di: Wang, Zecheng, et al.
Pubblicazione: (2023)
di: Wang, Zecheng, et al.
Pubblicazione: (2023)
Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning
di: Hu, Zican, et al.
Pubblicazione: (2025)
di: Hu, Zican, et al.
Pubblicazione: (2025)
The Generalization Gap in Offline Reinforcement Learning
di: Mediratta, Ishita, et al.
Pubblicazione: (2023)
di: Mediratta, Ishita, et al.
Pubblicazione: (2023)
Cracking the Code of Action: a Generative Approach to Affordances for Reinforcement Learning
di: Cherif, Lynn, et al.
Pubblicazione: (2025)
di: Cherif, Lynn, et al.
Pubblicazione: (2025)
Amplifying Exploration in Monte-Carlo Tree Search by Focusing on the Unknown
di: Derstroff, Cedric, et al.
Pubblicazione: (2024)
di: Derstroff, Cedric, et al.
Pubblicazione: (2024)
MAPLE: Modality-Aware Post-training and Learning Ecosystem
di: Verma, Nikhil, et al.
Pubblicazione: (2026)
di: Verma, Nikhil, et al.
Pubblicazione: (2026)
Sample Efficient Active Algorithms for Offline Reinforcement Learning
di: Roy, Soumyadeep, et al.
Pubblicazione: (2026)
di: Roy, Soumyadeep, et al.
Pubblicazione: (2026)
Adaptable Hindsight Experience Replay for Search-Based Learning
di: Vazaios, Alexandros, et al.
Pubblicazione: (2025)
di: Vazaios, Alexandros, et al.
Pubblicazione: (2025)
Offline Reinforcement Learning with Generative Trajectory Policies
di: Feng, Xinsong, et al.
Pubblicazione: (2025)
di: Feng, Xinsong, et al.
Pubblicazione: (2025)
Doubly Mild Generalization for Offline Reinforcement Learning
di: Mao, Yixiu, et al.
Pubblicazione: (2024)
di: Mao, Yixiu, et al.
Pubblicazione: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
When is Offline Policy Selection Sample Efficient for Reinforcement Learning?
di: Liu, Vincent, et al.
Pubblicazione: (2023)
di: Liu, Vincent, et al.
Pubblicazione: (2023)
Provable Zero-Shot Generalization in Offline Reinforcement Learning
di: Wang, Zhiyong, et al.
Pubblicazione: (2025)
di: Wang, Zhiyong, et al.
Pubblicazione: (2025)
Imagination-Limited Q-Learning for Offline Reinforcement Learning
di: Liu, Wenhui, et al.
Pubblicazione: (2025)
di: Liu, Wenhui, et al.
Pubblicazione: (2025)
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2026)
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2026)
Improving Offline Reinforcement Learning with Inaccurate Simulators
di: Hou, Yiwen, et al.
Pubblicazione: (2024)
di: Hou, Yiwen, et al.
Pubblicazione: (2024)
Pessimistic Auxiliary Policy for Offline Reinforcement Learning
di: Zhang, Fan, et al.
Pubblicazione: (2026)
di: Zhang, Fan, et al.
Pubblicazione: (2026)
Policy-regularized Offline Multi-objective Reinforcement Learning
di: Lin, Qian, et al.
Pubblicazione: (2024)
di: Lin, Qian, et al.
Pubblicazione: (2024)
Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation
di: Wu, Yecheng, et al.
Pubblicazione: (2026)
di: Wu, Yecheng, et al.
Pubblicazione: (2026)
Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
di: Huang, Xiao, et al.
Pubblicazione: (2025)
di: Huang, Xiao, et al.
Pubblicazione: (2025)
GTA: Generative Trajectory Augmentation with Guidance for Offline Reinforcement Learning
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
Goal-Conditioned Data Augmentation for Offline Reinforcement Learning
di: Huang, Xingshuai, et al.
Pubblicazione: (2024)
di: Huang, Xingshuai, et al.
Pubblicazione: (2024)
SAMG: Offline-to-Online Reinforcement Learning via State-Action-Conditional Offline Model Guidance
di: Zhang, Liyu, et al.
Pubblicazione: (2024)
di: Zhang, Liyu, et al.
Pubblicazione: (2024)
Scaling Strategy, Not Compute: A Stand-Alone, Open-Source StarCraft II Benchmark for Accessible Reinforcement Learning Research
di: Panda, Sourav, et al.
Pubblicazione: (2026)
di: Panda, Sourav, et al.
Pubblicazione: (2026)
CoRe-Code: Collaborative Reinforcement Learning for Code Generation
di: Dou, Zhihao, et al.
Pubblicazione: (2026)
di: Dou, Zhihao, et al.
Pubblicazione: (2026)
Preference Elicitation for Offline Reinforcement Learning
di: Pace, Alizée, et al.
Pubblicazione: (2024)
di: Pace, Alizée, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning with Imbalanced Datasets
di: Jiang, Li, et al.
Pubblicazione: (2023)
di: Jiang, Li, et al.
Pubblicazione: (2023)
Simple Ingredients for Offline Reinforcement Learning
di: Cetin, Edoardo, et al.
Pubblicazione: (2024)
di: Cetin, Edoardo, et al.
Pubblicazione: (2024)
State-Constrained Offline Reinforcement Learning
di: Hepburn, Charles A., et al.
Pubblicazione: (2024)
di: Hepburn, Charles A., et al.
Pubblicazione: (2024)
Dataset Distillation for Offline Reinforcement Learning
di: Light, Jonathan, et al.
Pubblicazione: (2024)
di: Light, Jonathan, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning with Imputed Rewards
di: Romeo, Carlo, et al.
Pubblicazione: (2024)
di: Romeo, Carlo, et al.
Pubblicazione: (2024)
Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning
di: Park, Jongchan, et al.
Pubblicazione: (2025)
di: Park, Jongchan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CodeSSM: Towards State Space Models for Code Understanding
di: Verma, Shweta, et al.
Pubblicazione: (2025) -
A Critical Study of What Code-LLMs (Do Not) Learn
di: Anand, Abhinav, et al.
Pubblicazione: (2024) -
Towards Understanding What State Space Models Learn About Code
di: Wu, Jiali, et al.
Pubblicazione: (2026) -
Integrating Symbolic Execution into the Fine-Tuning of Code-Generating LLMs
di: Sakharova, Marina, et al.
Pubblicazione: (2025) -
Analysis of Long Range Dependency Understanding in State Space Models
di: Ravikumar, Srividya, et al.
Pubblicazione: (2026)