Exploring RL-based LLM Training for Formal Language Tasks with Programmed Rewards
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Padula, Alexander G., Soemers, Dennis J. N. J. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On Designing Effective RL Reward at Training Time for LLM Reasoning
par: Gao, Jiaxuan, et autres
Publié: (2024)
par: Gao, Jiaxuan, et autres
Publié: (2024)
FlowRL: Matching Reward Distributions for LLM Reasoning
par: Zhu, Xuekai, et autres
Publié: (2025)
par: Zhu, Xuekai, et autres
Publié: (2025)
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
par: Pavlenko, Kirill, et autres
Publié: (2026)
par: Pavlenko, Kirill, et autres
Publié: (2026)
Formal-LLM: Integrating Formal Language and Natural Language for Controllable LLM-based Agents
par: Li, Zelong, et autres
Publié: (2024)
par: Li, Zelong, et autres
Publié: (2024)
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
par: Feng, Xiao, et autres
Publié: (2026)
par: Feng, Xiao, et autres
Publié: (2026)
On the Optimal Reasoning Length for RL-Trained Language Models
par: Nohara, Daisuke, et autres
Publié: (2026)
par: Nohara, Daisuke, et autres
Publié: (2026)
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
par: Zhou, Jin Peng, et autres
Publié: (2025)
par: Zhou, Jin Peng, et autres
Publié: (2025)
ToolRL: Reward is All Tool Learning Needs
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
ROSE: A Reward-Oriented Data Selection Framework for LLM Task-Specific Instruction Tuning
par: Wu, Yang, et autres
Publié: (2024)
par: Wu, Yang, et autres
Publié: (2024)
Exploring Domain Robust Lightweight Reward Models based on Router Mechanism
par: Namgoong, Hyuk, et autres
Publié: (2024)
par: Namgoong, Hyuk, et autres
Publié: (2024)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
par: Zhou, Yifei, et autres
Publié: (2024)
par: Zhou, Yifei, et autres
Publié: (2024)
Emergent Representations of Program Semantics in Language Models Trained on Programs
par: Jin, Charles, et autres
Publié: (2023)
par: Jin, Charles, et autres
Publié: (2023)
Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL
par: Zhou, Yixiao, et autres
Publié: (2026)
par: Zhou, Yixiao, et autres
Publié: (2026)
GLIDE-RL: Grounded Language Instruction through DEmonstration in RL
par: Kharyal, Chaitanya, et autres
Publié: (2024)
par: Kharyal, Chaitanya, et autres
Publié: (2024)
Scaling LLM Multi-turn RL with End-to-end Summarization-based Context Management
par: Lu, Miao, et autres
Publié: (2025)
par: Lu, Miao, et autres
Publié: (2025)
Feedback Loops With Language Models Drive In-Context Reward Hacking
par: Pan, Alexander, et autres
Publié: (2024)
par: Pan, Alexander, et autres
Publié: (2024)
Synthetic Data RL: Task Definition Is All You Need
par: Guo, Yiduo, et autres
Publié: (2025)
par: Guo, Yiduo, et autres
Publié: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
par: Li, Kenneth, et autres
Publié: (2022)
par: Li, Kenneth, et autres
Publié: (2022)
Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
par: Yu, Hongli, et autres
Publié: (2025)
par: Yu, Hongli, et autres
Publié: (2025)
Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?
par: Renduchintala, H S V N S Kowndinya, et autres
Publié: (2026)
par: Renduchintala, H S V N S Kowndinya, et autres
Publié: (2026)
Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training
par: Liu, Mingjie, et autres
Publié: (2025)
par: Liu, Mingjie, et autres
Publié: (2025)
Learning to Reason as Action Abstractions with Scalable Mid-Training RL
par: Zhang, Shenao, et autres
Publié: (2025)
par: Zhang, Shenao, et autres
Publié: (2025)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
par: Limozin, Alexis, et autres
Publié: (2026)
par: Limozin, Alexis, et autres
Publié: (2026)
Words as Beacons: Guiding RL Agents with High-Level Language Prompts
par: Ruiz-Gonzalez, Unai, et autres
Publié: (2024)
par: Ruiz-Gonzalez, Unai, et autres
Publié: (2024)
AIOS Compiler: LLM as Interpreter for Natural Language Programming and Flow Programming of AI Agents
par: Xu, Shuyuan, et autres
Publié: (2024)
par: Xu, Shuyuan, et autres
Publié: (2024)
Automated Rewards via LLM-Generated Progress Functions
par: Sarukkai, Vishnu, et autres
Publié: (2024)
par: Sarukkai, Vishnu, et autres
Publié: (2024)
BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning
par: Hage, Tarjei Paule, et autres
Publié: (2026)
par: Hage, Tarjei Paule, et autres
Publié: (2026)
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
par: Yang, Zhuolin, et autres
Publié: (2026)
par: Yang, Zhuolin, et autres
Publié: (2026)
Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
par: Damani, Mehul, et autres
Publié: (2025)
par: Damani, Mehul, et autres
Publié: (2025)
ShadowLLM: Predictor-based Contextual Sparsity for Large Language Models
par: Akhauri, Yash, et autres
Publié: (2024)
par: Akhauri, Yash, et autres
Publié: (2024)
Multilinguality in LLM-Designed Reward Functions for Restless Bandits: Effects on Task Performance and Fairness
par: Parthasarathy, Ambreesh, et autres
Publié: (2025)
par: Parthasarathy, Ambreesh, et autres
Publié: (2025)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
par: Djuhera, Aladin, et autres
Publié: (2026)
par: Djuhera, Aladin, et autres
Publié: (2026)
Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training
par: Ilin, Aleksei, et autres
Publié: (2025)
par: Ilin, Aleksei, et autres
Publié: (2025)
UserRL: Training Interactive User-Centric Agent via Reinforcement Learning
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
par: Zhu, Dingwei, et autres
Publié: (2025)
par: Zhu, Dingwei, et autres
Publié: (2025)
Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
par: Xia, Fanzeng, et autres
Publié: (2024)
par: Xia, Fanzeng, et autres
Publié: (2024)
ReDit: Reward Dithering for Improved LLM Policy Optimization
par: Wei, Chenxing, et autres
Publié: (2025)
par: Wei, Chenxing, et autres
Publié: (2025)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
par: Cheng, Ruoxi, et autres
Publié: (2025)
par: Cheng, Ruoxi, et autres
Publié: (2025)
Documents similaires
-
On Designing Effective RL Reward at Training Time for LLM Reasoning
par: Gao, Jiaxuan, et autres
Publié: (2024) -
FlowRL: Matching Reward Distributions for LLM Reasoning
par: Zhu, Xuekai, et autres
Publié: (2025) -
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
par: Pavlenko, Kirill, et autres
Publié: (2026) -
Formal-LLM: Integrating Formal Language and Natural Language for Controllable LLM-based Agents
par: Li, Zelong, et autres
Publié: (2024) -
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
par: Feng, Xiao, et autres
Publié: (2026)