Using Large Language Models to Automate and Expedite Reinforcement Learning with Reward Machine
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Alsadat, Shayan Meshkat, Gaglione, Jean-Raphael, Neider, Daniel, Topcu, Ufuk, Xu, Zhe |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Reinforcement Learning with Symbolic Reward Machines
von: Krug, Thomas, et al.
Veröffentlicht: (2026)
von: Krug, Thomas, et al.
Veröffentlicht: (2026)
Reinforcement Learning with Stochastic Reward Machines
von: Corazza, Jan, et al.
Veröffentlicht: (2025)
von: Corazza, Jan, et al.
Veröffentlicht: (2025)
Expediting Reinforcement Learning by Incorporating Knowledge About Temporal Causality in the Environment
von: Corazza, Jan, et al.
Veröffentlicht: (2025)
von: Corazza, Jan, et al.
Veröffentlicht: (2025)
Dynamic Coalition Structure Detection in Natural Language-based Interactions
von: Kulkarni, Abhishek N., et al.
Veröffentlicht: (2025)
von: Kulkarni, Abhishek N., et al.
Veröffentlicht: (2025)
Multimodal Pretrained Models for Verifiable Sequential Decision-Making: Planning, Grounding, and Perception
von: Yang, Yunhao, et al.
Veröffentlicht: (2023)
von: Yang, Yunhao, et al.
Veröffentlicht: (2023)
Fine-Tuning Language Models Using Formal Methods Feedback
von: Yang, Yunhao, et al.
Veröffentlicht: (2023)
von: Yang, Yunhao, et al.
Veröffentlicht: (2023)
Fine-Tuning Multilingual Language Models for Code Review: An Empirical Study on Industrial C# Projects
von: Begolli, Igli, et al.
Veröffentlicht: (2025)
von: Begolli, Igli, et al.
Veröffentlicht: (2025)
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
von: Hong, Haitao, et al.
Veröffentlicht: (2025)
von: Hong, Haitao, et al.
Veröffentlicht: (2025)
Large Language Models Streamline Automated Machine Learning for Clinical Studies
von: Arasteh, Soroosh Tayebi, et al.
Veröffentlicht: (2023)
von: Arasteh, Soroosh Tayebi, et al.
Veröffentlicht: (2023)
Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models
von: Bani-Harouni, David, et al.
Veröffentlicht: (2025)
von: Bani-Harouni, David, et al.
Veröffentlicht: (2025)
Zero-Shot Reinforcement Learning via Function Encoders
von: Ingebrand, Tyler, et al.
Veröffentlicht: (2024)
von: Ingebrand, Tyler, et al.
Veröffentlicht: (2024)
Large Language Models Synergize with Automated Machine Learning
von: Xu, Jinglue, et al.
Veröffentlicht: (2024)
von: Xu, Jinglue, et al.
Veröffentlicht: (2024)
Joint Verification and Refinement of Language Models for Safety-Constrained Planning
von: Yang, Yunhao, et al.
Veröffentlicht: (2024)
von: Yang, Yunhao, et al.
Veröffentlicht: (2024)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
von: Hu, Bokai, et al.
Veröffentlicht: (2024)
von: Hu, Bokai, et al.
Veröffentlicht: (2024)
Why Do LLMs Struggle in Strategic Play? Broken Links Between Observations, Beliefs, and Actions
von: Sobotka, Jan, et al.
Veröffentlicht: (2026)
von: Sobotka, Jan, et al.
Veröffentlicht: (2026)
Reasoning, Memorization, and Fine-Tuning Language Models for Non-Cooperative Games
von: Yang, Yunhao, et al.
Veröffentlicht: (2024)
von: Yang, Yunhao, et al.
Veröffentlicht: (2024)
Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning
von: Mo, Shentong
Veröffentlicht: (2026)
von: Mo, Shentong
Veröffentlicht: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning
von: Wachi, Akifumi, et al.
Veröffentlicht: (2026)
von: Wachi, Akifumi, et al.
Veröffentlicht: (2026)
Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2025)
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2025)
Automating Adjudication of Cardiovascular Events Using Large Language Models
von: Sivarajkumar, Sonish, et al.
Veröffentlicht: (2025)
von: Sivarajkumar, Sonish, et al.
Veröffentlicht: (2025)
Reviving The Classics: Active Reward Modeling in Large Language Model Alignment
von: Shen, Yunyi, et al.
Veröffentlicht: (2025)
von: Shen, Yunyi, et al.
Veröffentlicht: (2025)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
von: Cao, Meng, et al.
Veröffentlicht: (2024)
von: Cao, Meng, et al.
Veröffentlicht: (2024)
Automated Triaging and Transfer Learning of Incident Learning Safety Reports Using Large Language Representational Models
von: Beidler, Peter, et al.
Veröffentlicht: (2025)
von: Beidler, Peter, et al.
Veröffentlicht: (2025)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
von: Shen, Wei, et al.
Veröffentlicht: (2024)
von: Shen, Wei, et al.
Veröffentlicht: (2024)
Human-Agent Cooperation in Games under Incomplete Information through Natural Language Communication
von: Chen, Shenghui, et al.
Veröffentlicht: (2024)
von: Chen, Shenghui, et al.
Veröffentlicht: (2024)
What is Formal Verification without Specifications? A Survey on mining LTL Specifications
von: Neider, Daniel, et al.
Veröffentlicht: (2025)
von: Neider, Daniel, et al.
Veröffentlicht: (2025)
Reinforcement Learning with Conditional Expectation Reward
von: Xiao, Changyi, et al.
Veröffentlicht: (2026)
von: Xiao, Changyi, et al.
Veröffentlicht: (2026)
Reinforcement Learning Problem Solving with Large Language Models
von: Gholamian, Sina, et al.
Veröffentlicht: (2024)
von: Gholamian, Sina, et al.
Veröffentlicht: (2024)
Self-Rewarding Language Models
von: Yuan, Weizhe, et al.
Veröffentlicht: (2024)
von: Yuan, Weizhe, et al.
Veröffentlicht: (2024)
Expediting and Elevating Large Language Model Reasoning via Hidden Chain-of-Thought Decoding
von: Liu, Tianqiao, et al.
Veröffentlicht: (2024)
von: Liu, Tianqiao, et al.
Veröffentlicht: (2024)
Anti-adversarial Learning: Desensitizing Prompts for Large Language Models
von: Li, Xuan, et al.
Veröffentlicht: (2025)
von: Li, Xuan, et al.
Veröffentlicht: (2025)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
von: Tang, Zecheng, et al.
Veröffentlicht: (2026)
von: Tang, Zecheng, et al.
Veröffentlicht: (2026)
Adaptive Shielding for Safe Reinforcement Learning under Hidden-Parameter Dynamics Shifts
von: Kwon, Minjae, et al.
Veröffentlicht: (2025)
von: Kwon, Minjae, et al.
Veröffentlicht: (2025)
SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation
von: Yang, Wenjie, et al.
Veröffentlicht: (2025)
von: Yang, Wenjie, et al.
Veröffentlicht: (2025)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
von: Li, Hao, et al.
Veröffentlicht: (2023)
von: Li, Hao, et al.
Veröffentlicht: (2023)
Iter-AHMCL: Alleviate Hallucination for Large Language Model via Iterative Model-level Contrastive Learning
von: Wu, Huiwen, et al.
Veröffentlicht: (2024)
von: Wu, Huiwen, et al.
Veröffentlicht: (2024)
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
von: Denison, Carson, et al.
Veröffentlicht: (2024)
von: Denison, Carson, et al.
Veröffentlicht: (2024)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
von: Wang, Jiongxiao, et al.
Veröffentlicht: (2023)
von: Wang, Jiongxiao, et al.
Veröffentlicht: (2023)
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
von: Yan, Yuchen, et al.
Veröffentlicht: (2025)
von: Yan, Yuchen, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Reinforcement Learning with Symbolic Reward Machines
von: Krug, Thomas, et al.
Veröffentlicht: (2026) -
Reinforcement Learning with Stochastic Reward Machines
von: Corazza, Jan, et al.
Veröffentlicht: (2025) -
Expediting Reinforcement Learning by Incorporating Knowledge About Temporal Causality in the Environment
von: Corazza, Jan, et al.
Veröffentlicht: (2025) -
Dynamic Coalition Structure Detection in Natural Language-based Interactions
von: Kulkarni, Abhishek N., et al.
Veröffentlicht: (2025) -
Multimodal Pretrained Models for Verifiable Sequential Decision-Making: Planning, Grounding, and Perception
von: Yang, Yunhao, et al.
Veröffentlicht: (2023)