From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Wu, Xiefeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Enhancing Q-Learning with Large Language Model Heuristics
von: Wu, Xiefeng
Veröffentlicht: (2024)
von: Wu, Xiefeng
Veröffentlicht: (2024)
Achieving Optimal Tissue Repair Through MARL with Reward Shaping and Curriculum Learning
von: Khan, Muhammad Al-Zafar, et al.
Veröffentlicht: (2025)
von: Khan, Muhammad Al-Zafar, et al.
Veröffentlicht: (2025)
Bootstrapped Reward Shaping
von: Adamczyk, Jacob, et al.
Veröffentlicht: (2025)
von: Adamczyk, Jacob, et al.
Veröffentlicht: (2025)
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
von: Wu, Xiefeng, et al.
Veröffentlicht: (2025)
von: Wu, Xiefeng, et al.
Veröffentlicht: (2025)
Boosting LLM Reasoning via Human-Inspired Reward Shaping
von: Lin, Wenze, et al.
Veröffentlicht: (2026)
von: Lin, Wenze, et al.
Veröffentlicht: (2026)
Memory-Based Advantage Shaping for LLM-Guided Reinforcement Learning
von: Nourzad, Narjes, et al.
Veröffentlicht: (2026)
von: Nourzad, Narjes, et al.
Veröffentlicht: (2026)
BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping
von: Lidayan, Aly, et al.
Veröffentlicht: (2024)
von: Lidayan, Aly, et al.
Veröffentlicht: (2024)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
von: Holmes, Ian, et al.
Veröffentlicht: (2025)
von: Holmes, Ian, et al.
Veröffentlicht: (2025)
Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients
von: Mansouri, Omar El, et al.
Veröffentlicht: (2025)
von: Mansouri, Omar El, et al.
Veröffentlicht: (2025)
MAESTRO: Multi-Agent Environment Shaping through Task and Reward Optimization
von: Wu, Boyuan
Veröffentlicht: (2025)
von: Wu, Boyuan
Veröffentlicht: (2025)
Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
von: Ma, Haozhe, et al.
Veröffentlicht: (2024)
von: Ma, Haozhe, et al.
Veröffentlicht: (2024)
Subgoal-based Reward Shaping to Improve Efficiency in Reinforcement Learning
von: Okudo, Takato, et al.
Veröffentlicht: (2021)
von: Okudo, Takato, et al.
Veröffentlicht: (2021)
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
von: Zhan, Simon Sinong, et al.
Veröffentlicht: (2024)
von: Zhan, Simon Sinong, et al.
Veröffentlicht: (2024)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
Combining Automated Optimisation of Hyperparameters and Reward Shape
von: Dierkes, Julian, et al.
Veröffentlicht: (2024)
von: Dierkes, Julian, et al.
Veröffentlicht: (2024)
On the Sample Efficiency of Abstractions and Potential-Based Reward Shaping in Reinforcement Learning
von: Canonaco, Giuseppe, et al.
Veröffentlicht: (2024)
von: Canonaco, Giuseppe, et al.
Veröffentlicht: (2024)
Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach
von: Li, Wenyun, et al.
Veröffentlicht: (2025)
von: Li, Wenyun, et al.
Veröffentlicht: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
Automatic Reward Shaping from Confounded Offline Data
von: Li, Mingxuan, et al.
Veröffentlicht: (2025)
von: Li, Mingxuan, et al.
Veröffentlicht: (2025)
Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning
von: Bhambri, Siddhant, et al.
Veröffentlicht: (2024)
von: Bhambri, Siddhant, et al.
Veröffentlicht: (2024)
Automatic Reward Shaping from Multi-Objective Human Heuristics
von: Xie, Yuqing, et al.
Veröffentlicht: (2025)
von: Xie, Yuqing, et al.
Veröffentlicht: (2025)
Learn to Reason Efficiently with Adaptive Length-based Reward Shaping
von: Liu, Wei, et al.
Veröffentlicht: (2025)
von: Liu, Wei, et al.
Veröffentlicht: (2025)
GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification
von: Gan, Wangjie, et al.
Veröffentlicht: (2026)
von: Gan, Wangjie, et al.
Veröffentlicht: (2026)
Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots
von: Deng, Boyuan, et al.
Veröffentlicht: (2025)
von: Deng, Boyuan, et al.
Veröffentlicht: (2025)
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
von: Wang, Haichuan, et al.
Veröffentlicht: (2026)
von: Wang, Haichuan, et al.
Veröffentlicht: (2026)
Confounding Robust Continuous Control via Automatic Reward Shaping
von: Juliani, Mateo, et al.
Veröffentlicht: (2026)
von: Juliani, Mateo, et al.
Veröffentlicht: (2026)
Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients
von: Thrampoulidis, Christos, et al.
Veröffentlicht: (2025)
von: Thrampoulidis, Christos, et al.
Veröffentlicht: (2025)
The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
von: Liu, Yang, et al.
Veröffentlicht: (2026)
von: Liu, Yang, et al.
Veröffentlicht: (2026)
Zero-Shot LLMs in Human-in-the-Loop RL: Replacing Human Feedback for Reward Shaping
von: Nazir, Mohammad Saif, et al.
Veröffentlicht: (2025)
von: Nazir, Mohammad Saif, et al.
Veröffentlicht: (2025)
MVR: Multi-view Video Reward Shaping for Reinforcement Learning
von: Luo, Lirui, et al.
Veröffentlicht: (2026)
von: Luo, Lirui, et al.
Veröffentlicht: (2026)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
von: Rezaei, Mohammad, et al.
Veröffentlicht: (2026)
von: Rezaei, Mohammad, et al.
Veröffentlicht: (2026)
Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining
von: Zhao, Junjie, et al.
Veröffentlicht: (2025)
von: Zhao, Junjie, et al.
Veröffentlicht: (2025)
DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning
von: Wang, Yujie, et al.
Veröffentlicht: (2026)
von: Wang, Yujie, et al.
Veröffentlicht: (2026)
Chunk-Guided Q-Learning
von: Song, Gwanwoo, et al.
Veröffentlicht: (2026)
von: Song, Gwanwoo, et al.
Veröffentlicht: (2026)
Shape-aware Graph Spectral Learning
von: Xu, Junjie, et al.
Veröffentlicht: (2023)
von: Xu, Junjie, et al.
Veröffentlicht: (2023)
Unbiased Online Curvature Approximation for Regularized Graph Continual Learning
von: Yin, Jie, et al.
Veröffentlicht: (2025)
von: Yin, Jie, et al.
Veröffentlicht: (2025)
Brep2Shape: Boundary and Shape Representation Alignment via Self-Supervised Transformers
von: Sun, Yuanxu, et al.
Veröffentlicht: (2026)
von: Sun, Yuanxu, et al.
Veröffentlicht: (2026)
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
von: Le, Thanh-Long V., et al.
Veröffentlicht: (2025)
von: Le, Thanh-Long V., et al.
Veröffentlicht: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
von: Li, Ke, et al.
Veröffentlicht: (2026)
von: Li, Ke, et al.
Veröffentlicht: (2026)
TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs
von: Xie, Yutao, et al.
Veröffentlicht: (2026)
von: Xie, Yutao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Enhancing Q-Learning with Large Language Model Heuristics
von: Wu, Xiefeng
Veröffentlicht: (2024) -
Achieving Optimal Tissue Repair Through MARL with Reward Shaping and Curriculum Learning
von: Khan, Muhammad Al-Zafar, et al.
Veröffentlicht: (2025) -
Bootstrapped Reward Shaping
von: Adamczyk, Jacob, et al.
Veröffentlicht: (2025) -
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
von: Wu, Xiefeng, et al.
Veröffentlicht: (2025) -
Boosting LLM Reasoning via Human-Inspired Reward Shaping
von: Lin, Wenze, et al.
Veröffentlicht: (2026)