From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge
Fuente:
arXiv
Guardado en:
| Autor principal: | Wu, Xiefeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enhancing Q-Learning with Large Language Model Heuristics
por: Wu, Xiefeng
Publicado: (2024)
por: Wu, Xiefeng
Publicado: (2024)
Achieving Optimal Tissue Repair Through MARL with Reward Shaping and Curriculum Learning
por: Khan, Muhammad Al-Zafar, et al.
Publicado: (2025)
por: Khan, Muhammad Al-Zafar, et al.
Publicado: (2025)
Bootstrapped Reward Shaping
por: Adamczyk, Jacob, et al.
Publicado: (2025)
por: Adamczyk, Jacob, et al.
Publicado: (2025)
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
por: Wu, Xiefeng, et al.
Publicado: (2025)
por: Wu, Xiefeng, et al.
Publicado: (2025)
Boosting LLM Reasoning via Human-Inspired Reward Shaping
por: Lin, Wenze, et al.
Publicado: (2026)
por: Lin, Wenze, et al.
Publicado: (2026)
Memory-Based Advantage Shaping for LLM-Guided Reinforcement Learning
por: Nourzad, Narjes, et al.
Publicado: (2026)
por: Nourzad, Narjes, et al.
Publicado: (2026)
BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping
por: Lidayan, Aly, et al.
Publicado: (2024)
por: Lidayan, Aly, et al.
Publicado: (2024)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
por: Holmes, Ian, et al.
Publicado: (2025)
por: Holmes, Ian, et al.
Publicado: (2025)
Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients
por: Mansouri, Omar El, et al.
Publicado: (2025)
por: Mansouri, Omar El, et al.
Publicado: (2025)
MAESTRO: Multi-Agent Environment Shaping through Task and Reward Optimization
por: Wu, Boyuan
Publicado: (2025)
por: Wu, Boyuan
Publicado: (2025)
Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
por: Ma, Haozhe, et al.
Publicado: (2024)
por: Ma, Haozhe, et al.
Publicado: (2024)
Subgoal-based Reward Shaping to Improve Efficiency in Reinforcement Learning
por: Okudo, Takato, et al.
Publicado: (2021)
por: Okudo, Takato, et al.
Publicado: (2021)
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
por: Zhan, Simon Sinong, et al.
Publicado: (2024)
por: Zhan, Simon Sinong, et al.
Publicado: (2024)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
por: Xie, Tianbao, et al.
Publicado: (2023)
por: Xie, Tianbao, et al.
Publicado: (2023)
Combining Automated Optimisation of Hyperparameters and Reward Shape
por: Dierkes, Julian, et al.
Publicado: (2024)
por: Dierkes, Julian, et al.
Publicado: (2024)
On the Sample Efficiency of Abstractions and Potential-Based Reward Shaping in Reinforcement Learning
por: Canonaco, Giuseppe, et al.
Publicado: (2024)
por: Canonaco, Giuseppe, et al.
Publicado: (2024)
Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach
por: Li, Wenyun, et al.
Publicado: (2025)
por: Li, Wenyun, et al.
Publicado: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
por: Fu, Jiayi, et al.
Publicado: (2025)
por: Fu, Jiayi, et al.
Publicado: (2025)
Automatic Reward Shaping from Confounded Offline Data
por: Li, Mingxuan, et al.
Publicado: (2025)
por: Li, Mingxuan, et al.
Publicado: (2025)
Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning
por: Bhambri, Siddhant, et al.
Publicado: (2024)
por: Bhambri, Siddhant, et al.
Publicado: (2024)
Automatic Reward Shaping from Multi-Objective Human Heuristics
por: Xie, Yuqing, et al.
Publicado: (2025)
por: Xie, Yuqing, et al.
Publicado: (2025)
Learn to Reason Efficiently with Adaptive Length-based Reward Shaping
por: Liu, Wei, et al.
Publicado: (2025)
por: Liu, Wei, et al.
Publicado: (2025)
GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification
por: Gan, Wangjie, et al.
Publicado: (2026)
por: Gan, Wangjie, et al.
Publicado: (2026)
Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots
por: Deng, Boyuan, et al.
Publicado: (2025)
por: Deng, Boyuan, et al.
Publicado: (2025)
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
por: Wang, Haichuan, et al.
Publicado: (2026)
por: Wang, Haichuan, et al.
Publicado: (2026)
Confounding Robust Continuous Control via Automatic Reward Shaping
por: Juliani, Mateo, et al.
Publicado: (2026)
por: Juliani, Mateo, et al.
Publicado: (2026)
Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients
por: Thrampoulidis, Christos, et al.
Publicado: (2025)
por: Thrampoulidis, Christos, et al.
Publicado: (2025)
The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
Zero-Shot LLMs in Human-in-the-Loop RL: Replacing Human Feedback for Reward Shaping
por: Nazir, Mohammad Saif, et al.
Publicado: (2025)
por: Nazir, Mohammad Saif, et al.
Publicado: (2025)
MVR: Multi-view Video Reward Shaping for Reinforcement Learning
por: Luo, Lirui, et al.
Publicado: (2026)
por: Luo, Lirui, et al.
Publicado: (2026)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
por: Rezaei, Mohammad, et al.
Publicado: (2026)
por: Rezaei, Mohammad, et al.
Publicado: (2026)
Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining
por: Zhao, Junjie, et al.
Publicado: (2025)
por: Zhao, Junjie, et al.
Publicado: (2025)
DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning
por: Wang, Yujie, et al.
Publicado: (2026)
por: Wang, Yujie, et al.
Publicado: (2026)
Chunk-Guided Q-Learning
por: Song, Gwanwoo, et al.
Publicado: (2026)
por: Song, Gwanwoo, et al.
Publicado: (2026)
Shape-aware Graph Spectral Learning
por: Xu, Junjie, et al.
Publicado: (2023)
por: Xu, Junjie, et al.
Publicado: (2023)
Unbiased Online Curvature Approximation for Regularized Graph Continual Learning
por: Yin, Jie, et al.
Publicado: (2025)
por: Yin, Jie, et al.
Publicado: (2025)
Brep2Shape: Boundary and Shape Representation Alignment via Self-Supervised Transformers
por: Sun, Yuanxu, et al.
Publicado: (2026)
por: Sun, Yuanxu, et al.
Publicado: (2026)
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
por: Le, Thanh-Long V., et al.
Publicado: (2025)
por: Le, Thanh-Long V., et al.
Publicado: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
por: Li, Ke, et al.
Publicado: (2026)
por: Li, Ke, et al.
Publicado: (2026)
TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs
por: Xie, Yutao, et al.
Publicado: (2026)
por: Xie, Yutao, et al.
Publicado: (2026)
Ejemplares similares
-
Enhancing Q-Learning with Large Language Model Heuristics
por: Wu, Xiefeng
Publicado: (2024) -
Achieving Optimal Tissue Repair Through MARL with Reward Shaping and Curriculum Learning
por: Khan, Muhammad Al-Zafar, et al.
Publicado: (2025) -
Bootstrapped Reward Shaping
por: Adamczyk, Jacob, et al.
Publicado: (2025) -
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
por: Wu, Xiefeng, et al.
Publicado: (2025) -
Boosting LLM Reasoning via Human-Inspired Reward Shaping
por: Lin, Wenze, et al.
Publicado: (2026)