Saved in:
| Main Authors: | Zaregarizi, Shadmehr, Yavari, Khashayar |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2605.28168 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PIRS: Physics-Informed Reward Shaping for SAC-Based Building Energy Management
by: Zaregarizi, Shadmehr, et al.
Published: (2026)
by: Zaregarizi, Shadmehr, et al.
Published: (2026)
Uncertainty-Aware Transfer Learning for Cross-Building Energy Forecasting: Toward Robust and Scalable District-Level Energy Management
by: Zaregarizi, Shadmehr, et al.
Published: (2026)
by: Zaregarizi, Shadmehr, et al.
Published: (2026)
From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge
by: Wu, Xiefeng
Published: (2024)
by: Wu, Xiefeng
Published: (2024)
VORTEX: Aligning Task Utility and Human Preferences through LLM-Guided Reward Shaping
by: Xiong, Guojun, et al.
Published: (2025)
by: Xiong, Guojun, et al.
Published: (2025)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
by: Holmes, Ian, et al.
Published: (2025)
by: Holmes, Ian, et al.
Published: (2025)
Bootstrapped Reward Shaping
by: Adamczyk, Jacob, et al.
Published: (2025)
by: Adamczyk, Jacob, et al.
Published: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
by: Fu, Jiayi, et al.
Published: (2025)
by: Fu, Jiayi, et al.
Published: (2025)
OccuEMBED: Occupancy Extraction Merged with Building Energy Disaggregation for Occupant-Responsive Operation at Scale
by: Zhang, Yufei, et al.
Published: (2025)
by: Zhang, Yufei, et al.
Published: (2025)
Boosting LLM Reasoning via Human-Inspired Reward Shaping
by: Lin, Wenze, et al.
Published: (2026)
by: Lin, Wenze, et al.
Published: (2026)
Principal-Agent Reward Shaping in MDPs
by: Ben-Porat, Omer, et al.
Published: (2023)
by: Ben-Porat, Omer, et al.
Published: (2023)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
by: Rezaei, Mohammad, et al.
Published: (2026)
by: Rezaei, Mohammad, et al.
Published: (2026)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
by: Liao, Baohao, et al.
Published: (2025)
by: Liao, Baohao, et al.
Published: (2025)
Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards
by: Rad, Ali, et al.
Published: (2026)
by: Rad, Ali, et al.
Published: (2026)
ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning
by: Abboud, Elie, et al.
Published: (2026)
by: Abboud, Elie, et al.
Published: (2026)
Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language
by: Hwang, Minyoung, et al.
Published: (2025)
by: Hwang, Minyoung, et al.
Published: (2025)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
by: Peng, Hao, et al.
Published: (2026)
by: Peng, Hao, et al.
Published: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
by: Xie, Tianbao, et al.
Published: (2023)
by: Xie, Tianbao, et al.
Published: (2023)
Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward
by: Hussain, Mustafa Anis, et al.
Published: (2026)
by: Hussain, Mustafa Anis, et al.
Published: (2026)
Cooperative Reward Shaping for Multi-Agent Pathfinding
by: Song, Zhenyu, et al.
Published: (2024)
by: Song, Zhenyu, et al.
Published: (2024)
Boosting Universal LLM Reward Design through Heuristic Reward Observation Space Evolution
by: Heng, Zen Kit, et al.
Published: (2025)
by: Heng, Zen Kit, et al.
Published: (2025)
One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models
by: Fein, Daniel, et al.
Published: (2026)
by: Fein, Daniel, et al.
Published: (2026)
Combining Automated Optimisation of Hyperparameters and Reward Shape
by: Dierkes, Julian, et al.
Published: (2024)
by: Dierkes, Julian, et al.
Published: (2024)
BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping
by: Lidayan, Aly, et al.
Published: (2024)
by: Lidayan, Aly, et al.
Published: (2024)
MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels
by: Luo, Tianyang, et al.
Published: (2026)
by: Luo, Tianyang, et al.
Published: (2026)
Automatic Reward Shaping from Confounded Offline Data
by: Li, Mingxuan, et al.
Published: (2025)
by: Li, Mingxuan, et al.
Published: (2025)
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
by: Elle
Published: (2025)
by: Elle
Published: (2025)
ARGS: Alignment as Reward-Guided Search
by: Khanov, Maxim, et al.
Published: (2024)
by: Khanov, Maxim, et al.
Published: (2024)
Reward Guided Latent Consistency Distillation
by: Li, Jiachen, et al.
Published: (2024)
by: Li, Jiachen, et al.
Published: (2024)
LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble
by: Lee, Yujeong, et al.
Published: (2024)
by: Lee, Yujeong, et al.
Published: (2024)
Confidence as a Reward: Transforming LLMs into Reward Models
by: Du, He, et al.
Published: (2025)
by: Du, He, et al.
Published: (2025)
Subgoal-based Reward Shaping to Improve Efficiency in Reinforcement Learning
by: Okudo, Takato, et al.
Published: (2021)
by: Okudo, Takato, et al.
Published: (2021)
Automatic Reward Shaping from Multi-Objective Human Heuristics
by: Xie, Yuqing, et al.
Published: (2025)
by: Xie, Yuqing, et al.
Published: (2025)
Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
by: Ma, Haozhe, et al.
Published: (2024)
by: Ma, Haozhe, et al.
Published: (2024)
The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
by: Liu, Yang, et al.
Published: (2026)
by: Liu, Yang, et al.
Published: (2026)
Guiding Multi-agent Multi-task Reinforcement Learning by a Hierarchical Framework with Logical Reward Shaping
by: Liu, Chanjuan, et al.
Published: (2024)
by: Liu, Chanjuan, et al.
Published: (2024)
VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion
by: Shekhar, Shivanshu, et al.
Published: (2026)
by: Shekhar, Shivanshu, et al.
Published: (2026)
Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo
by: Markovic-Voronov, Jelena, et al.
Published: (2026)
by: Markovic-Voronov, Jelena, et al.
Published: (2026)
Rubric-Guided Process Reward for Stepwise Model Routing
by: Ye, Shenghao, et al.
Published: (2026)
by: Ye, Shenghao, et al.
Published: (2026)
Leash: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model
by: Li, Yanhao, et al.
Published: (2025)
by: Li, Yanhao, et al.
Published: (2025)
Enhancing Multi-Hop Knowledge Graph Reasoning through Reward Shaping Techniques
by: Li, Chen, et al.
Published: (2024)
by: Li, Chen, et al.
Published: (2024)
Similar Items
-
PIRS: Physics-Informed Reward Shaping for SAC-Based Building Energy Management
by: Zaregarizi, Shadmehr, et al.
Published: (2026) -
Uncertainty-Aware Transfer Learning for Cross-Building Energy Forecasting: Toward Robust and Scalable District-Level Energy Management
by: Zaregarizi, Shadmehr, et al.
Published: (2026) -
From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge
by: Wu, Xiefeng
Published: (2024) -
VORTEX: Aligning Task Utility and Human Preferences through LLM-Guided Reward Shaping
by: Xiong, Guojun, et al.
Published: (2025) -
Attention-Based Reward Shaping for Sparse and Delayed Rewards
by: Holmes, Ian, et al.
Published: (2025)