Boosting Universal LLM Reward Design through Heuristic Reward Observation Space Evolution
Fuente:
arXiv
Guardado en:
| Autores principales: | Heng, Zen Kit, Zhao, Zimeng, Wu, Tianhao, Wang, Yuanfei, Wu, Mingdong, Wang, Yangang, Dong, Hao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GraspGF: Learning Score-based Grasping Primitive for Human-assisting Dexterous Grasping
por: Wu, Tianhao, et al.
Publicado: (2023)
por: Wu, Tianhao, et al.
Publicado: (2023)
DiffusionReward: Enhancing Blind Face Restoration through Reward Feedback Learning
por: Wu, Bin, et al.
Publicado: (2025)
por: Wu, Bin, et al.
Publicado: (2025)
AdaManip: Adaptive Articulated Object Manipulation Environments and Policy Learning
por: Wang, Yuanfei, et al.
Publicado: (2025)
por: Wang, Yuanfei, et al.
Publicado: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
por: Fu, Jiayi, et al.
Publicado: (2025)
por: Fu, Jiayi, et al.
Publicado: (2025)
Towards Socially and Morally Aware RL agent: Reward Design With LLM
por: Wang, Zhaoyue
Publicado: (2024)
por: Wang, Zhaoyue
Publicado: (2024)
Automatic Reward Shaping from Multi-Objective Human Heuristics
por: Xie, Yuqing, et al.
Publicado: (2025)
por: Xie, Yuqing, et al.
Publicado: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
por: Gao, Jiaxuan, et al.
Publicado: (2024)
por: Gao, Jiaxuan, et al.
Publicado: (2024)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
por: Wu, Tianhao, et al.
Publicado: (2024)
por: Wu, Tianhao, et al.
Publicado: (2024)
Boosting LLM Reasoning via Human-Inspired Reward Shaping
por: Lin, Wenze, et al.
Publicado: (2026)
por: Lin, Wenze, et al.
Publicado: (2026)
Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation
por: Zhou, Jiang, et al.
Publicado: (2026)
por: Zhou, Jiang, et al.
Publicado: (2026)
Enhancing CVRP Solver through LLM-driven Automatic Heuristic Design
por: Xie, Zhuoliang, et al.
Publicado: (2026)
por: Xie, Zhuoliang, et al.
Publicado: (2026)
Co-Evolution of Policy and Internal Reward for Language Agents
por: Wang, Xinyu, et al.
Publicado: (2026)
por: Wang, Xinyu, et al.
Publicado: (2026)
Reward Model Routing in Alignment
por: Wu, Xinle, et al.
Publicado: (2025)
por: Wu, Xinle, et al.
Publicado: (2025)
Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models
por: Wu, Yanru, et al.
Publicado: (2026)
por: Wu, Yanru, et al.
Publicado: (2026)
MAESTRO: Multi-Agent Environment Shaping through Task and Reward Optimization
por: Wu, Boyuan
Publicado: (2025)
por: Wu, Boyuan
Publicado: (2025)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
por: Wang, Chaoqi, et al.
Publicado: (2025)
por: Wang, Chaoqi, et al.
Publicado: (2025)
Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration
por: Zhang, Qifan, et al.
Publicado: (2026)
por: Zhang, Qifan, et al.
Publicado: (2026)
IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning
por: Qin, Yihao, et al.
Publicado: (2026)
por: Qin, Yihao, et al.
Publicado: (2026)
Enhancing LLM Reasoning with Reward-guided Tree Search
por: Jiang, Jinhao, et al.
Publicado: (2024)
por: Jiang, Jinhao, et al.
Publicado: (2024)
Structural Reward Model: Enhancing Interpretability, Efficiency, and Scalability in Reward Modeling
por: Liu, Xiaoyu, et al.
Publicado: (2025)
por: Liu, Xiaoyu, et al.
Publicado: (2025)
SemiReward: A General Reward Model for Semi-supervised Learning
por: Li, Siyuan, et al.
Publicado: (2023)
por: Li, Siyuan, et al.
Publicado: (2023)
BEAM: Bi-level Memory-adaptive Algorithmic Evolution for LLM-Powered Heuristic Design
por: Xiang, Chuyang, et al.
Publicado: (2026)
por: Xiang, Chuyang, et al.
Publicado: (2026)
RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses
por: Wu, Feiyu, et al.
Publicado: (2026)
por: Wu, Feiyu, et al.
Publicado: (2026)
Optimal Transport for LLM Reward Modeling from Noisy Preference
por: Pan, Licheng, et al.
Publicado: (2026)
por: Pan, Licheng, et al.
Publicado: (2026)
Verifiable Process Rewards for Agentic Reasoning
por: Yuan, Huining, et al.
Publicado: (2026)
por: Yuan, Huining, et al.
Publicado: (2026)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
por: Peng, Hao, et al.
Publicado: (2026)
por: Peng, Hao, et al.
Publicado: (2026)
From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge
por: Wu, Xiefeng
Publicado: (2024)
por: Wu, Xiefeng
Publicado: (2024)
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
por: Zhan, Simon Sinong, et al.
Publicado: (2024)
por: Zhan, Simon Sinong, et al.
Publicado: (2024)
RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models
por: Wu, Hao, et al.
Publicado: (2026)
por: Wu, Hao, et al.
Publicado: (2026)
G-LNS: Generative Large Neighborhood Search for LLM-Based Automatic Heuristic Design
por: Zhao, Baoyun, et al.
Publicado: (2026)
por: Zhao, Baoyun, et al.
Publicado: (2026)
TIDE: Tuning-Integrated Dynamic Evolution for LLM-Based Automated Heuristic Design
por: Chen, Chentong, et al.
Publicado: (2026)
por: Chen, Chentong, et al.
Publicado: (2026)
Process Reinforcement through Implicit Rewards
por: Cui, Ganqu, et al.
Publicado: (2025)
por: Cui, Ganqu, et al.
Publicado: (2025)
Automated Reward Design for Gran Turismo
por: Ma, Michel, et al.
Publicado: (2025)
por: Ma, Michel, et al.
Publicado: (2025)
Tiered Reward: Designing Rewards for Specification and Fast Learning of Desired Behavior
por: Zhou, Zhiyuan, et al.
Publicado: (2022)
por: Zhou, Zhiyuan, et al.
Publicado: (2022)
What Are Step-Level Reward Models Rewarding? Counterintuitive Findings from MCTS-Boosted Mathematical Reasoning
por: Ma, Yiran, et al.
Publicado: (2024)
por: Ma, Yiran, et al.
Publicado: (2024)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
por: Li, Hao, et al.
Publicado: (2023)
por: Li, Hao, et al.
Publicado: (2023)
Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning
por: Bhambri, Siddhant, et al.
Publicado: (2024)
por: Bhambri, Siddhant, et al.
Publicado: (2024)
Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents
por: Wang, Yiding, et al.
Publicado: (2025)
por: Wang, Yiding, et al.
Publicado: (2025)
Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
por: Chen, Sirui, et al.
Publicado: (2026)
por: Chen, Sirui, et al.
Publicado: (2026)
MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling
por: Feng, Zhaopeng, et al.
Publicado: (2025)
por: Feng, Zhaopeng, et al.
Publicado: (2025)
Ejemplares similares
-
GraspGF: Learning Score-based Grasping Primitive for Human-assisting Dexterous Grasping
por: Wu, Tianhao, et al.
Publicado: (2023) -
DiffusionReward: Enhancing Blind Face Restoration through Reward Feedback Learning
por: Wu, Bin, et al.
Publicado: (2025) -
AdaManip: Adaptive Articulated Object Manipulation Environments and Policy Learning
por: Wang, Yuanfei, et al.
Publicado: (2025) -
Reward Shaping to Mitigate Reward Hacking in RLHF
por: Fu, Jiayi, et al.
Publicado: (2025) -
Towards Socially and Morally Aware RL agent: Reward Design With LLM
por: Wang, Zhaoyue
Publicado: (2024)