From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Niu, Wenzhe, He, Wei, Xie, Zongxia, Ou, Jinpeng, Fan, Huichuan, Ge, Yuchen, Sun, Yanru, Wang, Ziyin, Sun, Yizhao, Shi, Chengshun, Gao, Jiuchong, Hao, Jinghua, He, Renqing |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
by: Chen, Xinzhu, et al.
Published: (2026)
by: Chen, Xinzhu, et al.
Published: (2026)
LangTime: A Language-Guided Unified Model for Time Series Forecasting with Proximal Policy Optimization
by: Niu, Wenzhe, et al.
Published: (2025)
by: Niu, Wenzhe, et al.
Published: (2025)
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
by: Zhang, Feng, et al.
Published: (2026)
by: Zhang, Feng, et al.
Published: (2026)
Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
by: Zhang, Nonghai, et al.
Published: (2026)
by: Zhang, Nonghai, et al.
Published: (2026)
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
by: Liu, Yan, et al.
Published: (2026)
by: Liu, Yan, et al.
Published: (2026)
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
by: Zhang, Jiaying, et al.
Published: (2026)
by: Zhang, Jiaying, et al.
Published: (2026)
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
by: Zou, Wenhao, et al.
Published: (2026)
by: Zou, Wenhao, et al.
Published: (2026)
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
by: Shi, Qinglong, et al.
Published: (2026)
by: Shi, Qinglong, et al.
Published: (2026)
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
by: Liu, Zihao, et al.
Published: (2026)
by: Liu, Zihao, et al.
Published: (2026)
Adapting LLMs to Time Series Forecasting via Temporal Heterogeneity Modeling and Semantic Alignment
by: Sun, Yanru, et al.
Published: (2025)
by: Sun, Yanru, et al.
Published: (2025)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
by: Ma, Weitao, et al.
Published: (2026)
by: Ma, Weitao, et al.
Published: (2026)
State Rank Dynamics in Linear Attention LLMs
by: Sun, Ao, et al.
Published: (2026)
by: Sun, Ao, et al.
Published: (2026)
SEED: Spectral Entropy-Guided Evaluation of SpatialTemporal Dependencies for Multivariate Time Series Forecasting
by: Xiong, Feng, et al.
Published: (2025)
by: Xiong, Feng, et al.
Published: (2025)
Lightweight Channel-wise Dynamic Fusion Model: Non-stationary Time Series Forecasting via Entropy Analysis
by: Jia, Tianyu, et al.
Published: (2025)
by: Jia, Tianyu, et al.
Published: (2025)
PPGF: Probability Pattern-Guided Time Series Forecasting
by: Sun, Yanru, et al.
Published: (2025)
by: Sun, Yanru, et al.
Published: (2025)
Hierarchical Classification Auxiliary Network for Time Series Forecasting
by: Sun, Yanru, et al.
Published: (2024)
by: Sun, Yanru, et al.
Published: (2024)
Patch-wise Structural Loss for Time Series Forecasting
by: Kudrat, Dilfira, et al.
Published: (2025)
by: Kudrat, Dilfira, et al.
Published: (2025)
Learning Pattern-Specific Experts for Time Series Forecasting Under Patch-level Distribution Shift
by: Sun, Yanru, et al.
Published: (2024)
by: Sun, Yanru, et al.
Published: (2024)
Despite Absolute Information Advantages, All Investors Incur Welfare Loss
by: Liang, Zongxia, et al.
Published: (2024)
by: Liang, Zongxia, et al.
Published: (2024)
Mean-Field Game of Relative Performance Portfolio for Two Populations with Poisson Common Noise
by: Li, Yuchen, et al.
Published: (2025)
by: Li, Yuchen, et al.
Published: (2025)
Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach
by: Li, Wenyun, et al.
Published: (2025)
by: Li, Wenyun, et al.
Published: (2025)
Rethinking Plasticity in Deep Reinforcement Learning
by: He, Zhiqiang
Published: (2026)
by: He, Zhiqiang
Published: (2026)
Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning
by: Li, Zichao, et al.
Published: (2026)
by: Li, Zichao, et al.
Published: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
by: Xie, Tianbao, et al.
Published: (2023)
by: Xie, Tianbao, et al.
Published: (2023)
Harvesting Efficient On-Demand Order Pooling from Skilled Couriers: Enhancing Graph Representation Learning for Refining Real-time Many-to-One Assignments
by: Liang, Yile, et al.
Published: (2024)
by: Liang, Yile, et al.
Published: (2024)
Relative-Absolute Fusion: Rethinking Feature Extraction in Image-Based Iterative Method Selection for Solving Sparse Linear Systems
by: Zhang, Kaiqi, et al.
Published: (2025)
by: Zhang, Kaiqi, et al.
Published: (2025)
Hydrodynamic modulation instability triggered by a two-wave system
by: He, Yuchen, et al.
Published: (2024)
by: He, Yuchen, et al.
Published: (2024)
VoiceAgentEval: A Dual-Dimensional Benchmark for Expert-Level Intelligent Voice-Agent Evaluation of Xbench's Professional-Aligned Series
by: Xu, Pengyu, et al.
Published: (2025)
by: Xu, Pengyu, et al.
Published: (2025)
Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue
by: Gao, Ning, et al.
Published: (2026)
by: Gao, Ning, et al.
Published: (2026)
Monotone Mean-Variance Portfolio Selection in Semimartingale Markets: Martingale Method
by: Li, Yuchen, et al.
Published: (2024)
by: Li, Yuchen, et al.
Published: (2024)
Continuous-Time Monotone Mean-Variance Portfolio Selection in Jump-Diffusion Model
by: Li, Yuchen, et al.
Published: (2022)
by: Li, Yuchen, et al.
Published: (2022)
ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning
by: Wang, Jinpeng, et al.
Published: (2025)
by: Wang, Jinpeng, et al.
Published: (2025)
The Absolute Anabelian Geometry of Virtual Curves Arising from Sections of Arithmetic Fundamental Groups of Configuration Spaces
by: Sun, Zeming
Published: (2025)
by: Sun, Zeming
Published: (2025)
Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?
by: Wen, Xueru, et al.
Published: (2024)
by: Wen, Xueru, et al.
Published: (2024)
A Mean Field Game Approach to Relative Investment-Consumption Games with Habit Formation
by: Liang, Zongxia, et al.
Published: (2024)
by: Liang, Zongxia, et al.
Published: (2024)
Least Absolute Deviation Utility for Trapezoidal Fuzzy Preference Relations
by: He, Lei, et al.
Published: (2025)
by: He, Lei, et al.
Published: (2025)
Seismic Behavior of Pile Group‐Supported Bridges in Liquefiable Sloping Ground Considering Vertical Ground Motion Effects
by: Kemin Jia, et al.
Published: (2026)
by: Kemin Jia, et al.
Published: (2026)
MixTex: Unambiguous Recognition Should Not Rely Solely on Real Data
by: Luo, Renqing, et al.
Published: (2024)
by: Luo, Renqing, et al.
Published: (2024)
Process Reinforcement through Implicit Rewards
by: Cui, Ganqu, et al.
Published: (2025)
by: Cui, Ganqu, et al.
Published: (2025)
REBEL: Reinforcement Learning via Regressing Relative Rewards
by: Gao, Zhaolin, et al.
Published: (2024)
by: Gao, Zhaolin, et al.
Published: (2024)
Similar Items
-
Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
by: Chen, Xinzhu, et al.
Published: (2026) -
LangTime: A Language-Guided Unified Model for Time Series Forecasting with Proximal Policy Optimization
by: Niu, Wenzhe, et al.
Published: (2025) -
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
by: Zhang, Feng, et al.
Published: (2026) -
Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
by: Zhang, Nonghai, et al.
Published: (2026) -
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
by: Liu, Yan, et al.
Published: (2026)