Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Peiran, Li, Zhuohao, Xing, Xiaoying, Zhang, Guannan, Li, Debiao, Shi, Kunyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
von: Shen, Yiran, et al.
Veröffentlicht: (2025)
von: Shen, Yiran, et al.
Veröffentlicht: (2025)
Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling
von: Li, Derek, et al.
Veröffentlicht: (2025)
von: Li, Derek, et al.
Veröffentlicht: (2025)
SemiReward: A General Reward Model for Semi-supervised Learning
von: Li, Siyuan, et al.
Veröffentlicht: (2023)
von: Li, Siyuan, et al.
Veröffentlicht: (2023)
HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning
von: Lu, Zhicong, et al.
Veröffentlicht: (2026)
von: Lu, Zhicong, et al.
Veröffentlicht: (2026)
Non-Normal Diffusion Models
von: Li, Henry
Veröffentlicht: (2024)
von: Li, Henry
Veröffentlicht: (2024)
Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach
von: Li, Wenyun, et al.
Veröffentlicht: (2025)
von: Li, Wenyun, et al.
Veröffentlicht: (2025)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
von: Yu, Zhuohao, et al.
Veröffentlicht: (2024)
von: Yu, Zhuohao, et al.
Veröffentlicht: (2024)
RewardAnything: Generalizable Principle-Following Reward Models
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling
von: Jian, Ai, et al.
Veröffentlicht: (2025)
von: Jian, Ai, et al.
Veröffentlicht: (2025)
K-Score: Kalman Filter as a Principled Alternative to Reward Normalization in Reinforcement Learning
von: Xia, Zixuan, et al.
Veröffentlicht: (2026)
von: Xia, Zixuan, et al.
Veröffentlicht: (2026)
HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
von: Wu, Peilin, et al.
Veröffentlicht: (2025)
von: Wu, Peilin, et al.
Veröffentlicht: (2025)
Process Rewards with Learned Reliability
von: Li, Jinyuan, et al.
Veröffentlicht: (2026)
von: Li, Jinyuan, et al.
Veröffentlicht: (2026)
Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis
von: Qiu, Zhisong, et al.
Veröffentlicht: (2026)
von: Qiu, Zhisong, et al.
Veröffentlicht: (2026)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
von: Li, Jiawei, et al.
Veröffentlicht: (2024)
von: Li, Jiawei, et al.
Veröffentlicht: (2024)
Curvature Dynamic Black-box Attack: revisiting adversarial robustness via dynamic curvature estimation
von: Sun, Peiran
Veröffentlicht: (2025)
von: Sun, Peiran
Veröffentlicht: (2025)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
von: Xiong, Xiqiao, et al.
Veröffentlicht: (2025)
von: Xiong, Xiqiao, et al.
Veröffentlicht: (2025)
Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation
von: Zhang, Xiaoying, et al.
Veröffentlicht: (2024)
von: Zhang, Xiaoying, et al.
Veröffentlicht: (2024)
Normalizing self-supervised learning for provably reliable Change Point Detection
von: Bazarova, Alexandra, et al.
Veröffentlicht: (2024)
von: Bazarova, Alexandra, et al.
Veröffentlicht: (2024)
Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes
von: Trapasso, Alessandro, et al.
Veröffentlicht: (2025)
von: Trapasso, Alessandro, et al.
Veröffentlicht: (2025)
Dataset Distillation-based Hybrid Federated Learning on Non-IID Data
von: Shi, Xiufang, et al.
Veröffentlicht: (2024)
von: Shi, Xiufang, et al.
Veröffentlicht: (2024)
Process Reinforcement through Implicit Rewards
von: Cui, Ganqu, et al.
Veröffentlicht: (2025)
von: Cui, Ganqu, et al.
Veröffentlicht: (2025)
Supplement Generation Training for Enhancing Agentic Task Performance
von: Cho, Young Min, et al.
Veröffentlicht: (2026)
von: Cho, Young Min, et al.
Veröffentlicht: (2026)
TF-MCL: Time-frequency Fusion and Multi-domain Cross-Loss for Self-supervised Depression Detection
von: Zhao, Li-Xuan, et al.
Veröffentlicht: (2025)
von: Zhao, Li-Xuan, et al.
Veröffentlicht: (2025)
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
von: Feng, Xiao, et al.
Veröffentlicht: (2026)
von: Feng, Xiao, et al.
Veröffentlicht: (2026)
Beyond Distribution Sharpening: The Importance of Task Rewards
von: Mittal, Sarthak, et al.
Veröffentlicht: (2026)
von: Mittal, Sarthak, et al.
Veröffentlicht: (2026)
New Hybrid Fine-Tuning Paradigm for LLMs: Algorithm Design and Convergence Analysis Framework
von: Ma, Shaocong, et al.
Veröffentlicht: (2026)
von: Ma, Shaocong, et al.
Veröffentlicht: (2026)
Adversarial Training for Process Reward Models
von: Juneja, Gurusha, et al.
Veröffentlicht: (2025)
von: Juneja, Gurusha, et al.
Veröffentlicht: (2025)
Towards Effective Theory of LLMs: A Representation Learning Approach
von: Ustaomeroglu, Muhammed, et al.
Veröffentlicht: (2026)
von: Ustaomeroglu, Muhammed, et al.
Veröffentlicht: (2026)
DistDD: Distributed Data Distillation Aggregation through Gradient Matching
von: Wang, Peiran, et al.
Veröffentlicht: (2024)
von: Wang, Peiran, et al.
Veröffentlicht: (2024)
Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)
HybridNorm: Towards Stable and Efficient Transformer Training via Hybrid Normalization
von: Zhuo, Zhijian, et al.
Veröffentlicht: (2025)
von: Zhuo, Zhijian, et al.
Veröffentlicht: (2025)
Multi-Task Reward Learning from Human Ratings
von: Wu, Mingkang, et al.
Veröffentlicht: (2025)
von: Wu, Mingkang, et al.
Veröffentlicht: (2025)
Policy Filtration for RLHF to Mitigate Noise in Reward Models
von: Zhang, Chuheng, et al.
Veröffentlicht: (2024)
von: Zhang, Chuheng, et al.
Veröffentlicht: (2024)
GeoFlow: Agentic Workflow Automation for Geospatial Tasks
von: Bhattaram, Amulya, et al.
Veröffentlicht: (2025)
von: Bhattaram, Amulya, et al.
Veröffentlicht: (2025)
Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training
von: Ye, Chenlu, et al.
Veröffentlicht: (2025)
von: Ye, Chenlu, et al.
Veröffentlicht: (2025)
GRPO is Secretly a Process Reward Model
von: Sullivan, Michael, et al.
Veröffentlicht: (2025)
von: Sullivan, Michael, et al.
Veröffentlicht: (2025)
Interpretable Hybrid-Rule Temporal Point Processes
von: Cao, Yunyang, et al.
Veröffentlicht: (2025)
von: Cao, Yunyang, et al.
Veröffentlicht: (2025)
Provably Efficient Reward Transfer in Reinforcement Learning with Discrete Markov Decision Processes
von: Vora, Kevin, et al.
Veröffentlicht: (2025)
von: Vora, Kevin, et al.
Veröffentlicht: (2025)
Advancing Safe Mechanical Ventilation Using Offline RL With Hybrid Actions and Clinically Aligned Rewards
von: Yousuf, Muhammad Hamza, et al.
Veröffentlicht: (2025)
von: Yousuf, Muhammad Hamza, et al.
Veröffentlicht: (2025)
Exploring Open-world Continual Learning with Knowns-Unknowns Knowledge Transfer
von: Li, Yujie, et al.
Veröffentlicht: (2025)
von: Li, Yujie, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
von: Shen, Yiran, et al.
Veröffentlicht: (2025) -
Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling
von: Li, Derek, et al.
Veröffentlicht: (2025) -
SemiReward: A General Reward Model for Semi-supervised Learning
von: Li, Siyuan, et al.
Veröffentlicht: (2023) -
HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning
von: Lu, Zhicong, et al.
Veröffentlicht: (2026) -
Non-Normal Diffusion Models
von: Li, Henry
Veröffentlicht: (2024)