Adversarial Training for Process Reward Models
Fuente:
arXiv
Saved in:
| Main Authors: | Juneja, Gurusha, Nathani, Deepak, Wang, William Yang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Task Facet Learning: A Structured Approach to Prompt Optimization
by: Juneja, Gurusha, et al.
Published: (2024)
by: Juneja, Gurusha, et al.
Published: (2024)
Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable
by: Saha, Rounak, et al.
Published: (2026)
by: Saha, Rounak, et al.
Published: (2026)
$\texttt{LM}^\texttt{2}$: A Simple Society of Language Models Solves Complex Reasoning
by: Juneja, Gurusha, et al.
Published: (2024)
by: Juneja, Gurusha, et al.
Published: (2024)
Efficient Process Reward Model Training via Active Learning
by: Duan, Keyu, et al.
Published: (2025)
by: Duan, Keyu, et al.
Published: (2025)
MAGPIE: A dataset for Multi-AGent contextual PrIvacy Evaluation
by: Juneja, Gurusha, et al.
Published: (2025)
by: Juneja, Gurusha, et al.
Published: (2025)
Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking
by: Beigi, Mohammad, et al.
Published: (2026)
by: Beigi, Mohammad, et al.
Published: (2026)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
by: Yang, Shidong, et al.
Published: (2026)
by: Yang, Shidong, et al.
Published: (2026)
Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training
by: Ye, Chenlu, et al.
Published: (2025)
by: Ye, Chenlu, et al.
Published: (2025)
Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo
by: Markovic-Voronov, Jelena, et al.
Published: (2026)
by: Markovic-Voronov, Jelena, et al.
Published: (2026)
Diffusion-Reward Adversarial Imitation Learning
by: Lai, Chun-Mao, et al.
Published: (2024)
by: Lai, Chun-Mao, et al.
Published: (2024)
Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation
by: Zhang, Xiaoying, et al.
Published: (2024)
by: Zhang, Xiaoying, et al.
Published: (2024)
Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
by: Nathani, Deepak, et al.
Published: (2026)
by: Nathani, Deepak, et al.
Published: (2026)
GRPO is Secretly a Process Reward Model
by: Sullivan, Michael, et al.
Published: (2025)
by: Sullivan, Michael, et al.
Published: (2025)
Process Reward Models That Think
by: Khalifa, Muhammad, et al.
Published: (2025)
by: Khalifa, Muhammad, et al.
Published: (2025)
Meta Policy Switching for Secure UAV Deconfliction in Adversarial Airspace
by: Panda, Deepak Kumar, et al.
Published: (2025)
by: Panda, Deepak Kumar, et al.
Published: (2025)
Generative Adversarial Evasion and Out-of-Distribution Detection for UAV Cyber-Attacks
by: Panda, Deepak Kumar, et al.
Published: (2025)
by: Panda, Deepak Kumar, et al.
Published: (2025)
Conflict-Aware Adversarial Training
by: Xue, Zhiyu, et al.
Published: (2024)
by: Xue, Zhiyu, et al.
Published: (2024)
DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
by: Cao, Qi, et al.
Published: (2025)
by: Cao, Qi, et al.
Published: (2025)
Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport
by: Ma, Rachel, et al.
Published: (2026)
by: Ma, Rachel, et al.
Published: (2026)
Adversarial Training: A Survey
by: Zhao, Mengnan, et al.
Published: (2024)
by: Zhao, Mengnan, et al.
Published: (2024)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
by: Wang, Haozhe, et al.
Published: (2026)
by: Wang, Haozhe, et al.
Published: (2026)
Know What You Don't Know: Uncertainty Calibration of Process Reward Models
by: Park, Young-Jin, et al.
Published: (2025)
by: Park, Young-Jin, et al.
Published: (2025)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
by: Yu, Zhang Ze, et al.
Published: (2023)
by: Yu, Zhang Ze, et al.
Published: (2023)
Process Reward Models for LLM Agents: Practical Framework and Directions
by: Choudhury, Sanjiban
Published: (2025)
by: Choudhury, Sanjiban
Published: (2025)
Spurious Rewards: Rethinking Training Signals in RLVR
by: Shao, Rulin, et al.
Published: (2025)
by: Shao, Rulin, et al.
Published: (2025)
Explanation-Guided Adversarial Training for Robust and Interpretable Models
by: Chen, Chao, et al.
Published: (2026)
by: Chen, Chao, et al.
Published: (2026)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
by: Luo, Ruilin, et al.
Published: (2025)
by: Luo, Ruilin, et al.
Published: (2025)
Curiosity-Critic: Cumulative Prediction Error Improvement as a Tractable Intrinsic Reward for World Model Training
by: Bhaskara, Vin, et al.
Published: (2026)
by: Bhaskara, Vin, et al.
Published: (2026)
Revisiting the Relationship between Adversarial and Clean Training: Why Clean Training Can Make Adversarial Training Better
by: Zhou, MingWei, et al.
Published: (2025)
by: Zhou, MingWei, et al.
Published: (2025)
Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
by: Cheng, Jie, et al.
Published: (2025)
by: Cheng, Jie, et al.
Published: (2025)
Small Language Models Fine-tuned to Coordinate Larger Language Models improve Complex Reasoning
by: Juneja, Gurusha, et al.
Published: (2023)
by: Juneja, Gurusha, et al.
Published: (2023)
Scalable Energy-Based Models via Adversarial Training: Unifying Discrimination and Generation
by: Yin, Xuwang, et al.
Published: (2025)
by: Yin, Xuwang, et al.
Published: (2025)
Benign Overfitting in Adversarial Training for Vision Transformers
by: Zhang, Jiaming, et al.
Published: (2026)
by: Zhang, Jiaming, et al.
Published: (2026)
CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models
by: Zhu, Xiao, et al.
Published: (2026)
by: Zhu, Xiao, et al.
Published: (2026)
MemLoss: Enhancing Adversarial Training with Recycling Adversarial Examples
by: Mahdi, Soroush, et al.
Published: (2025)
by: Mahdi, Soroush, et al.
Published: (2025)
Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models
by: Peysakhovich, Alexander, et al.
Published: (2026)
by: Peysakhovich, Alexander, et al.
Published: (2026)
Process Rewards with Learned Reliability
by: Li, Jinyuan, et al.
Published: (2026)
by: Li, Jinyuan, et al.
Published: (2026)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
by: Xiong, Xiqiao, et al.
Published: (2025)
by: Xiong, Xiqiao, et al.
Published: (2025)
Ignition Phase : Standard Training for Fast Adversarial Robustness
by: Yu-Hang, Wang, et al.
Published: (2025)
by: Yu-Hang, Wang, et al.
Published: (2025)
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
by: Xu, Yuanda, et al.
Published: (2026)
by: Xu, Yuanda, et al.
Published: (2026)
Similar Items
-
Task Facet Learning: A Structured Approach to Prompt Optimization
by: Juneja, Gurusha, et al.
Published: (2024) -
Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable
by: Saha, Rounak, et al.
Published: (2026) -
$\texttt{LM}^\texttt{2}$: A Simple Society of Language Models Solves Complex Reasoning
by: Juneja, Gurusha, et al.
Published: (2024) -
Efficient Process Reward Model Training via Active Learning
by: Duan, Keyu, et al.
Published: (2025) -
MAGPIE: A dataset for Multi-AGent contextual PrIvacy Evaluation
by: Juneja, Gurusha, et al.
Published: (2025)