AgentV-RL: Scaling Reward Modeling with Agentic Verifier
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jiazheng, Fu, Ziche, Xi, Zhiheng, Jing, Wenqing, Chai, Mingxu, He, Wei, Zhang, Guoqiang, Fan, Chenghao, An, Chenxin, Chen, Wenxiang, Liu, Zhicheng, Pan, Haojie, Zhu, Dingwei, Gui, Tao, Zhang, Qi, Huang, Xuanjing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
di: Zhang, Jiazheng, et al.
Pubblicazione: (2025)
di: Zhang, Jiazheng, et al.
Pubblicazione: (2025)
Can RL Improve Generalization of LLM Agents? An Empirical Study
di: Xi, Zhiheng, et al.
Pubblicazione: (2026)
di: Xi, Zhiheng, et al.
Pubblicazione: (2026)
Better Process Supervision with Bi-directional Rewarding Signals
di: Chen, Wenxiang, et al.
Pubblicazione: (2025)
di: Chen, Wenxiang, et al.
Pubblicazione: (2025)
Prefix-Adaptive Block Diffusion for Efficient Document Recognition
di: Chai, Mingxu, et al.
Pubblicazione: (2026)
di: Chai, Mingxu, et al.
Pubblicazione: (2026)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
di: Zhang, Jiazheng, et al.
Pubblicazione: (2026)
di: Zhang, Jiazheng, et al.
Pubblicazione: (2026)
DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training
di: Zhu, Dingwei, et al.
Pubblicazione: (2026)
di: Zhu, Dingwei, et al.
Pubblicazione: (2026)
OpenNovelty: An LLM-powered Agentic System for Verifiable Scholarly Novelty Assessment
di: Zhang, Ming, et al.
Pubblicazione: (2026)
di: Zhang, Ming, et al.
Pubblicazione: (2026)
CCTU: A Benchmark for Tool Use under Complex Constraints
di: Ye, Junjie, et al.
Pubblicazione: (2026)
di: Ye, Junjie, et al.
Pubblicazione: (2026)
Verifiable Process Rewards for Agentic Reasoning
di: Yuan, Huining, et al.
Pubblicazione: (2026)
di: Yuan, Huining, et al.
Pubblicazione: (2026)
Scaling Agentic Verifier for Competitive Coding
di: Ma, Zeyao, et al.
Pubblicazione: (2026)
di: Ma, Zeyao, et al.
Pubblicazione: (2026)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
di: Zheng, Rui, et al.
Pubblicazione: (2024)
di: Zheng, Rui, et al.
Pubblicazione: (2024)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
RoCoIns: Enhancing Robustness of Large Language Models through Code-Style Instructions
di: Zhang, Yuansen, et al.
Pubblicazione: (2024)
di: Zhang, Yuansen, et al.
Pubblicazione: (2024)
Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers
di: Yang, Zhicheng, et al.
Pubblicazione: (2025)
di: Yang, Zhicheng, et al.
Pubblicazione: (2025)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
di: Zhang, Chenghao, et al.
Pubblicazione: (2026)
di: Zhang, Chenghao, et al.
Pubblicazione: (2026)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
di: Cao, Yifei, et al.
Pubblicazione: (2025)
di: Cao, Yifei, et al.
Pubblicazione: (2025)
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
di: Lin, Jiahang, et al.
Pubblicazione: (2026)
di: Lin, Jiahang, et al.
Pubblicazione: (2026)
LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening
di: Zhang, Ming, et al.
Pubblicazione: (2026)
di: Zhang, Ming, et al.
Pubblicazione: (2026)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
Polar: Agentic RL on Any Harness at Scale
di: Xu, Binfeng, et al.
Pubblicazione: (2026)
di: Xu, Binfeng, et al.
Pubblicazione: (2026)
DocFusion: A Unified Framework for Document Parsing Tasks
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
di: Huang, Yu, et al.
Pubblicazione: (2026)
di: Huang, Yu, et al.
Pubblicazione: (2026)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
di: Pan, Chengjun, et al.
Pubblicazione: (2026)
di: Pan, Chengjun, et al.
Pubblicazione: (2026)
When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning
di: Yang, Chenghao, et al.
Pubblicazione: (2025)
di: Yang, Chenghao, et al.
Pubblicazione: (2025)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
di: Zhang, Ming, et al.
Pubblicazione: (2025)
di: Zhang, Ming, et al.
Pubblicazione: (2025)
LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
di: Zhang, Ming, et al.
Pubblicazione: (2025)
di: Zhang, Ming, et al.
Pubblicazione: (2025)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
di: Zhou, Enyu, et al.
Pubblicazione: (2024)
di: Zhou, Enyu, et al.
Pubblicazione: (2024)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
di: Xi, Zhiheng, et al.
Pubblicazione: (2023)
di: Xi, Zhiheng, et al.
Pubblicazione: (2023)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
di: Dou, Shihan, et al.
Pubblicazione: (2025)
di: Dou, Shihan, et al.
Pubblicazione: (2025)
Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning
di: Tang, Lingxiao, et al.
Pubblicazione: (2026)
di: Tang, Lingxiao, et al.
Pubblicazione: (2026)
LLM4PM: A case study on using Large Language Models for Process Modeling in Enterprise Organizations
di: Ziche, Clara, et al.
Pubblicazione: (2024)
di: Ziche, Clara, et al.
Pubblicazione: (2024)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
di: Li, Yuhan, et al.
Pubblicazione: (2026)
di: Li, Yuhan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
di: Zhu, Dingwei, et al.
Pubblicazione: (2025) -
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
di: Zhang, Jiazheng, et al.
Pubblicazione: (2025) -
Can RL Improve Generalization of LLM Agents? An Empirical Study
di: Xi, Zhiheng, et al.
Pubblicazione: (2026) -
Better Process Supervision with Bi-directional Rewarding Signals
di: Chen, Wenxiang, et al.
Pubblicazione: (2025) -
Prefix-Adaptive Block Diffusion for Efficient Document Recognition
di: Chai, Mingxu, et al.
Pubblicazione: (2026)