Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Ran, Liu, Tianci, Dong, Zihan, Yu, Tony, Hong, Ilgee, Yang, Carl, Zhang, Linjun, Zhao, Tao, Wang, Haoyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
di: Jiang, Haoxiang, et al.
Pubblicazione: (2026)
di: Jiang, Haoxiang, et al.
Pubblicazione: (2026)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
di: Liu, Tianci, et al.
Pubblicazione: (2025)
di: Liu, Tianci, et al.
Pubblicazione: (2025)
Reinforcement Learning with Robust Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
di: Gunjal, Anisha, et al.
Pubblicazione: (2025)
di: Gunjal, Anisha, et al.
Pubblicazione: (2025)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
di: Huang, Yu, et al.
Pubblicazione: (2026)
di: Huang, Yu, et al.
Pubblicazione: (2026)
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
di: Lan, Guangchen, et al.
Pubblicazione: (2026)
di: Lan, Guangchen, et al.
Pubblicazione: (2026)
DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
di: Hu, Haoyu, et al.
Pubblicazione: (2026)
di: Hu, Haoyu, et al.
Pubblicazione: (2026)
Reward Hacking in Rubric-Based Reinforcement Learning
di: Mahmoud, Anas, et al.
Pubblicazione: (2026)
di: Mahmoud, Anas, et al.
Pubblicazione: (2026)
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
di: Huang, Jiawei, et al.
Pubblicazione: (2026)
di: Huang, Jiawei, et al.
Pubblicazione: (2026)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
di: Li, Gaotang, et al.
Pubblicazione: (2026)
di: Li, Gaotang, et al.
Pubblicazione: (2026)
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
di: Ren, Tao, et al.
Pubblicazione: (2025)
di: Ren, Tao, et al.
Pubblicazione: (2025)
Step-wise Rubric Rewards for LLM Reasoning
di: Xie, Weichu, et al.
Pubblicazione: (2026)
di: Xie, Weichu, et al.
Pubblicazione: (2026)
Mitigating Heterogeneous Token Overfitting in LLM Knowledge Editing
di: Liu, Tianci, et al.
Pubblicazione: (2025)
di: Liu, Tianci, et al.
Pubblicazione: (2025)
AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
di: Xu, Ran, et al.
Pubblicazione: (2025)
di: Xu, Ran, et al.
Pubblicazione: (2025)
Visual Preference Optimization with Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
RoseRAG: Robust Retrieval-augmented Generation with Small-scale LLMs via Margin-aware Preference Optimization
di: Liu, Tianci, et al.
Pubblicazione: (2025)
di: Liu, Tianci, et al.
Pubblicazione: (2025)
GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training
di: Cao, Yuan, et al.
Pubblicazione: (2026)
di: Cao, Yuan, et al.
Pubblicazione: (2026)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
Post-Training Local LLM Agents for Linux Privilege Escalation with Verifiable Rewards
di: Normann, Philipp, et al.
Pubblicazione: (2026)
di: Normann, Philipp, et al.
Pubblicazione: (2026)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
di: Ding, Liang
Pubblicazione: (2026)
di: Ding, Liang
Pubblicazione: (2026)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
di: Liu, Yixin, et al.
Pubblicazione: (2026)
di: Liu, Yixin, et al.
Pubblicazione: (2026)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
Quantum Verifiable Rewards for Post-Training Qiskit Code Assistant
di: Dupuis, Nicolas, et al.
Pubblicazione: (2025)
di: Dupuis, Nicolas, et al.
Pubblicazione: (2025)
Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training
di: Zhang, Junkai, et al.
Pubblicazione: (2025)
di: Zhang, Junkai, et al.
Pubblicazione: (2025)
RLNVR: Reinforcement Learning from Non-Verified Real-World Rewards
di: Krishnan, Rohit, et al.
Pubblicazione: (2025)
di: Krishnan, Rohit, et al.
Pubblicazione: (2025)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
di: Wu, Peilin, et al.
Pubblicazione: (2026)
di: Wu, Peilin, et al.
Pubblicazione: (2026)
AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following
di: He, Yun, et al.
Pubblicazione: (2025)
di: He, Yun, et al.
Pubblicazione: (2025)
Reinforcement Learning with Rubric Anchors
di: Huang, Zenan, et al.
Pubblicazione: (2025)
di: Huang, Zenan, et al.
Pubblicazione: (2025)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
di: Jia, Mengzhao, et al.
Pubblicazione: (2025)
di: Jia, Mengzhao, et al.
Pubblicazione: (2025)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
di: Zhang, Feng, et al.
Pubblicazione: (2026)
di: Zhang, Feng, et al.
Pubblicazione: (2026)
Training AI Co-Scientists Using Rubric Rewards
di: Goel, Shashwat, et al.
Pubblicazione: (2025)
di: Goel, Shashwat, et al.
Pubblicazione: (2025)
Ask a Strong LLM Judge when Your Reward Model is Uncertain
di: Xu, Zhenghao, et al.
Pubblicazione: (2025)
di: Xu, Zhenghao, et al.
Pubblicazione: (2025)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
di: Xu, Tianze, et al.
Pubblicazione: (2026)
di: Xu, Tianze, et al.
Pubblicazione: (2026)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
di: Jia, Ruipeng, et al.
Pubblicazione: (2026)
di: Jia, Ruipeng, et al.
Pubblicazione: (2026)
When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On
di: Ikezogwo, Wisdom, et al.
Pubblicazione: (2026)
di: Ikezogwo, Wisdom, et al.
Pubblicazione: (2026)
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
di: Jiang, Yuxin, et al.
Pubblicazione: (2026)
di: Jiang, Yuxin, et al.
Pubblicazione: (2026)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
di: Jiang, Haoxiang, et al.
Pubblicazione: (2026) -
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
di: Liu, Tianci, et al.
Pubblicazione: (2025) -
Reinforcement Learning with Robust Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026) -
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
di: Gunjal, Anisha, et al.
Pubblicazione: (2025) -
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
di: Huang, Yu, et al.
Pubblicazione: (2026)