Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Ye, Zhiling, Yue, Yun, Wang, Haowen, Han, Xudong, Jiang, Jiadi, Wei, Cheng, Fan, Lei, Liang, Jiaxin, Zhang, Shuowen, Li, Ji, Guo, Chunxiao, Wang, Jian, Wei, Peng, Gu, Jinjie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning to Align, Aligning to Learn: A Unified Approach for Self-Optimized Alignment
di: Wang, Haowen, et al.
Pubblicazione: (2025)
di: Wang, Haowen, et al.
Pubblicazione: (2025)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
di: Guan, Xin, et al.
Pubblicazione: (2026)
di: Guan, Xin, et al.
Pubblicazione: (2026)
EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models
di: Cheng, Jialiang, et al.
Pubblicazione: (2024)
di: Cheng, Jialiang, et al.
Pubblicazione: (2024)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
di: Yang, Zixuan, et al.
Pubblicazione: (2026)
di: Yang, Zixuan, et al.
Pubblicazione: (2026)
AGD: an Auto-switchable Optimizer using Stepwise Gradient Difference for Preconditioning Matrix
di: Yue, Yun, et al.
Pubblicazione: (2023)
di: Yue, Yun, et al.
Pubblicazione: (2023)
CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics
di: Nagar, Aishik, et al.
Pubblicazione: (2026)
di: Nagar, Aishik, et al.
Pubblicazione: (2026)
OrchMoE: Efficient Multi-Adapter Learning with Task-Skill Synergy
di: Wang, Haowen, et al.
Pubblicazione: (2024)
di: Wang, Haowen, et al.
Pubblicazione: (2024)
Step-wise Rubric Rewards for LLM Reasoning
di: Xie, Weichu, et al.
Pubblicazione: (2026)
di: Xie, Weichu, et al.
Pubblicazione: (2026)
Reinforcement Learning with Robust Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
di: Sheng, Leheng, et al.
Pubblicazione: (2026)
di: Sheng, Leheng, et al.
Pubblicazione: (2026)
Sharpness-Aware Minimization Revisited: Weighted Sharpness as a Regularization Term
di: Yue, Yun, et al.
Pubblicazione: (2023)
di: Yue, Yun, et al.
Pubblicazione: (2023)
REC-CBM: Rubric-Aware Error-Correction Concept Bottleneck Models for Trustworthy Open-Ended Grading
di: Zhao, Chengshuai, et al.
Pubblicazione: (2026)
di: Zhao, Chengshuai, et al.
Pubblicazione: (2026)
Reverse-Engineered Reasoning for Open-Ended Generation
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
Reward Hacking in Rubric-Based Reinforcement Learning
di: Mahmoud, Anas, et al.
Pubblicazione: (2026)
di: Mahmoud, Anas, et al.
Pubblicazione: (2026)
OpenSIR: Open-Ended Self-Improving Reasoner
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2025)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2025)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
di: Liu, Tianci, et al.
Pubblicazione: (2025)
di: Liu, Tianci, et al.
Pubblicazione: (2025)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
di: Huang, Yu, et al.
Pubblicazione: (2026)
di: Huang, Yu, et al.
Pubblicazione: (2026)
CTRL-RAG: Contrastive Likelihood Reward Based Reinforcement Learning for Context-Faithful RAG Models
di: Tan, Zhehao, et al.
Pubblicazione: (2026)
di: Tan, Zhehao, et al.
Pubblicazione: (2026)
Reinforcement Learning with Rubric Anchors
di: Huang, Zenan, et al.
Pubblicazione: (2025)
di: Huang, Zenan, et al.
Pubblicazione: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
di: Gunjal, Anisha, et al.
Pubblicazione: (2025)
di: Gunjal, Anisha, et al.
Pubblicazione: (2025)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
di: Jia, Mengzhao, et al.
Pubblicazione: (2025)
di: Jia, Mengzhao, et al.
Pubblicazione: (2025)
Rubric-Guided Process Reward for Stepwise Model Routing
di: Ye, Shenghao, et al.
Pubblicazione: (2026)
di: Ye, Shenghao, et al.
Pubblicazione: (2026)
DIVER: A Multi-Stage Approach for Reasoning-intensive Information Retrieval
di: Sun, Duolin, et al.
Pubblicazione: (2025)
di: Sun, Duolin, et al.
Pubblicazione: (2025)
Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation
di: Cao, Guining, et al.
Pubblicazione: (2026)
di: Cao, Guining, et al.
Pubblicazione: (2026)
Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards
di: Yang, Ting, et al.
Pubblicazione: (2025)
di: Yang, Ting, et al.
Pubblicazione: (2025)
Grad2Reward: From Sparse Judgment to Dense Rewards for Improving Open-Ended LLM Reasoning
di: Zhang, Zheng, et al.
Pubblicazione: (2026)
di: Zhang, Zheng, et al.
Pubblicazione: (2026)
G-Zero: Self-Play for Open-Ended Generation from Zero Data
di: Huang, Chengsong, et al.
Pubblicazione: (2026)
di: Huang, Chengsong, et al.
Pubblicazione: (2026)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
di: Wang, Pengkai, et al.
Pubblicazione: (2025)
di: Wang, Pengkai, et al.
Pubblicazione: (2025)
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
di: Jia, Ruipeng, et al.
Pubblicazione: (2026)
di: Jia, Ruipeng, et al.
Pubblicazione: (2026)
MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models
di: Gong, Lecheng, et al.
Pubblicazione: (2026)
di: Gong, Lecheng, et al.
Pubblicazione: (2026)
MedResearcher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis Framework
di: Yu, Ailing, et al.
Pubblicazione: (2025)
di: Yu, Ailing, et al.
Pubblicazione: (2025)
OpenEP: Open-Ended Future Event Prediction
di: Guan, Yong, et al.
Pubblicazione: (2024)
di: Guan, Yong, et al.
Pubblicazione: (2024)
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
di: Bhattarai, Manish, et al.
Pubblicazione: (2026)
di: Bhattarai, Manish, et al.
Pubblicazione: (2026)
EHR-R1: A Reasoning-Enhanced Foundational Language Model for Electronic Health Record Analysis
di: Liao, Yusheng, et al.
Pubblicazione: (2025)
di: Liao, Yusheng, et al.
Pubblicazione: (2025)
Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning
di: Bi, Baolong, et al.
Pubblicazione: (2025)
di: Bi, Baolong, et al.
Pubblicazione: (2025)
Visual Preference Optimization with Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO
di: Hong, Haoyang, et al.
Pubblicazione: (2025)
di: Hong, Haoyang, et al.
Pubblicazione: (2025)
Reinforced Reasoning for Embodied Planning
di: Wu, Di, et al.
Pubblicazione: (2025)
di: Wu, Di, et al.
Pubblicazione: (2025)
Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions
di: Zhao, Yu, et al.
Pubblicazione: (2024)
di: Zhao, Yu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Learning to Align, Aligning to Learn: A Unified Approach for Self-Optimized Alignment
di: Wang, Haowen, et al.
Pubblicazione: (2025) -
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
di: Guan, Xin, et al.
Pubblicazione: (2026) -
EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models
di: Cheng, Jialiang, et al.
Pubblicazione: (2024) -
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
di: Yang, Zixuan, et al.
Pubblicazione: (2026) -
AGD: an Auto-switchable Optimizer using Stepwise Gradient Difference for Preconditioning Matrix
di: Yue, Yun, et al.
Pubblicazione: (2023)