CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Dengcan, Yang, Fengkai, Wang, Xiaohan, Yan, Shurui, Chai, Jiajun, Li, Jiahao, Ban, Yikun, Mao, Zhendong, Lin, Wei, Yin, Guojun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
von: Wang, Li, et al.
Veröffentlicht: (2026)
von: Wang, Li, et al.
Veröffentlicht: (2026)
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
von: Zeng, Wenwen, et al.
Veröffentlicht: (2026)
von: Zeng, Wenwen, et al.
Veröffentlicht: (2026)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
von: Lu, Xiaodong, et al.
Veröffentlicht: (2026)
von: Lu, Xiaodong, et al.
Veröffentlicht: (2026)
Your Group-Relative Advantage Is Biased
von: Yang, Fengkai, et al.
Veröffentlicht: (2026)
von: Yang, Fengkai, et al.
Veröffentlicht: (2026)
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
von: Lin, Zihan, et al.
Veröffentlicht: (2025)
von: Lin, Zihan, et al.
Veröffentlicht: (2025)
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
von: Liu, Dengcan, et al.
Veröffentlicht: (2025)
von: Liu, Dengcan, et al.
Veröffentlicht: (2025)
SAE as a Crystal Ball: Interpretable Features Predict Cross-domain Transferability of LLMs without Training
von: Zhang, Qi, et al.
Veröffentlicht: (2026)
von: Zhang, Qi, et al.
Veröffentlicht: (2026)
Promoting Efficient Reasoning with Verifiable Stepwise Reward
von: Yue, Chuhuai, et al.
Veröffentlicht: (2025)
von: Yue, Chuhuai, et al.
Veröffentlicht: (2025)
ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models
von: Lin, Zihan, et al.
Veröffentlicht: (2025)
von: Lin, Zihan, et al.
Veröffentlicht: (2025)
Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration
von: Wang, Zili, et al.
Veröffentlicht: (2026)
von: Wang, Zili, et al.
Veröffentlicht: (2026)
ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay
von: Hu, Zhexin, et al.
Veröffentlicht: (2026)
von: Hu, Zhexin, et al.
Veröffentlicht: (2026)
SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
von: Guo, Xiaojun, et al.
Veröffentlicht: (2025)
von: Guo, Xiaojun, et al.
Veröffentlicht: (2025)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
von: Ding, Liang
Veröffentlicht: (2026)
von: Ding, Liang
Veröffentlicht: (2026)
Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning
von: Wang, Li, et al.
Veröffentlicht: (2026)
von: Wang, Li, et al.
Veröffentlicht: (2026)
RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation
von: Dhole, Kaustubh D., et al.
Veröffentlicht: (2026)
von: Dhole, Kaustubh D., et al.
Veröffentlicht: (2026)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
von: Lin, Zihan, et al.
Veröffentlicht: (2026)
von: Lin, Zihan, et al.
Veröffentlicht: (2026)
AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment
von: Wei, Zhenlin, et al.
Veröffentlicht: (2026)
von: Wei, Zhenlin, et al.
Veröffentlicht: (2026)
Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling
von: Sanders, Kate, et al.
Veröffentlicht: (2026)
von: Sanders, Kate, et al.
Veröffentlicht: (2026)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
von: Jia, Mengzhao, et al.
Veröffentlicht: (2025)
von: Jia, Mengzhao, et al.
Veröffentlicht: (2025)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
From Experience to Strategy: Empowering LLM Agents with Trainable Graph Memory
von: Xia, Siyu, et al.
Veröffentlicht: (2025)
von: Xia, Siyu, et al.
Veröffentlicht: (2025)
MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL
von: Xu, Zekun, et al.
Veröffentlicht: (2025)
von: Xu, Zekun, et al.
Veröffentlicht: (2025)
GCL-OT: Graph Contrastive Learning with Optimal Transport for Heterophilic Text-Attributed Graphs
von: Ren, Yating, et al.
Veröffentlicht: (2025)
von: Ren, Yating, et al.
Veröffentlicht: (2025)
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
von: Wu, Bin, et al.
Veröffentlicht: (2026)
von: Wu, Bin, et al.
Veröffentlicht: (2026)
ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
von: Chen, Hao, et al.
Veröffentlicht: (2025)
von: Chen, Hao, et al.
Veröffentlicht: (2025)
Rethinking Personalization in Large Language Models at the Token Level
von: Zhang, Chenheng, et al.
Veröffentlicht: (2026)
von: Zhang, Chenheng, et al.
Veröffentlicht: (2026)
CustomContrast: A Multilevel Contrastive Perspective For Subject-Driven Text-to-Image Customization
von: Chen, Nan, et al.
Veröffentlicht: (2024)
von: Chen, Nan, et al.
Veröffentlicht: (2024)
AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment
von: Kao, Kuei-Chun, et al.
Veröffentlicht: (2026)
von: Kao, Kuei-Chun, et al.
Veröffentlicht: (2026)
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
von: Sun, Jingbo, et al.
Veröffentlicht: (2026)
von: Sun, Jingbo, et al.
Veröffentlicht: (2026)
$π$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data
von: Zhang, Yaocheng, et al.
Veröffentlicht: (2026)
von: Zhang, Yaocheng, et al.
Veröffentlicht: (2026)
Are Full Rollouts Necessary for On-Policy Distillation?
von: Zhang, Yaocheng, et al.
Veröffentlicht: (2026)
von: Zhang, Yaocheng, et al.
Veröffentlicht: (2026)
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
Training Multi-Image Vision Agents via End2End Reinforcement Learning
von: Dong, Chengqi, et al.
Veröffentlicht: (2025)
von: Dong, Chengqi, et al.
Veröffentlicht: (2025)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
von: Li, Gaotang, et al.
Veröffentlicht: (2026)
von: Li, Gaotang, et al.
Veröffentlicht: (2026)
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
von: Tyagi, Utkarsh, et al.
Veröffentlicht: (2026)
von: Tyagi, Utkarsh, et al.
Veröffentlicht: (2026)
Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs
von: Ji, Yikun, et al.
Veröffentlicht: (2025)
von: Ji, Yikun, et al.
Veröffentlicht: (2025)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
von: Huang, Yu, et al.
Veröffentlicht: (2026)
von: Huang, Yu, et al.
Veröffentlicht: (2026)
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
von: Feng, Xuelu, et al.
Veröffentlicht: (2025)
von: Feng, Xuelu, et al.
Veröffentlicht: (2025)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
von: Guan, Xin, et al.
Veröffentlicht: (2026)
von: Guan, Xin, et al.
Veröffentlicht: (2026)
Visual Preference Optimization with Rubric Rewards
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
von: Wang, Li, et al.
Veröffentlicht: (2026) -
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
von: Zeng, Wenwen, et al.
Veröffentlicht: (2026) -
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
von: Lu, Xiaodong, et al.
Veröffentlicht: (2026) -
Your Group-Relative Advantage Is Biased
von: Yang, Fengkai, et al.
Veröffentlicht: (2026) -
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
von: Lin, Zihan, et al.
Veröffentlicht: (2025)