Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Qiu, Weijie, Guan, Dai, Wang, Junxin, Li, Zhihang, Gai, Yongbo, Zhou, Mengyu, Zhao, Erchao, Jiang, Xiaoxi, Jiang, Guanjun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models
di: Wang, Junxin, et al.
Pubblicazione: (2026)
di: Wang, Junxin, et al.
Pubblicazione: (2026)
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
di: Jia, Ruipeng, et al.
Pubblicazione: (2026)
di: Jia, Ruipeng, et al.
Pubblicazione: (2026)
ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation
di: Liu, Yinuo, et al.
Pubblicazione: (2026)
di: Liu, Yinuo, et al.
Pubblicazione: (2026)
Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards
di: Jia, Ruipeng, et al.
Pubblicazione: (2025)
di: Jia, Ruipeng, et al.
Pubblicazione: (2025)
Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills
di: Ni, Jingwei, et al.
Pubblicazione: (2026)
di: Ni, Jingwei, et al.
Pubblicazione: (2026)
Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models
di: Jia, Mengni, et al.
Pubblicazione: (2025)
di: Jia, Mengni, et al.
Pubblicazione: (2025)
Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance
di: Li, Zhuo, et al.
Pubblicazione: (2025)
di: Li, Zhuo, et al.
Pubblicazione: (2025)
MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination
di: Li, Zhuo, et al.
Pubblicazione: (2026)
di: Li, Zhuo, et al.
Pubblicazione: (2026)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
di: Cui, Sijia, et al.
Pubblicazione: (2026)
di: Cui, Sijia, et al.
Pubblicazione: (2026)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
di: Jia, Mengzhao, et al.
Pubblicazione: (2025)
di: Jia, Mengzhao, et al.
Pubblicazione: (2025)
Rubric-Guided Process Reward for Stepwise Model Routing
di: Ye, Shenghao, et al.
Pubblicazione: (2026)
di: Ye, Shenghao, et al.
Pubblicazione: (2026)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
di: Miao, Yanting, et al.
Pubblicazione: (2026)
di: Miao, Yanting, et al.
Pubblicazione: (2026)
Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents
di: Kang, Jiazheng, et al.
Pubblicazione: (2026)
di: Kang, Jiazheng, et al.
Pubblicazione: (2026)
Robust Reward Modeling via Causal Rubrics
di: Srivastava, Pragya, et al.
Pubblicazione: (2025)
di: Srivastava, Pragya, et al.
Pubblicazione: (2025)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
di: Huang, Yu, et al.
Pubblicazione: (2026)
di: Huang, Yu, et al.
Pubblicazione: (2026)
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
di: Liu, Rui, et al.
Pubblicazione: (2026)
di: Liu, Rui, et al.
Pubblicazione: (2026)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
di: Liu, Tianci, et al.
Pubblicazione: (2025)
di: Liu, Tianci, et al.
Pubblicazione: (2025)
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
di: Tyagi, Utkarsh, et al.
Pubblicazione: (2026)
di: Tyagi, Utkarsh, et al.
Pubblicazione: (2026)
Reinforcement Learning From Imperfect Corrective Actions And Proxy Rewards
di: Jiang, Zhaohui, et al.
Pubblicazione: (2024)
di: Jiang, Zhaohui, et al.
Pubblicazione: (2024)
Visual Preference Optimization with Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
Reinforcement Learning with Robust Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
Step-wise Rubric Rewards for LLM Reasoning
di: Xie, Weichu, et al.
Pubblicazione: (2026)
di: Xie, Weichu, et al.
Pubblicazione: (2026)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
di: Xie, Lipeng, et al.
Pubblicazione: (2025)
di: Xie, Lipeng, et al.
Pubblicazione: (2025)
Swim2Real: VLM-Guided System Identification for Sim-to-Real Transfer
di: Qiu, Kevin, et al.
Pubblicazione: (2026)
di: Qiu, Kevin, et al.
Pubblicazione: (2026)
RWKVQuant: Quantizing the RWKV Family with Proxy Guided Hybrid of Scalar and Vector Quantization
di: Xu, Chen, et al.
Pubblicazione: (2025)
di: Xu, Chen, et al.
Pubblicazione: (2025)
R3: Robust Rubric-Agnostic Reward Models
di: Anugraha, David, et al.
Pubblicazione: (2025)
di: Anugraha, David, et al.
Pubblicazione: (2025)
Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria
di: Tian, Juanxi, et al.
Pubblicazione: (2026)
di: Tian, Juanxi, et al.
Pubblicazione: (2026)
Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis
di: Kong, Zicheng, et al.
Pubblicazione: (2026)
di: Kong, Zicheng, et al.
Pubblicazione: (2026)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
di: Li, Gaotang, et al.
Pubblicazione: (2026)
di: Li, Gaotang, et al.
Pubblicazione: (2026)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
di: Ding, Liang
Pubblicazione: (2026)
di: Ding, Liang
Pubblicazione: (2026)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale
di: Gai, Xiaotang, et al.
Pubblicazione: (2024)
di: Gai, Xiaotang, et al.
Pubblicazione: (2024)
MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique
di: Liu, Shuhang, et al.
Pubblicazione: (2025)
di: Liu, Shuhang, et al.
Pubblicazione: (2025)
Reward Hacking in Rubric-Based Reinforcement Learning
di: Mahmoud, Anas, et al.
Pubblicazione: (2026)
di: Mahmoud, Anas, et al.
Pubblicazione: (2026)
MARE: Multi-Aspect Rationale Extractor on Unsupervised Rationale Extraction
di: Jiang, Han, et al.
Pubblicazione: (2024)
di: Jiang, Han, et al.
Pubblicazione: (2024)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
di: Xu, Tianze, et al.
Pubblicazione: (2026)
di: Xu, Tianze, et al.
Pubblicazione: (2026)
VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization
di: Cong, Xiaoyan, et al.
Pubblicazione: (2025)
di: Cong, Xiaoyan, et al.
Pubblicazione: (2025)
Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
Critique Before Thinking: Mitigating Hallucination through Rationale-Augmented Instruction Tuning
di: Yang, Zexian, et al.
Pubblicazione: (2025)
di: Yang, Zexian, et al.
Pubblicazione: (2025)
StyleSSP: Sampling StartPoint Enhancement for Training-free Diffusion-based Method for Style Transfer
di: Xu, Ruojun, et al.
Pubblicazione: (2025)
di: Xu, Ruojun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models
di: Wang, Junxin, et al.
Pubblicazione: (2026) -
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
di: Jia, Ruipeng, et al.
Pubblicazione: (2026) -
ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation
di: Liu, Yinuo, et al.
Pubblicazione: (2026) -
Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards
di: Jia, Ruipeng, et al.
Pubblicazione: (2025) -
Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills
di: Ni, Jingwei, et al.
Pubblicazione: (2026)