Visual Preference Optimization with Rubric Rewards
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Ya-Qi, Hong, Fangyu, Qu, Xiangyang, Wang, Hao, Wu, Gaojie, Luo, Qiaoyu, Xu, Nuo, Wang, Huixin, Xu, Wuheng, Liao, Yongxin, Chen, Zihao, Li, Haonan, Li, Ziming, Peng, Dezhi, Liao, Minghui, Wu, Jihao, Ren, Haoyu, Tu, Dandan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reinforcement Learning with Robust Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026)
par: Yu, Ya-Qi, et autres
Publié: (2026)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria
par: Tian, Juanxi, et autres
Publié: (2026)
par: Tian, Juanxi, et autres
Publié: (2026)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
par: Liu, Tianci, et autres
Publié: (2025)
par: Liu, Tianci, et autres
Publié: (2025)
Android in the Zoo: Chain-of-Action-Thought for GUI Agents
par: Zhang, Jiwen, et autres
Publié: (2024)
par: Zhang, Jiwen, et autres
Publié: (2024)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
FROG: Effective Friend Recommendation in Online Games via Modality-aware User Preferences
par: Wang, Qiwei, et autres
Publié: (2025)
par: Wang, Qiwei, et autres
Publié: (2025)
Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis
par: Kong, Zicheng, et autres
Publié: (2026)
par: Kong, Zicheng, et autres
Publié: (2026)
Reward Hacking in Rubric-Based Reinforcement Learning
par: Mahmoud, Anas, et autres
Publié: (2026)
par: Mahmoud, Anas, et autres
Publié: (2026)
Step-wise Rubric Rewards for LLM Reasoning
par: Xie, Weichu, et autres
Publié: (2026)
par: Xie, Weichu, et autres
Publié: (2026)
AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward
par: Han, Haonan, et autres
Publié: (2024)
par: Han, Haonan, et autres
Publié: (2024)
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
par: Jiang, Haoxiang, et autres
Publié: (2026)
par: Jiang, Haoxiang, et autres
Publié: (2026)
The impact of the fourth industrial revolution: a cross-country/region comparison
par: Yongxin Liao
Publié: (2018)
par: Yongxin Liao
Publié: (2018)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
par: Xu, Ran, et autres
Publié: (2026)
par: Xu, Ran, et autres
Publié: (2026)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
par: Xu, Tianze, et autres
Publié: (2026)
par: Xu, Tianze, et autres
Publié: (2026)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
par: Li, Gaotang, et autres
Publié: (2026)
par: Li, Gaotang, et autres
Publié: (2026)
Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
par: Ding, Ruomeng, et autres
Publié: (2026)
par: Ding, Ruomeng, et autres
Publié: (2026)
C2: Scalable Rubric-Augmented Reward Modeling from Binary Preferences
par: Kawabata, Akira, et autres
Publié: (2026)
par: Kawabata, Akira, et autres
Publié: (2026)
On the Role of Preference Variance in Preference Optimization
par: Guo, Jiacheng, et autres
Publié: (2025)
par: Guo, Jiacheng, et autres
Publié: (2025)
Decomposing and Fusing Intra- and Inter-Sensor Spatio-Temporal Signal for Multi-Sensor Wearable Human Activity Recognition
par: Xie, Haoyu, et autres
Publié: (2025)
par: Xie, Haoyu, et autres
Publié: (2025)
Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
par: Gu, Jihao, et autres
Publié: (2024)
par: Gu, Jihao, et autres
Publié: (2024)
TPO: Aligning Large Language Models with Multi-branch & Multi-step Preference Trees
par: Liao, Weibin, et autres
Publié: (2024)
par: Liao, Weibin, et autres
Publié: (2024)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
par: Yuan, Youliang, et autres
Publié: (2025)
par: Yuan, Youliang, et autres
Publié: (2025)
Enhancing Counterfactual Image Generation Using Mahalanobis Distance with Distribution Preferences in Feature Space
par: Zhang, Yukai, et autres
Publié: (2024)
par: Zhang, Yukai, et autres
Publié: (2024)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
par: Huang, Yu, et autres
Publié: (2026)
par: Huang, Yu, et autres
Publié: (2026)
Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective
par: Yu, Xinmiao, et autres
Publié: (2024)
par: Yu, Xinmiao, et autres
Publié: (2024)
Learning Reward and Policy Jointly from Demonstration and Preference Improves Alignment
par: Li, Chenliang, et autres
Publié: (2024)
par: Li, Chenliang, et autres
Publié: (2024)
MRHER: Model-based Relay Hindsight Experience Replay for Sequential Object Manipulation Tasks with Sparse Rewards
par: Huang, Yuming, et autres
Publié: (2023)
par: Huang, Yuming, et autres
Publié: (2023)
Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
Rubric-Guided Process Reward for Stepwise Model Routing
par: Ye, Shenghao, et autres
Publié: (2026)
par: Ye, Shenghao, et autres
Publié: (2026)
MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
par: Chen, Feilong, et autres
Publié: (2025)
par: Chen, Feilong, et autres
Publié: (2025)
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
par: Tyagi, Utkarsh, et autres
Publié: (2026)
par: Tyagi, Utkarsh, et autres
Publié: (2026)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
par: Jia, Mengzhao, et autres
Publié: (2025)
par: Jia, Mengzhao, et autres
Publié: (2025)
Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning
par: Bi, Baolong, et autres
Publié: (2025)
par: Bi, Baolong, et autres
Publié: (2025)
Garbage Segmentation and Attribute Analysis by Robotic Dogs
par: Xu, Nuo, et autres
Publié: (2024)
par: Xu, Nuo, et autres
Publié: (2024)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
par: Liao, Huan, et autres
Publié: (2024)
par: Liao, Huan, et autres
Publié: (2024)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025)
par: Gunjal, Anisha, et autres
Publié: (2025)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
par: Wu, Sihao, et autres
Publié: (2025)
par: Wu, Sihao, et autres
Publié: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
par: Ye, Zhiling, et autres
Publié: (2025)
par: Ye, Zhiling, et autres
Publié: (2025)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
par: Xie, Lipeng, et autres
Publié: (2025)
par: Xie, Lipeng, et autres
Publié: (2025)
Documents similaires
-
Reinforcement Learning with Robust Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026) -
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
par: Yu, Ya-Qi, et autres
Publié: (2024) -
Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria
par: Tian, Juanxi, et autres
Publié: (2026) -
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
par: Liu, Tianci, et autres
Publié: (2025) -
Android in the Zoo: Chain-of-Action-Thought for GUI Agents
par: Zhang, Jiwen, et autres
Publié: (2024)