RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Chenglong, Gan, Yang, Huo, Yifu, Mu, Yongyu, Yang, Murun, He, Qiaozhi, Xiao, Tong, Zhang, Chunliang, Liu, Tongran, Du, Quan, Yang, Di, Zhu, Jingbo |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LRHP: Learning Representations for Human Preferences via Preference Pairs
by: Wang, Chenglong, et al.
Published: (2024)
by: Wang, Chenglong, et al.
Published: (2024)
GRAM: A Generative Foundation Reward Model for Reward Generalization
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
by: Huo, Yifu, et al.
Published: (2025)
by: Huo, Yifu, et al.
Published: (2025)
Cross-layer Attention Sharing for Pre-trained Large Language Models
by: Mu, Yongyu, et al.
Published: (2024)
by: Mu, Yongyu, et al.
Published: (2024)
MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning
by: Wang, Chenglong, et al.
Published: (2026)
by: Wang, Chenglong, et al.
Published: (2026)
VRM: Teaching Reward Models to Understand Authentic Human Preferences
by: Liu, Biao, et al.
Published: (2026)
by: Liu, Biao, et al.
Published: (2026)
Revealing the Parallel Multilingual Learning within Large Language Models
by: Mu, Yongyu, et al.
Published: (2024)
by: Mu, Yongyu, et al.
Published: (2024)
Hybrid Alignment Training for Large Language Models
by: Wang, Chenglong, et al.
Published: (2024)
by: Wang, Chenglong, et al.
Published: (2024)
Learning Evaluation Models from Large Language Models for Sequence Generation
by: Wang, Chenglong, et al.
Published: (2023)
by: Wang, Chenglong, et al.
Published: (2023)
APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards
by: Chang, Kaiyan, et al.
Published: (2026)
by: Chang, Kaiyan, et al.
Published: (2026)
LaTeXTrans: Structured LaTeX Translation with Multi-Agent Coordination
by: Zhu, Ziming, et al.
Published: (2025)
by: Zhu, Ziming, et al.
Published: (2025)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
by: Huo, Yifu, et al.
Published: (2026)
by: Huo, Yifu, et al.
Published: (2026)
Prior Constraints-based Reward Model Training for Aligning Large Language Models
by: Zhou, Hang, et al.
Published: (2024)
by: Zhou, Hang, et al.
Published: (2024)
Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models
by: Mu, Yongyu, et al.
Published: (2025)
by: Mu, Yongyu, et al.
Published: (2025)
SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query Streams
by: Wang, Chenglong, et al.
Published: (2026)
by: Wang, Chenglong, et al.
Published: (2026)
DaPT: A Dual-Path Framework for Multilingual Multi-hop Question Answering
by: Wang, Yilin, et al.
Published: (2026)
by: Wang, Yilin, et al.
Published: (2026)
AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning
by: Yang, Dejie, et al.
Published: (2025)
by: Yang, Dejie, et al.
Published: (2025)
LoRA-LiteE: A Computationally Efficient Framework for Chatbot Preference-Tuning
by: Yang, Yahe, et al.
Published: (2024)
by: Yang, Yahe, et al.
Published: (2024)
NiuTrans.LMT: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs
by: Luo, Yingfeng, et al.
Published: (2025)
by: Luo, Yingfeng, et al.
Published: (2025)
Weighted-Reward Preference Optimization for Implicit Model Fusion
by: Yang, Ziyi, et al.
Published: (2024)
by: Yang, Ziyi, et al.
Published: (2024)
RoMeO: Robust Metric Visual Odometry
by: Cheng, Junda, et al.
Published: (2024)
by: Cheng, Junda, et al.
Published: (2024)
Adversarial-Robustness-Guided Graph Pruning
by: Wang, Yongyu
Published: (2024)
by: Wang, Yongyu
Published: (2024)
Translate-and-Revise: Boosting Large Language Models for Constrained Translation
by: Huang, Pengcheng, et al.
Published: (2024)
by: Huang, Pengcheng, et al.
Published: (2024)
RoPE Attention Can Be Trained in Almost Linear Time
by: Cao, Yang, et al.
Published: (2024)
by: Cao, Yang, et al.
Published: (2024)
Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models
by: Fan, Yuchun, et al.
Published: (2025)
by: Fan, Yuchun, et al.
Published: (2025)
RoHyDR: Robust Hybrid Diffusion Recovery for Incomplete Multimodal Emotion Recognition
by: Jin, Yuehan, et al.
Published: (2025)
by: Jin, Yuehan, et al.
Published: (2025)
VRM: Knowledge Distillation via Virtual Relation Matching
by: Zhang, Weijia, et al.
Published: (2025)
by: Zhang, Weijia, et al.
Published: (2025)
Harnessing LLMs for API Interactions: A Framework for Classification and Synthetic Data Generation
by: Tao, Chunliang, et al.
Published: (2024)
by: Tao, Chunliang, et al.
Published: (2024)
Personalized Decision Modeling: Utility Optimization or Textualized-Symbolic Reasoning
by: Zhao, Yibo, et al.
Published: (2025)
by: Zhao, Yibo, et al.
Published: (2025)
Towards Resilient and Efficient LLMs: A Comparative Study of Efficiency, Performance, and Adversarial Robustness
by: Fan, Xiaojing, et al.
Published: (2024)
by: Fan, Xiaojing, et al.
Published: (2024)
Periodic RoPE for Infinite Context LLMs
by: Huo, Simin
Published: (2026)
by: Huo, Simin
Published: (2026)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
by: Zhu, Zining, et al.
Published: (2025)
by: Zhu, Zining, et al.
Published: (2025)
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
by: Mu, Yongyu, et al.
Published: (2025)
by: Mu, Yongyu, et al.
Published: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
by: Wang, Yifan, et al.
Published: (2026)
by: Wang, Yifan, et al.
Published: (2026)
RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment
by: Luo, Yingfeng, et al.
Published: (2026)
by: Luo, Yingfeng, et al.
Published: (2026)
LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
by: Fan, Yuchun, et al.
Published: (2026)
by: Fan, Yuchun, et al.
Published: (2026)
Visual Textualization for Image Prompted Object Detection
by: Wu, Yongjian, et al.
Published: (2025)
by: Wu, Yongjian, et al.
Published: (2025)
Similar Items
-
LRHP: Learning Representations for Human Preferences via Preference Pairs
by: Wang, Chenglong, et al.
Published: (2024) -
GRAM: A Generative Foundation Reward Model for Reward Generalization
by: Wang, Chenglong, et al.
Published: (2025) -
Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models
by: Wang, Chenglong, et al.
Published: (2025) -
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
by: Wang, Chenglong, et al.
Published: (2025) -
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
by: Wang, Chenglong, et al.
Published: (2025)