DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Zhihong, Zhao, Jie, Huang, Xiaojian, Xu, Jin, Luo, Zhuodong, Liu, Xin, Wei, Jiansheng, Chen, Xuejin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
by: Zhang, Zhihong, et al.
Published: (2025)
by: Zhang, Zhihong, et al.
Published: (2025)
Training Data Efficiency in Multimodal Process Reward Models
by: Li, Jinyuan, et al.
Published: (2026)
by: Li, Jinyuan, et al.
Published: (2026)
MRM3: Machine Readable ML Model Metadata
by: Čop, Andrej, et al.
Published: (2025)
by: Čop, Andrej, et al.
Published: (2025)
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
by: Zhang, Zefeng, et al.
Published: (2025)
by: Zhang, Zefeng, et al.
Published: (2025)
Semi-Supervised Reward Modeling via Iterative Self-Training
by: He, Yifei, et al.
Published: (2024)
by: He, Yifei, et al.
Published: (2024)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
by: Jin, Zhuoran, et al.
Published: (2024)
by: Jin, Zhuoran, et al.
Published: (2024)
VRM: Teaching Reward Models to Understand Authentic Human Preferences
by: Liu, Biao, et al.
Published: (2026)
by: Liu, Biao, et al.
Published: (2026)
Microstructure Evolution of Powder‐Mixed Inconel718‐ x Rene88DT Alloy Fabricated by Direct Laser Deposition
by: Linxu Li, et al.
Published: (2024)
by: Linxu Li, et al.
Published: (2024)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
by: Jin, Zhuoran, et al.
Published: (2025)
by: Jin, Zhuoran, et al.
Published: (2025)
Constructing and Evaluating Digital Twins: An Intelligent Framework for DT Development
by: Ma, Longfei, et al.
Published: (2024)
by: Ma, Longfei, et al.
Published: (2024)
In-Context Reward Adaptation for Robust Preference Modeling
by: Sun, Zhenyu, et al.
Published: (2026)
by: Sun, Zhenyu, et al.
Published: (2026)
Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling
by: Li, Jiachun, et al.
Published: (2025)
by: Li, Jiachun, et al.
Published: (2025)
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
by: Li, Pengxiang, et al.
Published: (2025)
by: Li, Pengxiang, et al.
Published: (2025)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
by: Sun, Mengyuan, et al.
Published: (2026)
by: Sun, Mengyuan, et al.
Published: (2026)
Debiased Multimodal Understanding for Human Language Sequences
by: Xu, Zhi, et al.
Published: (2024)
by: Xu, Zhi, et al.
Published: (2024)
Debiasing Reward Models by Representation Learning with Guarantees
by: Ng, Ignavier, et al.
Published: (2025)
by: Ng, Ignavier, et al.
Published: (2025)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
by: Jiang, Zaifan, et al.
Published: (2023)
by: Jiang, Zaifan, et al.
Published: (2023)
The Use of Binary Choice Forests to Model and Estimate Discrete Choices
by: Chen, Ningyuan, et al.
Published: (2019)
by: Chen, Ningyuan, et al.
Published: (2019)
Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders
by: Liu, Shunchang, et al.
Published: (2026)
by: Liu, Shunchang, et al.
Published: (2026)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
by: Yang, Shidong, et al.
Published: (2026)
by: Yang, Shidong, et al.
Published: (2026)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
by: Xu, Xin, et al.
Published: (2025)
by: Xu, Xin, et al.
Published: (2025)
Target-oriented Multimodal Sentiment Classification with Counterfactual-enhanced Debiasing
by: Liu, Zhiyue, et al.
Published: (2025)
by: Liu, Zhiyue, et al.
Published: (2025)
Region-Enhanced Feature Learning for Scene Semantic Segmentation
by: Kang, Xin, et al.
Published: (2023)
by: Kang, Xin, et al.
Published: (2023)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
by: Xu, Yue, et al.
Published: (2024)
by: Xu, Yue, et al.
Published: (2024)
AIPO: Improving Training Objective for Iterative Preference Optimization
by: Shen, Yaojie, et al.
Published: (2024)
by: Shen, Yaojie, et al.
Published: (2024)
RRM: Robust Reward Model Training Mitigates Reward Hacking
by: Liu, Tianqi, et al.
Published: (2024)
by: Liu, Tianqi, et al.
Published: (2024)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
by: Zhang, Ruohong, et al.
Published: (2024)
by: Zhang, Ruohong, et al.
Published: (2024)
Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria
by: Tian, Juanxi, et al.
Published: (2026)
by: Tian, Juanxi, et al.
Published: (2026)
Debiasing Kernel-Based Generative Models
by: Qin, Tian, et al.
Published: (2025)
by: Qin, Tian, et al.
Published: (2025)
IceBerg: Debiased Self-Training for Class-Imbalanced Node Classification
by: Li, Zhixun, et al.
Published: (2025)
by: Li, Zhixun, et al.
Published: (2025)
Exploring and Addressing Reward Confusion in Offline Preference Learning
by: Chen, Xin, et al.
Published: (2024)
by: Chen, Xin, et al.
Published: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
by: Men, Tianyi, et al.
Published: (2025)
by: Men, Tianyi, et al.
Published: (2025)
Teacher-Student Training for Debiasing: General Permutation Debiasing for Large Language Models
by: Liusie, Adian, et al.
Published: (2024)
by: Liusie, Adian, et al.
Published: (2024)
Debiasing Online Preference Learning via Preference Feature Preservation
by: Kim, Dongyoung, et al.
Published: (2025)
by: Kim, Dongyoung, et al.
Published: (2025)
MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning
by: Chen, Jinhao, et al.
Published: (2025)
by: Chen, Jinhao, et al.
Published: (2025)
MSFNet-CPD: Multi-Scale Cross-Modal Fusion Network for Crop Pest Detection
by: Zhang, Jiaqi, et al.
Published: (2025)
by: Zhang, Jiaqi, et al.
Published: (2025)
RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution
by: Song, Yushuai, et al.
Published: (2026)
by: Song, Yushuai, et al.
Published: (2026)
APT: Improving Specialist LLM Performance with Weakness Case Acquisition and Iterative Preference Training
by: Rao, Jun, et al.
Published: (2025)
by: Rao, Jun, et al.
Published: (2025)
DeDPO: Debiased Direct Preference Optimization for Diffusion Models
by: Pham, Khiem, et al.
Published: (2026)
by: Pham, Khiem, et al.
Published: (2026)
Similar Items
-
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
by: Zhang, Zhihong, et al.
Published: (2025) -
Training Data Efficiency in Multimodal Process Reward Models
by: Li, Jinyuan, et al.
Published: (2026) -
MRM3: Machine Readable ML Model Metadata
by: Čop, Andrej, et al.
Published: (2025) -
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
by: Zhang, Zefeng, et al.
Published: (2025) -
Semi-Supervised Reward Modeling via Iterative Self-Training
by: He, Yifei, et al.
Published: (2024)