RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Hongli, Huang, Hui, Liu, Wei, Wang, Chenglong, Bu, Xingyuan, Han, Lvyuan, Song, Fuhai, Yang, Muyun, Jiang, Wenhao, Cao, Hailong, Zhao, Tiejun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4
by: Huang, Hui, et al.
Published: (2024)
by: Huang, Hui, et al.
Published: (2024)
Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory
by: Zhou, Hongli, et al.
Published: (2025)
by: Zhou, Hongli, et al.
Published: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
by: Huang, Hui, et al.
Published: (2026)
by: Huang, Hui, et al.
Published: (2026)
Mitigating the Bias of Large Language Model Evaluation
by: Zhou, Hongli, et al.
Published: (2024)
by: Zhou, Hongli, et al.
Published: (2024)
Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization
by: Zhou, Hongli, et al.
Published: (2026)
by: Zhou, Hongli, et al.
Published: (2026)
LLM-based Discriminative Reasoning for Knowledge Graph Question Answering
by: Xu, Mufan, et al.
Published: (2024)
by: Xu, Mufan, et al.
Published: (2024)
DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation
by: Jiang, Bo
Published: (2026)
by: Jiang, Bo
Published: (2026)
Memory-augmented Query Reconstruction for LLM-based Knowledge Graph Reasoning
by: Xu, Mufan, et al.
Published: (2025)
by: Xu, Mufan, et al.
Published: (2025)
Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
by: Lu, Yunhong, et al.
Published: (2025)
by: Lu, Yunhong, et al.
Published: (2025)
Enhancing Large Language Models'Machine Translation via Dynamic Focus Anchoring
by: Ding, Qiuyu, et al.
Published: (2025)
by: Ding, Qiuyu, et al.
Published: (2025)
Cross-Domain Bilingual Lexicon Induction via Pretrained Language Models
by: Ding, Qiuyu, et al.
Published: (2025)
by: Ding, Qiuyu, et al.
Published: (2025)
Thinking with DistilQwen: A Tale of Four Distilled Reasoning and Reward Model Series
by: Cai, Wenrui, et al.
Published: (2025)
by: Cai, Wenrui, et al.
Published: (2025)
Diversity-Rewarded CFG Distillation
by: Cideron, Geoffrey, et al.
Published: (2024)
by: Cideron, Geoffrey, et al.
Published: (2024)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
by: Hong, Ilgee, et al.
Published: (2025)
by: Hong, Ilgee, et al.
Published: (2025)
Self-Evaluation of Large Language Model based on Glass-box Features
by: Huang, Hui, et al.
Published: (2024)
by: Huang, Hui, et al.
Published: (2024)
FedDistill: Global Model Distillation for Local Model De-Biasing in Non-IID Federated Learning
by: Song, Changlin, et al.
Published: (2024)
by: Song, Changlin, et al.
Published: (2024)
Dynamic Planning for LLM-based Graphical User Interface Automation
by: Zhang, Shaoqing, et al.
Published: (2024)
by: Zhang, Shaoqing, et al.
Published: (2024)
Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases
by: Huang, Hui, et al.
Published: (2026)
by: Huang, Hui, et al.
Published: (2026)
Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling
by: Chen, Andong, et al.
Published: (2026)
by: Chen, Andong, et al.
Published: (2026)
Make Imagination Clearer! Stable Diffusion-based Visual Imagination for Multimodal Machine Translation
by: Chen, Andong, et al.
Published: (2024)
by: Chen, Andong, et al.
Published: (2024)
PMoL: Parameter Efficient MoE for Preference Mixing of LLM Alignment
by: Liu, Dongxu, et al.
Published: (2024)
by: Liu, Dongxu, et al.
Published: (2024)
ProgRM: Build Better GUI Agents with Progress Rewards
by: Zhang, Danyang, et al.
Published: (2025)
by: Zhang, Danyang, et al.
Published: (2025)
Look Before You Leap: Enhancing Attention and Vigilance Regarding Harmful Content with GuidelineLLM
by: Zhang, Shaoqing, et al.
Published: (2024)
by: Zhang, Shaoqing, et al.
Published: (2024)
LoRA-drop: Efficient LoRA Parameter Pruning based on Output Evaluation
by: Zhou, Hongyun, et al.
Published: (2024)
by: Zhou, Hongyun, et al.
Published: (2024)
KoGNER: A Novel Framework for Knowledge Graph Distillation on Biomedical Named Entity Recognition
by: Zhang, Heming, et al.
Published: (2025)
by: Zhang, Heming, et al.
Published: (2025)
Exploiting Inter-sample and Inter-feature Relations in Dataset Distillation
by: Deng, Wenxiao, et al.
Published: (2024)
by: Deng, Wenxiao, et al.
Published: (2024)
Online Knowledge Distillation with Reward Guidance
by: Jia, Chen
Published: (2025)
by: Jia, Chen
Published: (2025)
Reward Guided Latent Consistency Distillation
by: Li, Jiachen, et al.
Published: (2024)
by: Li, Jiachen, et al.
Published: (2024)
Preference Score Distillation: Leveraging 2D Rewards to Align Text-to-3D Generation with Human Preference
by: Leng, Jiaqi, et al.
Published: (2026)
by: Leng, Jiaqi, et al.
Published: (2026)
AgentRM: Enhancing Agent Generalization with Reward Modeling
by: Xia, Yu, et al.
Published: (2025)
by: Xia, Yu, et al.
Published: (2025)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
by: Yang, Wenkai, et al.
Published: (2026)
by: Yang, Wenkai, et al.
Published: (2026)
Breaking Modality Gap in RGBT Tracking: Coupled Knowledge Distillation
by: Lu, Andong, et al.
Published: (2024)
by: Lu, Andong, et al.
Published: (2024)
PairDistill: Pairwise Relevance Distillation for Dense Retrieval
by: Huang, Chao-Wei, et al.
Published: (2024)
by: Huang, Chao-Wei, et al.
Published: (2024)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
by: Lai, Yuhang, et al.
Published: (2024)
by: Lai, Yuhang, et al.
Published: (2024)
MiniLLM: On-Policy Distillation of Large Language Models
by: Gu, Yuxian, et al.
Published: (2023)
by: Gu, Yuxian, et al.
Published: (2023)
Self-Evolution Knowledge Distillation for LLM-based Machine Translation
by: Song, Yuncheng, et al.
Published: (2024)
by: Song, Yuncheng, et al.
Published: (2024)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
by: Liu, Shujun, et al.
Published: (2024)
by: Liu, Shujun, et al.
Published: (2024)
LLM-based Translation Inference with Iterative Bilingual Understanding
by: Chen, Andong, et al.
Published: (2024)
by: Chen, Andong, et al.
Published: (2024)
MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive Training
by: Huang, Hui, et al.
Published: (2025)
by: Huang, Hui, et al.
Published: (2025)
Distilling the Unknown to Unveil Certainty
by: Zhao, Zhilin, et al.
Published: (2023)
by: Zhao, Zhilin, et al.
Published: (2023)
Similar Items
-
An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4
by: Huang, Hui, et al.
Published: (2024) -
Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory
by: Zhou, Hongli, et al.
Published: (2025) -
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
by: Huang, Hui, et al.
Published: (2026) -
Mitigating the Bias of Large Language Model Evaluation
by: Zhou, Hongli, et al.
Published: (2024) -
Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization
by: Zhou, Hongli, et al.
Published: (2026)