UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Lingling, Xue, Yongfu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization
par: Fu, Lingling, et autres
Publié: (2026)
par: Fu, Lingling, et autres
Publié: (2026)
Hierarchical LoRA MoE for Efficient CTR Model Scaling
par: Zeng, Zhichen, et autres
Publié: (2025)
par: Zeng, Zhichen, et autres
Publié: (2025)
Probabilistic Rank and Reward: A Scalable Model for Slate Recommendation
par: Aouali, Imad, et autres
Publié: (2022)
par: Aouali, Imad, et autres
Publié: (2022)
RewardRank: Optimizing True Learning-to-Rank Utility
par: Bhatt, Gaurav, et autres
Publié: (2025)
par: Bhatt, Gaurav, et autres
Publié: (2025)
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
par: Zeng, Wenwen, et autres
Publié: (2026)
par: Zeng, Wenwen, et autres
Publié: (2026)
EBaReT: Expert-guided Bag Reward Transformer for Auto Bidding
par: Li, Kaiyuan, et autres
Publié: (2025)
par: Li, Kaiyuan, et autres
Publié: (2025)
Orchestrating Heterogeneous Experts: A Scalable MoE Framework with Anisotropy-Preserving Fusion
par: Liu, Ye, et autres
Publié: (2025)
par: Liu, Ye, et autres
Publié: (2025)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
par: Miao, Yuchun, et autres
Publié: (2024)
par: Miao, Yuchun, et autres
Publié: (2024)
Exploring Test-time Scaling via Prediction Merging on Large-Scale Recommendation
par: Lyu, Fuyuan, et autres
Publié: (2025)
par: Lyu, Fuyuan, et autres
Publié: (2025)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL
par: Wang, Youting, et autres
Publié: (2026)
par: Wang, Youting, et autres
Publié: (2026)
Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training
par: Xia, Tianle, et autres
Publié: (2026)
par: Xia, Tianle, et autres
Publié: (2026)
Mitigating Pooling Bias in E-commerce Search via False Negative Estimation
par: Wang, Xiaochen, et autres
Publié: (2023)
par: Wang, Xiaochen, et autres
Publié: (2023)
BiCoRec: Bias-Mitigated Context-Aware Sequential Recommendation Model
par: Muthivhi, Mufhumudzi, et autres
Publié: (2025)
par: Muthivhi, Mufhumudzi, et autres
Publié: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025)
par: Fu, Jiayi, et autres
Publié: (2025)
Temporal Information Retrieval via Time-Specifier Model Merging
par: Han, SeungYoon, et autres
Publié: (2025)
par: Han, SeungYoon, et autres
Publié: (2025)
Analyzing and Mitigating Repetitions in Trip Recommendation
par: Shu, Wenzheng, et autres
Publié: (2025)
par: Shu, Wenzheng, et autres
Publié: (2025)
MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting
par: Wei, Kangda, et autres
Publié: (2026)
par: Wei, Kangda, et autres
Publié: (2026)
MoToRec: Sparse-Regularized Multimodal Tokenization for Cold-Start Recommendation
par: Liu, Jialin, et autres
Publié: (2026)
par: Liu, Jialin, et autres
Publié: (2026)
On the Necessity of World Knowledge for Mitigating Missing Labels in Extreme Classification
par: Prakash, Jatin, et autres
Publié: (2024)
par: Prakash, Jatin, et autres
Publié: (2024)
Optimizing Novelty of Top-k Recommendations using Large Language Models and Reinforcement Learning
par: Sharma, Amit, et autres
Publié: (2024)
par: Sharma, Amit, et autres
Publié: (2024)
Debiasing Message Passing to Mitigate Popularity Bias in GNN-based Collaborative Filtering
par: Islam, Md Aminul, et autres
Publié: (2026)
par: Islam, Md Aminul, et autres
Publié: (2026)
LIME: Link-based user-item Interaction Modeling with decoupled xor attention for Efficient test time scaling
par: Jiang, Yunjiang, et autres
Publié: (2025)
par: Jiang, Yunjiang, et autres
Publié: (2025)
Linear-PAL: A Lightweight Ranker for Mitigating Shortcut Learning in Personalized, High-Bias Tabular Ranking
par: Pawar, Vipul Dinesh
Publié: (2025)
par: Pawar, Vipul Dinesh
Publié: (2025)
CF-KAN: Kolmogorov-Arnold Network-based Collaborative Filtering to Mitigate Catastrophic Forgetting in Recommender Systems
par: Park, Jin-Duk, et autres
Publié: (2024)
par: Park, Jin-Duk, et autres
Publié: (2024)
Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERT
par: Saad-Falcon, Jon, et autres
Publié: (2024)
par: Saad-Falcon, Jon, et autres
Publié: (2024)
Mitigating Exposure Bias in Online Learning to Rank Recommendation: A Novel Reward Model for Cascading Bandits
par: Mansoury, Masoud, et autres
Publié: (2024)
par: Mansoury, Masoud, et autres
Publié: (2024)
A Language-Driven Framework for Improving Personalized Recommendations: Merging LLMs with Traditional Algorithms
par: Goldstein, Aaron, et autres
Publié: (2025)
par: Goldstein, Aaron, et autres
Publié: (2025)
ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging
par: Verma, Neha, et autres
Publié: (2026)
par: Verma, Neha, et autres
Publié: (2026)
Cross-attention Secretly Performs Orthogonal Alignment in Recommendation Models
par: Lee, Hyunin, et autres
Publié: (2025)
par: Lee, Hyunin, et autres
Publié: (2025)
Constructing a Question-Answering Simulator through the Distillation of LLMs
par: Liu, Haipeng, et autres
Publié: (2025)
par: Liu, Haipeng, et autres
Publié: (2025)
Metric-agnostic Learning-to-Rank via Boosting and Rank Approximation
par: Gomez, Camilo, et autres
Publié: (2026)
par: Gomez, Camilo, et autres
Publié: (2026)
Reward Hacking Mitigation using Verifiable Composite Rewards
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
par: Hatgis-Kessell, Stephane, et autres
Publié: (2025)
par: Hatgis-Kessell, Stephane, et autres
Publié: (2025)
Predict Click-Through Rates with Deep Interest Network Model in E-commerce Advertising
par: Zhou, Chang, et autres
Publié: (2024)
par: Zhou, Chang, et autres
Publié: (2024)
Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional Training
par: Wang, Mengru, et autres
Publié: (2025)
par: Wang, Mengru, et autres
Publié: (2025)
Knowledge Distillation for Enhancing Walmart E-commerce Search Relevance Using Large Language Models
par: Shang, Hongwei, et autres
Publié: (2025)
par: Shang, Hongwei, et autres
Publié: (2025)
Joint Model Parameter Scaling and Universal-Domain Data Integration for E-commerce Search Ranking
par: Yu, Liren, et autres
Publié: (2026)
par: Yu, Liren, et autres
Publié: (2026)
Fine-Tuning Diffusion-Based Recommender Systems via Reinforcement Learning with Reward Function Optimization
par: Hou, Yu, et autres
Publié: (2025)
par: Hou, Yu, et autres
Publié: (2025)
Do Not Wait: Learning Re-Ranking Model Without User Feedback At Serving Time in E-Commerce
par: Wang, Yuan, et autres
Publié: (2024)
par: Wang, Yuan, et autres
Publié: (2024)
Documents similaires
-
TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization
par: Fu, Lingling, et autres
Publié: (2026) -
Hierarchical LoRA MoE for Efficient CTR Model Scaling
par: Zeng, Zhichen, et autres
Publié: (2025) -
Probabilistic Rank and Reward: A Scalable Model for Slate Recommendation
par: Aouali, Imad, et autres
Publié: (2022) -
RewardRank: Optimizing True Learning-to-Rank Utility
par: Bhatt, Gaurav, et autres
Publié: (2025) -
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
par: Zeng, Wenwen, et autres
Publié: (2026)