UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fu, Lingling, Xue, Yongfu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization
von: Fu, Lingling, et al.
Veröffentlicht: (2026)
von: Fu, Lingling, et al.
Veröffentlicht: (2026)
Hierarchical LoRA MoE for Efficient CTR Model Scaling
von: Zeng, Zhichen, et al.
Veröffentlicht: (2025)
von: Zeng, Zhichen, et al.
Veröffentlicht: (2025)
Probabilistic Rank and Reward: A Scalable Model for Slate Recommendation
von: Aouali, Imad, et al.
Veröffentlicht: (2022)
von: Aouali, Imad, et al.
Veröffentlicht: (2022)
RewardRank: Optimizing True Learning-to-Rank Utility
von: Bhatt, Gaurav, et al.
Veröffentlicht: (2025)
von: Bhatt, Gaurav, et al.
Veröffentlicht: (2025)
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
von: Zeng, Wenwen, et al.
Veröffentlicht: (2026)
von: Zeng, Wenwen, et al.
Veröffentlicht: (2026)
EBaReT: Expert-guided Bag Reward Transformer for Auto Bidding
von: Li, Kaiyuan, et al.
Veröffentlicht: (2025)
von: Li, Kaiyuan, et al.
Veröffentlicht: (2025)
Orchestrating Heterogeneous Experts: A Scalable MoE Framework with Anisotropy-Preserving Fusion
von: Liu, Ye, et al.
Veröffentlicht: (2025)
von: Liu, Ye, et al.
Veröffentlicht: (2025)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
von: Miao, Yuchun, et al.
Veröffentlicht: (2024)
von: Miao, Yuchun, et al.
Veröffentlicht: (2024)
Exploring Test-time Scaling via Prediction Merging on Large-Scale Recommendation
von: Lyu, Fuyuan, et al.
Veröffentlicht: (2025)
von: Lyu, Fuyuan, et al.
Veröffentlicht: (2025)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL
von: Wang, Youting, et al.
Veröffentlicht: (2026)
von: Wang, Youting, et al.
Veröffentlicht: (2026)
Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training
von: Xia, Tianle, et al.
Veröffentlicht: (2026)
von: Xia, Tianle, et al.
Veröffentlicht: (2026)
Mitigating Pooling Bias in E-commerce Search via False Negative Estimation
von: Wang, Xiaochen, et al.
Veröffentlicht: (2023)
von: Wang, Xiaochen, et al.
Veröffentlicht: (2023)
BiCoRec: Bias-Mitigated Context-Aware Sequential Recommendation Model
von: Muthivhi, Mufhumudzi, et al.
Veröffentlicht: (2025)
von: Muthivhi, Mufhumudzi, et al.
Veröffentlicht: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
Temporal Information Retrieval via Time-Specifier Model Merging
von: Han, SeungYoon, et al.
Veröffentlicht: (2025)
von: Han, SeungYoon, et al.
Veröffentlicht: (2025)
Analyzing and Mitigating Repetitions in Trip Recommendation
von: Shu, Wenzheng, et al.
Veröffentlicht: (2025)
von: Shu, Wenzheng, et al.
Veröffentlicht: (2025)
MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting
von: Wei, Kangda, et al.
Veröffentlicht: (2026)
von: Wei, Kangda, et al.
Veröffentlicht: (2026)
MoToRec: Sparse-Regularized Multimodal Tokenization for Cold-Start Recommendation
von: Liu, Jialin, et al.
Veröffentlicht: (2026)
von: Liu, Jialin, et al.
Veröffentlicht: (2026)
On the Necessity of World Knowledge for Mitigating Missing Labels in Extreme Classification
von: Prakash, Jatin, et al.
Veröffentlicht: (2024)
von: Prakash, Jatin, et al.
Veröffentlicht: (2024)
Optimizing Novelty of Top-k Recommendations using Large Language Models and Reinforcement Learning
von: Sharma, Amit, et al.
Veröffentlicht: (2024)
von: Sharma, Amit, et al.
Veröffentlicht: (2024)
Debiasing Message Passing to Mitigate Popularity Bias in GNN-based Collaborative Filtering
von: Islam, Md Aminul, et al.
Veröffentlicht: (2026)
von: Islam, Md Aminul, et al.
Veröffentlicht: (2026)
LIME: Link-based user-item Interaction Modeling with decoupled xor attention for Efficient test time scaling
von: Jiang, Yunjiang, et al.
Veröffentlicht: (2025)
von: Jiang, Yunjiang, et al.
Veröffentlicht: (2025)
Linear-PAL: A Lightweight Ranker for Mitigating Shortcut Learning in Personalized, High-Bias Tabular Ranking
von: Pawar, Vipul Dinesh
Veröffentlicht: (2025)
von: Pawar, Vipul Dinesh
Veröffentlicht: (2025)
CF-KAN: Kolmogorov-Arnold Network-based Collaborative Filtering to Mitigate Catastrophic Forgetting in Recommender Systems
von: Park, Jin-Duk, et al.
Veröffentlicht: (2024)
von: Park, Jin-Duk, et al.
Veröffentlicht: (2024)
Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERT
von: Saad-Falcon, Jon, et al.
Veröffentlicht: (2024)
von: Saad-Falcon, Jon, et al.
Veröffentlicht: (2024)
Mitigating Exposure Bias in Online Learning to Rank Recommendation: A Novel Reward Model for Cascading Bandits
von: Mansoury, Masoud, et al.
Veröffentlicht: (2024)
von: Mansoury, Masoud, et al.
Veröffentlicht: (2024)
A Language-Driven Framework for Improving Personalized Recommendations: Merging LLMs with Traditional Algorithms
von: Goldstein, Aaron, et al.
Veröffentlicht: (2025)
von: Goldstein, Aaron, et al.
Veröffentlicht: (2025)
ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging
von: Verma, Neha, et al.
Veröffentlicht: (2026)
von: Verma, Neha, et al.
Veröffentlicht: (2026)
Cross-attention Secretly Performs Orthogonal Alignment in Recommendation Models
von: Lee, Hyunin, et al.
Veröffentlicht: (2025)
von: Lee, Hyunin, et al.
Veröffentlicht: (2025)
Constructing a Question-Answering Simulator through the Distillation of LLMs
von: Liu, Haipeng, et al.
Veröffentlicht: (2025)
von: Liu, Haipeng, et al.
Veröffentlicht: (2025)
Metric-agnostic Learning-to-Rank via Boosting and Rank Approximation
von: Gomez, Camilo, et al.
Veröffentlicht: (2026)
von: Gomez, Camilo, et al.
Veröffentlicht: (2026)
Reward Hacking Mitigation using Verifiable Composite Rewards
von: Tarek, Mirza Farhan Bin, et al.
Veröffentlicht: (2025)
von: Tarek, Mirza Farhan Bin, et al.
Veröffentlicht: (2025)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
von: Hatgis-Kessell, Stephane, et al.
Veröffentlicht: (2025)
von: Hatgis-Kessell, Stephane, et al.
Veröffentlicht: (2025)
Predict Click-Through Rates with Deep Interest Network Model in E-commerce Advertising
von: Zhou, Chang, et al.
Veröffentlicht: (2024)
von: Zhou, Chang, et al.
Veröffentlicht: (2024)
Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional Training
von: Wang, Mengru, et al.
Veröffentlicht: (2025)
von: Wang, Mengru, et al.
Veröffentlicht: (2025)
Knowledge Distillation for Enhancing Walmart E-commerce Search Relevance Using Large Language Models
von: Shang, Hongwei, et al.
Veröffentlicht: (2025)
von: Shang, Hongwei, et al.
Veröffentlicht: (2025)
Joint Model Parameter Scaling and Universal-Domain Data Integration for E-commerce Search Ranking
von: Yu, Liren, et al.
Veröffentlicht: (2026)
von: Yu, Liren, et al.
Veröffentlicht: (2026)
Fine-Tuning Diffusion-Based Recommender Systems via Reinforcement Learning with Reward Function Optimization
von: Hou, Yu, et al.
Veröffentlicht: (2025)
von: Hou, Yu, et al.
Veröffentlicht: (2025)
Do Not Wait: Learning Re-Ranking Model Without User Feedback At Serving Time in E-Commerce
von: Wang, Yuan, et al.
Veröffentlicht: (2024)
von: Wang, Yuan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization
von: Fu, Lingling, et al.
Veröffentlicht: (2026) -
Hierarchical LoRA MoE for Efficient CTR Model Scaling
von: Zeng, Zhichen, et al.
Veröffentlicht: (2025) -
Probabilistic Rank and Reward: A Scalable Model for Slate Recommendation
von: Aouali, Imad, et al.
Veröffentlicht: (2022) -
RewardRank: Optimizing True Learning-to-Rank Utility
von: Bhatt, Gaurav, et al.
Veröffentlicht: (2025) -
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
von: Zeng, Wenwen, et al.
Veröffentlicht: (2026)