TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Lingling, Xu, Yongfu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking
par: Fu, Lingling, et autres
Publié: (2025)
par: Fu, Lingling, et autres
Publié: (2025)
FashionDPO:Fine-tune Fashion Outfit Generation Model using Direct Preference Optimization
par: Yu, Mingzhe, et autres
Publié: (2025)
par: Yu, Mingzhe, et autres
Publié: (2025)
RAD-DPO: Robust Adaptive Denoising Direct Preference Optimization for Generative Retrieval in E-commerce
par: Chen, Zhiguo, et autres
Publié: (2026)
par: Chen, Zhiguo, et autres
Publié: (2026)
Direct Preference Optimization for LLM-Enhanced Recommendation Systems
par: Sun, Chao, et autres
Publié: (2024)
par: Sun, Chao, et autres
Publié: (2024)
On Negative-aware Preference Optimization for Recommendation
par: Ding, Chenlu, et autres
Publié: (2025)
par: Ding, Chenlu, et autres
Publié: (2025)
Proactive Recommendation with Iterative Preference Guidance
par: Bi, Shuxian, et autres
Publié: (2024)
par: Bi, Shuxian, et autres
Publié: (2024)
Listwise Preference Diffusion Optimization for User Behavior Trajectories Prediction
par: Huang, Hongtao, et autres
Publié: (2025)
par: Huang, Hongtao, et autres
Publié: (2025)
On Softmax Direct Preference Optimization for Recommendation
par: Chen, Yuxin, et autres
Publié: (2024)
par: Chen, Yuxin, et autres
Publié: (2024)
Reinforced Preference Optimization for Recommendation
par: Tan, Junfei, et autres
Publié: (2025)
par: Tan, Junfei, et autres
Publié: (2025)
Oracle-guided Dynamic User Preference Modeling for Sequential Recommendation
par: Xia, Jiafeng, et autres
Publié: (2024)
par: Xia, Jiafeng, et autres
Publié: (2024)
RankGR: Rank-Enhanced Generative Retrieval with Listwise Direct Preference Optimization in Recommendation
par: Fu, Kairui, et autres
Publié: (2026)
par: Fu, Kairui, et autres
Publié: (2026)
Preference Trajectory Modeling via Flow Matching for Sequential Recommendation
par: Li, Li, et autres
Publié: (2025)
par: Li, Li, et autres
Publié: (2025)
Coherence-guided Preference Disentanglement for Cross-domain Recommendations
par: Xiang, Zongyi, et autres
Publié: (2024)
par: Xiang, Zongyi, et autres
Publié: (2024)
Aligning Web Query Generation with Ranking Objectives via Direct Preference Optimization
par: Coelho, João, et autres
Publié: (2025)
par: Coelho, João, et autres
Publié: (2025)
Refining Text Generation for Realistic Conversational Recommendation via Direct Preference Optimization
par: Tajiri, Manato, et autres
Publié: (2025)
par: Tajiri, Manato, et autres
Publié: (2025)
Reinforced Preference Optimization for Reasoning-Augmented Recommendations
par: Gao, Jingtong, et autres
Publié: (2026)
par: Gao, Jingtong, et autres
Publié: (2026)
Causal Direct Preference Optimization for Distributionally Robust Generative Recommendation
par: Zhao, Chu, et autres
Publié: (2026)
par: Zhao, Chu, et autres
Publié: (2026)
Optimizing LLMs with Direct Preferences: A Data Efficiency Perspective
par: Bernardelle, Pietro, et autres
Publié: (2024)
par: Bernardelle, Pietro, et autres
Publié: (2024)
Align-for-Fusion: Harmonizing Triple Preferences via Dual-oriented Diffusion for Cross-domain Sequential Recommendation
par: Zha, Yongfu, et autres
Publié: (2025)
par: Zha, Yongfu, et autres
Publié: (2025)
OneRec: Unifying Retrieve and Rank with Generative Recommender and Iterative Preference Alignment
par: Deng, Jiaxin, et autres
Publié: (2025)
par: Deng, Jiaxin, et autres
Publié: (2025)
K-order Ranking Preference Optimization for Large Language Models
par: Cai, Shihao, et autres
Publié: (2025)
par: Cai, Shihao, et autres
Publié: (2025)
TrackRec: Iterative Alternating Feedback with Chain-of-Thought via Preference Alignment for Recommendation
par: Xia, Yu, et autres
Publié: (2025)
par: Xia, Yu, et autres
Publié: (2025)
Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation
par: Wang, Yu, et autres
Publié: (2025)
par: Wang, Yu, et autres
Publié: (2025)
Clinical Reading Comprehension with Encoder-Decoder Models Enhanced by Direct Preference Optimization
par: Nahian, Md Sultan Al, et autres
Publié: (2024)
par: Nahian, Md Sultan Al, et autres
Publié: (2024)
Federated User Preference Modeling for Privacy-Preserving Cross-Domain Recommendation
par: Wang, Li, et autres
Publié: (2024)
par: Wang, Li, et autres
Publié: (2024)
Listwise Preference Alignment Optimization for Tail Item Recommendation
par: Li, Zihao, et autres
Publié: (2025)
par: Li, Zihao, et autres
Publié: (2025)
Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE
par: Huang, Hejin, et autres
Publié: (2026)
par: Huang, Hejin, et autres
Publié: (2026)
Fading to Grow: Growing Preference Ratios via Preference Fading Discrete Diffusion for Recommendation
par: Hu, Guoqing, et autres
Publié: (2025)
par: Hu, Guoqing, et autres
Publié: (2025)
Disentangled Modeling of Preferences and Social Influence for Group Recommendation
par: Ye, Guangze, et autres
Publié: (2025)
par: Ye, Guangze, et autres
Publié: (2025)
Vague Preference Policy Learning for Conversational Recommendation
par: Zhang, Gangyi, et autres
Publié: (2023)
par: Zhang, Gangyi, et autres
Publié: (2023)
DynamicPO: Dynamic Preference Optimization for Recommendation
par: Hu, Xingyu, et autres
Publié: (2026)
par: Hu, Xingyu, et autres
Publié: (2026)
CTR-Driven Ad Text Generation via Online Feedback Preference Optimization
par: Chen, Yanda, et autres
Publié: (2025)
par: Chen, Yanda, et autres
Publié: (2025)
Multi-Grained Preference Enhanced Transformer for Multi-Behavior Sequential Recommendation
par: He, Chuan, et autres
Publié: (2024)
par: He, Chuan, et autres
Publié: (2024)
Behavior-Contextualized Item Preference Modeling for Multi-Behavior Recommendation
par: Yan, Mingshi, et autres
Publié: (2024)
par: Yan, Mingshi, et autres
Publié: (2024)
Exploring Preference-Guided Diffusion Model for Cross-Domain Recommendation
par: Li, Xiaodong, et autres
Publié: (2025)
par: Li, Xiaodong, et autres
Publié: (2025)
NextQuill: Causal Preference Modeling for Enhancing LLM Personalization
par: Zhao, Xiaoyan, et autres
Publié: (2025)
par: Zhao, Xiaoyan, et autres
Publié: (2025)
Embed Progressive Implicit Preference in Unified Space for Deep Collaborative Filtering
par: Zhang, Zhongjin, et autres
Publié: (2025)
par: Zhang, Zhongjin, et autres
Publié: (2025)
Affect-aware Cross-Domain Recommendation for Art Therapy via Music Preference Elicitation
par: Yilma, Bereket A., et autres
Publié: (2025)
par: Yilma, Bereket A., et autres
Publié: (2025)
Generative Retrieval with Preference Optimization for E-commerce Search
par: Li, Mingming, et autres
Publié: (2024)
par: Li, Mingming, et autres
Publié: (2024)
Multi-Domain Recommendation to Attract Users via Domain Preference Modeling
par: Ju, Hyunjun, et autres
Publié: (2024)
par: Ju, Hyunjun, et autres
Publié: (2024)
Documents similaires
-
UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking
par: Fu, Lingling, et autres
Publié: (2025) -
FashionDPO:Fine-tune Fashion Outfit Generation Model using Direct Preference Optimization
par: Yu, Mingzhe, et autres
Publié: (2025) -
RAD-DPO: Robust Adaptive Denoising Direct Preference Optimization for Generative Retrieval in E-commerce
par: Chen, Zhiguo, et autres
Publié: (2026) -
Direct Preference Optimization for LLM-Enhanced Recommendation Systems
par: Sun, Chao, et autres
Publié: (2024) -
On Negative-aware Preference Optimization for Recommendation
par: Ding, Chenlu, et autres
Publié: (2025)