MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Qi, Yupeng, Lyu, Ziyu, Yang, Min, Wang, Yanlin, Bai, Lu, Cui, Lixin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding
di: Qi, Yupeng, et al.
Pubblicazione: (2026)
di: Qi, Yupeng, et al.
Pubblicazione: (2026)
DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization
di: She, Shuaijie, et al.
Pubblicazione: (2025)
di: She, Shuaijie, et al.
Pubblicazione: (2025)
RAIE: Region-Aware Incremental Preference Editing with LoRA for LLM-based Recommendation
di: Zeng, Jin, et al.
Pubblicazione: (2026)
di: Zeng, Jin, et al.
Pubblicazione: (2026)
SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models
di: Rao, Jun, et al.
Pubblicazione: (2025)
di: Rao, Jun, et al.
Pubblicazione: (2025)
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
di: Zhang, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhang, Wenxuan, et al.
Pubblicazione: (2024)
Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
di: Deng, Qiyuan, et al.
Pubblicazione: (2025)
di: Deng, Qiyuan, et al.
Pubblicazione: (2025)
Transfer-Prompting: Enhancing Cross-Task Adaptation in Large Language Models via Dual-Stage Prompts Optimization
di: Chang, Yupeng, et al.
Pubblicazione: (2025)
di: Chang, Yupeng, et al.
Pubblicazione: (2025)
Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models
di: Lu, Xudong, et al.
Pubblicazione: (2024)
di: Lu, Xudong, et al.
Pubblicazione: (2024)
Unveiling Super Experts in Mixture-of-Experts Large Language Models
di: Su, Zunhai, et al.
Pubblicazione: (2025)
di: Su, Zunhai, et al.
Pubblicazione: (2025)
DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
Cluster-Driven Expert Pruning for Mixture-of-Experts Large Language Models
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
PrefPO: Pairwise Preference Prompt Optimization
di: Singhal, Rahul, et al.
Pubblicazione: (2026)
di: Singhal, Rahul, et al.
Pubblicazione: (2026)
Knowledge Probing for Graph Representation Learning
di: Zhao, Mingyu, et al.
Pubblicazione: (2024)
di: Zhao, Mingyu, et al.
Pubblicazione: (2024)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
Bayesian Mixture of Experts For Large Language Models
di: Dialameh, Maryam, et al.
Pubblicazione: (2025)
di: Dialameh, Maryam, et al.
Pubblicazione: (2025)
AMaPO: Adaptive Margin-attached Preference Optimization for Language Model Alignment
di: Deng, Ruibo, et al.
Pubblicazione: (2025)
di: Deng, Ruibo, et al.
Pubblicazione: (2025)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
di: Zhu, Zining, et al.
Pubblicazione: (2025)
di: Zhu, Zining, et al.
Pubblicazione: (2025)
CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization
di: Li, Junyi, et al.
Pubblicazione: (2026)
di: Li, Junyi, et al.
Pubblicazione: (2026)
Towards Safety and Helpfulness Balanced Responses via Controllable Large Language Models
di: Tuan, Yi-Lin, et al.
Pubblicazione: (2024)
di: Tuan, Yi-Lin, et al.
Pubblicazione: (2024)
Large Language Model Cascades with Mixture of Thoughts Representations for Cost-efficient Reasoning
di: Yue, Murong, et al.
Pubblicazione: (2023)
di: Yue, Murong, et al.
Pubblicazione: (2023)
Upcycling Large Language Models into Mixture of Experts
di: He, Ethan, et al.
Pubblicazione: (2024)
di: He, Ethan, et al.
Pubblicazione: (2024)
POROver: Improving Safety and Reducing Overrefusal in Large Language Models with Overgeneration and Preference Optimization
di: Karaman, Batuhan K., et al.
Pubblicazione: (2024)
di: Karaman, Batuhan K., et al.
Pubblicazione: (2024)
SciDFM: A Large Language Model with Mixture-of-Experts for Science
di: Sun, Liangtai, et al.
Pubblicazione: (2024)
di: Sun, Liangtai, et al.
Pubblicazione: (2024)
EvoMoE: Expert Evolution in Mixture of Experts for Multimodal Large Language Models
di: Jing, Linglin, et al.
Pubblicazione: (2025)
di: Jing, Linglin, et al.
Pubblicazione: (2025)
FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings
di: Liu, Tong, et al.
Pubblicazione: (2025)
di: Liu, Tong, et al.
Pubblicazione: (2025)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
di: Xiang, Hao, et al.
Pubblicazione: (2024)
di: Xiang, Hao, et al.
Pubblicazione: (2024)
A Survey on Mixture of Experts in Large Language Models
di: Cai, Weilin, et al.
Pubblicazione: (2024)
di: Cai, Weilin, et al.
Pubblicazione: (2024)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization
di: Sun, Huashan, et al.
Pubblicazione: (2025)
di: Sun, Huashan, et al.
Pubblicazione: (2025)
Pre-Attention Expert Prediction and Prefetching for Mixture-of-Experts Large Language Models
di: Zhu, Shien, et al.
Pubblicazione: (2025)
di: Zhu, Shien, et al.
Pubblicazione: (2025)
ComPO: Community Preferences for Language Model Personalization
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference Alignment
di: Wang, Jianing, et al.
Pubblicazione: (2024)
di: Wang, Jianing, et al.
Pubblicazione: (2024)
Routing by Analogy: kNN-Augmented Expert Assignment for Mixture-of-Experts
di: Lyu, Boxuan, et al.
Pubblicazione: (2026)
di: Lyu, Boxuan, et al.
Pubblicazione: (2026)
Diversifying the Mixture-of-Experts Representation for Language Models with Orthogonal Optimizer
di: Liu, Boan, et al.
Pubblicazione: (2023)
di: Liu, Boan, et al.
Pubblicazione: (2023)
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
di: Huang, Yushi, et al.
Pubblicazione: (2025)
di: Huang, Yushi, et al.
Pubblicazione: (2025)
FactorLLM: Factorizing Knowledge via Mixture of Experts for Large Language Models
di: Zhao, Zhongyu, et al.
Pubblicazione: (2024)
di: Zhao, Zhongyu, et al.
Pubblicazione: (2024)
Mixtures of SubExperts for Large Language Continual Learning
di: Kang, Haeyong
Pubblicazione: (2025)
di: Kang, Haeyong
Pubblicazione: (2025)
A Closer Look into Mixture-of-Experts in Large Language Models
di: Lo, Ka Man, et al.
Pubblicazione: (2024)
di: Lo, Ka Man, et al.
Pubblicazione: (2024)
Understanding and Leveraging the Expert Specialization of Context Faithfulness in Mixture-of-Experts LLMs
di: Bai, Jun, et al.
Pubblicazione: (2025)
di: Bai, Jun, et al.
Pubblicazione: (2025)
Dropping Experts, Recombining Neurons: Retraining-Free Pruning for Sparse Mixture-of-Experts LLMs
di: Zhou, Yixiao, et al.
Pubblicazione: (2025)
di: Zhou, Yixiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding
di: Qi, Yupeng, et al.
Pubblicazione: (2026) -
DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization
di: She, Shuaijie, et al.
Pubblicazione: (2025) -
RAIE: Region-Aware Incremental Preference Editing with LoRA for LLM-based Recommendation
di: Zeng, Jin, et al.
Pubblicazione: (2026) -
SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models
di: Rao, Jun, et al.
Pubblicazione: (2025) -
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
di: Zhang, Wenxuan, et al.
Pubblicazione: (2024)