Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Wenxuan, Torr, Philip H. S., Elhoseiny, Mohamed, Bibi, Adel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Universal In-Context Approximation By Prompting Fully Recurrent Models
por: Petrov, Aleksandar, et al.
Publicado: (2024)
por: Petrov, Aleksandar, et al.
Publicado: (2024)
Model Merging and Safety Alignment: One Bad Model Spoils the Bunch
por: Hammoud, Hasan Abed Al Kader, et al.
Publicado: (2024)
por: Hammoud, Hasan Abed Al Kader, et al.
Publicado: (2024)
No Culture Left Behind: ArtELingo-28, a Benchmark of WikiArt with Captions in 28 Languages
por: Mohamed, Youssef, et al.
Publicado: (2024)
por: Mohamed, Youssef, et al.
Publicado: (2024)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
por: Alssum, Lama, et al.
Publicado: (2025)
por: Alssum, Lama, et al.
Publicado: (2025)
Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation
por: Zhang, Wenxuan, et al.
Publicado: (2024)
por: Zhang, Wenxuan, et al.
Publicado: (2024)
When Do Prompting and Prefix-Tuning Work? A Theory of Capabilities and Limitations
por: Petrov, Aleksandar, et al.
Publicado: (2023)
por: Petrov, Aleksandar, et al.
Publicado: (2023)
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
por: Lan, Michael, et al.
Publicado: (2023)
por: Lan, Michael, et al.
Publicado: (2023)
T-REG: Preference Optimization with Token-Level Reward Regularization
por: Zhou, Wenxuan, et al.
Publicado: (2024)
por: Zhou, Wenxuan, et al.
Publicado: (2024)
Prompting a Pretrained Transformer Can Be a Universal Approximator
por: Petrov, Aleksandar, et al.
Publicado: (2024)
por: Petrov, Aleksandar, et al.
Publicado: (2024)
Shh, don't say that! Domain Certification in LLMs
por: Emde, Cornelius, et al.
Publicado: (2025)
por: Emde, Cornelius, et al.
Publicado: (2025)
HelpSteer2-Preference: Complementing Ratings with Preferences
por: Wang, Zhilin, et al.
Publicado: (2024)
por: Wang, Zhilin, et al.
Publicado: (2024)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
por: Yang, Jinluan, et al.
Publicado: (2025)
por: Yang, Jinluan, et al.
Publicado: (2025)
WPO: Enhancing RLHF with Weighted Preference Optimization
por: Zhou, Wenxuan, et al.
Publicado: (2024)
por: Zhou, Wenxuan, et al.
Publicado: (2024)
HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
por: Wang, Zhilin, et al.
Publicado: (2025)
por: Wang, Zhilin, et al.
Publicado: (2025)
Do as I do (Safely): Mitigating Task-Specific Fine-tuning Risks in Large Language Models
por: Eiras, Francisco, et al.
Publicado: (2024)
por: Eiras, Francisco, et al.
Publicado: (2024)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
por: Kim, Minseon, et al.
Publicado: (2025)
por: Kim, Minseon, et al.
Publicado: (2025)
Revisiting Uncertainty Estimation and Calibration of Large Language Models
por: Tao, Linwei, et al.
Publicado: (2025)
por: Tao, Linwei, et al.
Publicado: (2025)
ROPO: Robust Preference Optimization for Large Language Models
por: Liang, Xize, et al.
Publicado: (2024)
por: Liang, Xize, et al.
Publicado: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
por: He, Jiafan, et al.
Publicado: (2024)
por: He, Jiafan, et al.
Publicado: (2024)
Self-Play Preference Optimization for Language Model Alignment
por: Wu, Yue, et al.
Publicado: (2024)
por: Wu, Yue, et al.
Publicado: (2024)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
por: Lan, Michael, et al.
Publicado: (2024)
por: Lan, Michael, et al.
Publicado: (2024)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
por: Rafailov, Rafael, et al.
Publicado: (2023)
por: Rafailov, Rafael, et al.
Publicado: (2023)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2023)
por: Zhao, Siyan, et al.
Publicado: (2023)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
por: Feng, Zhili, et al.
Publicado: (2025)
por: Feng, Zhili, et al.
Publicado: (2025)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
por: Rosset, Corby, et al.
Publicado: (2024)
por: Rosset, Corby, et al.
Publicado: (2024)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
Mitigating Hallucinated Translations in Large Language Models with Hallucination-focused Preference Optimization
por: Tang, Zilu, et al.
Publicado: (2025)
por: Tang, Zilu, et al.
Publicado: (2025)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
por: Singh, Joykirat, et al.
Publicado: (2025)
por: Singh, Joykirat, et al.
Publicado: (2025)
Active Preference Learning for Large Language Models
por: Muldrew, William, et al.
Publicado: (2024)
por: Muldrew, William, et al.
Publicado: (2024)
Fine-tuning can Help Detect Pretraining Data from Large Language Models
por: Zhang, Hengxiang, et al.
Publicado: (2024)
por: Zhang, Hengxiang, et al.
Publicado: (2024)
Course-Correction: Safety Alignment Using Synthetic Preferences
por: Xu, Rongwu, et al.
Publicado: (2024)
por: Xu, Rongwu, et al.
Publicado: (2024)
On the Role of Preference Variance in Preference Optimization
por: Guo, Jiacheng, et al.
Publicado: (2025)
por: Guo, Jiacheng, et al.
Publicado: (2025)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
por: Lee, Gihun, et al.
Publicado: (2024)
por: Lee, Gihun, et al.
Publicado: (2024)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
por: Gupta, Taneesh, et al.
Publicado: (2025)
por: Gupta, Taneesh, et al.
Publicado: (2025)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
por: Zhang, Yifan, et al.
Publicado: (2024)
por: Zhang, Yifan, et al.
Publicado: (2024)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
por: Li, Junsong, et al.
Publicado: (2025)
por: Li, Junsong, et al.
Publicado: (2025)
SFTMix: Elevating Language Model Instruction Tuning with Mixup Recipe
por: Xiao, Yuxin, et al.
Publicado: (2024)
por: Xiao, Yuxin, et al.
Publicado: (2024)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
por: Zou, Minghui, et al.
Publicado: (2024)
por: Zou, Minghui, et al.
Publicado: (2024)
BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language Models
por: Lin, Feng, et al.
Publicado: (2024)
por: Lin, Feng, et al.
Publicado: (2024)
Ejemplares similares
-
Universal In-Context Approximation By Prompting Fully Recurrent Models
por: Petrov, Aleksandar, et al.
Publicado: (2024) -
Model Merging and Safety Alignment: One Bad Model Spoils the Bunch
por: Hammoud, Hasan Abed Al Kader, et al.
Publicado: (2024) -
No Culture Left Behind: ArtELingo-28, a Benchmark of WikiArt with Captions in 28 Languages
por: Mohamed, Youssef, et al.
Publicado: (2024) -
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
por: Alssum, Lama, et al.
Publicado: (2025) -
Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation
por: Zhang, Wenxuan, et al.
Publicado: (2024)