POROver: Improving Safety and Reducing Overrefusal in Large Language Models with Overgeneration and Preference Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Karaman, Batuhan K., Zabir, Ishmam, Benhaim, Alon, Chaudhary, Vishrav, Sabuncu, Mert R., Song, Xia |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Scaling Optimal LR Across Token Horizons
by: Bjorck, Johan, et al.
Published: (2024)
by: Bjorck, Johan, et al.
Published: (2024)
A Practical Analysis of Human Alignment with *PO
by: Ahrabian, Kian, et al.
Published: (2024)
by: Ahrabian, Kian, et al.
Published: (2024)
Scaling Laws for Multilingual Language Models
by: He, Yifei, et al.
Published: (2024)
by: He, Yifei, et al.
Published: (2024)
Assessing the significance of longitudinal data in Alzheimer's Disease forecasting
by: Karaman, Batuhan K., et al.
Published: (2024)
by: Karaman, Batuhan K., et al.
Published: (2024)
StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models
by: Khan, Ishmam, et al.
Published: (2026)
by: Khan, Ishmam, et al.
Published: (2026)
Longitudinal Mammogram Risk Prediction
by: Karaman, Batuhan K., et al.
Published: (2024)
by: Karaman, Batuhan K., et al.
Published: (2024)
FrugalPrompt: Reducing Contextual Overhead in Large Language Models via Token Attribution
by: Raiyan, Syed Rifat, et al.
Published: (2025)
by: Raiyan, Syed Rifat, et al.
Published: (2025)
Exploring Automated Keyword Mnemonics Generation with Large Language Models via Overgenerate-and-Rank
by: Lee, Jaewook, et al.
Published: (2024)
by: Lee, Jaewook, et al.
Published: (2024)
On The Adaptation of Unlimiformer for Decoder-Only Transformers
by: Ahrabian, Kian, et al.
Published: (2024)
by: Ahrabian, Kian, et al.
Published: (2024)
DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning
by: Karaman, Batuhan K., et al.
Published: (2026)
by: Karaman, Batuhan K., et al.
Published: (2026)
Large language models in healthcare and medical domain: A review
by: Nazi, Zabir Al, et al.
Published: (2023)
by: Nazi, Zabir Al, et al.
Published: (2023)
S2-Attention: Hardware-Aware Context Sharding Among Attention Heads
by: Lin, Xihui, et al.
Published: (2024)
by: Lin, Xihui, et al.
Published: (2024)
Impact of Preference Noise on the Alignment Performance of Generative Language Models
by: Gao, Yang, et al.
Published: (2024)
by: Gao, Yang, et al.
Published: (2024)
Knockout: A simple way to handle missing inputs
by: Nguyen, Minh, et al.
Published: (2024)
by: Nguyen, Minh, et al.
Published: (2024)
Preference Packing: Efficient Preference Optimization for Large Language Models
by: Cho, Jaekyung
Published: (2026)
by: Cho, Jaekyung
Published: (2026)
RLVF: Learning from Verbal Feedback without Overgeneralization
by: Stephan, Moritz, et al.
Published: (2024)
by: Stephan, Moritz, et al.
Published: (2024)
PII-VisBench: Evaluating Personally Identifiable Information Safety in Vision Language Models Along a Continuum of Visibility
by: Shahariar, G M, et al.
Published: (2026)
by: Shahariar, G M, et al.
Published: (2026)
A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia
by: Monea, Giovanni, et al.
Published: (2023)
by: Monea, Giovanni, et al.
Published: (2023)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
by: Xiang, Hao, et al.
Published: (2024)
by: Xiang, Hao, et al.
Published: (2024)
MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework
by: Qi, Yupeng, et al.
Published: (2025)
by: Qi, Yupeng, et al.
Published: (2025)
Multi-Reference Preference Optimization for Large Language Models
by: Le, Hung, et al.
Published: (2024)
by: Le, Hung, et al.
Published: (2024)
Weights-Rotated Preference Optimization for Large Language Models
by: Yang, Chenxu, et al.
Published: (2025)
by: Yang, Chenxu, et al.
Published: (2025)
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
by: Zhang, Wenxuan, et al.
Published: (2024)
by: Zhang, Wenxuan, et al.
Published: (2024)
Integrating Large Language Models and Reinforcement Learning for Non-Linear Reasoning
by: Alon, Yoav, et al.
Published: (2024)
by: Alon, Yoav, et al.
Published: (2024)
Sparse Reward Subsystem in Large Language Models
by: Xu, Guowei, et al.
Published: (2026)
by: Xu, Guowei, et al.
Published: (2026)
Compression Laws for Large Language Models
by: Sengupta, Ayan, et al.
Published: (2025)
by: Sengupta, Ayan, et al.
Published: (2025)
DORA Explorer: Improving the Exploration Ability of LLMs Without Training
by: Gurjar, Priya, et al.
Published: (2026)
by: Gurjar, Priya, et al.
Published: (2026)
Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?
by: Nazi, Zabir Al, et al.
Published: (2025)
by: Nazi, Zabir Al, et al.
Published: (2025)
Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?
by: Zhang, Yanjian, et al.
Published: (2025)
by: Zhang, Yanjian, et al.
Published: (2025)
From User Preferences to Optimization Constraints Using Large Language Models
by: Sanguinetti, Manuela, et al.
Published: (2025)
by: Sanguinetti, Manuela, et al.
Published: (2025)
ROPO: Robust Preference Optimization for Large Language Models
by: Liang, Xize, et al.
Published: (2024)
by: Liang, Xize, et al.
Published: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
by: He, Jiafan, et al.
Published: (2024)
by: He, Jiafan, et al.
Published: (2024)
Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention
by: Rozental, Alon
Published: (2026)
by: Rozental, Alon
Published: (2026)
Learning to Reduce: Towards Improving Performance of Large Language Models on Structured Data
by: Lee, Younghun, et al.
Published: (2024)
by: Lee, Younghun, et al.
Published: (2024)
A Framework for Interpretability in Machine Learning for Medical Imaging
by: Wang, Alan Q., et al.
Published: (2023)
by: Wang, Alan Q., et al.
Published: (2023)
Self-Evolutionary Large Language Models through Uncertainty-Enhanced Preference Optimization
by: Wang, Jianing, et al.
Published: (2024)
by: Wang, Jianing, et al.
Published: (2024)
Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
by: Deng, Qiyuan, et al.
Published: (2025)
by: Deng, Qiyuan, et al.
Published: (2025)
Improving Conversational Abilities of Quantized Large Language Models via Direct Preference Alignment
by: Lee, Janghwan, et al.
Published: (2024)
by: Lee, Janghwan, et al.
Published: (2024)
Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions
by: Bianchi, Federico, et al.
Published: (2023)
by: Bianchi, Federico, et al.
Published: (2023)
Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language Models
by: Mekala, Anmol, et al.
Published: (2024)
by: Mekala, Anmol, et al.
Published: (2024)
Similar Items
-
Scaling Optimal LR Across Token Horizons
by: Bjorck, Johan, et al.
Published: (2024) -
A Practical Analysis of Human Alignment with *PO
by: Ahrabian, Kian, et al.
Published: (2024) -
Scaling Laws for Multilingual Language Models
by: He, Yifei, et al.
Published: (2024) -
Assessing the significance of longitudinal data in Alzheimer's Disease forecasting
by: Karaman, Batuhan K., et al.
Published: (2024) -
StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models
by: Khan, Ishmam, et al.
Published: (2026)