The Unintended Trade-off of AI Alignment:Balancing Hallucination Mitigation and Safety in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mahmoud, Omar, Khalil, Ali, Semage, Buddhika Laknath, Karimpanal, Thommen George, Rana, Santu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Multilingual Language Models by Aligning Representations through Steering
par: Mahmoud, Omar, et autres
Publié: (2025)
par: Mahmoud, Omar, et autres
Publié: (2025)
Human-Aligned Skill Discovery: Balancing Behaviour Exploration and Alignment
par: Hussonnois, Maxence, et autres
Publié: (2025)
par: Hussonnois, Maxence, et autres
Publié: (2025)
ECoDe: A Sample-Efficient Method for Co-Design of Robotic Agents
par: Nagiredla, Kishan R., et autres
Publié: (2023)
par: Nagiredla, Kishan R., et autres
Publié: (2023)
Dynamic Policy Fusion for User Alignment Without Re-Interaction
par: Palattuparambil, Ajsal Shereef, et autres
Publié: (2024)
par: Palattuparambil, Ajsal Shereef, et autres
Publié: (2024)
Leveraging Human Feedback for Semantically-Relevant Skill Discovery
par: Hussonnois, Maxence, et autres
Publié: (2026)
par: Hussonnois, Maxence, et autres
Publié: (2026)
ASPECT:Analogical Semantic Policy Execution via Language Conditioned Transfer
par: Palattuparambil, Ajsal Shereef, et autres
Publié: (2026)
par: Palattuparambil, Ajsal Shereef, et autres
Publié: (2026)
MAGIK: Mapping to Analogous Goals via Imagination-enabled Knowledge Transfer
par: Palattuparambil, Ajsal Shereef, et autres
Publié: (2025)
par: Palattuparambil, Ajsal Shereef, et autres
Publié: (2025)
Alpaca against Vicuna: Using LLMs to Uncover Memorization of LLMs
par: Kassem, Aly M., et autres
Publié: (2024)
par: Kassem, Aly M., et autres
Publié: (2024)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
par: Wang, Yanbo, et autres
Publié: (2026)
par: Wang, Yanbo, et autres
Publié: (2026)
Mitigating Unintended Memorization with LoRA in Federated Learning for LLMs
par: Bossy, Thierry, et autres
Publié: (2025)
par: Bossy, Thierry, et autres
Publié: (2025)
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
par: Zhang, Xiaoying, et autres
Publié: (2024)
par: Zhang, Xiaoying, et autres
Publié: (2024)
GRU: Mitigating the Trade-off between Unlearning and Retention for LLMs
par: Wang, Yue, et autres
Publié: (2025)
par: Wang, Yue, et autres
Publié: (2025)
Unintended Impacts of LLM Alignment on Global Representation
par: Ryan, Michael J., et autres
Publié: (2024)
par: Ryan, Michael J., et autres
Publié: (2024)
ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs
par: Simhi, Adi, et autres
Publié: (2025)
par: Simhi, Adi, et autres
Publié: (2025)
Causal ATE Mitigates Unintended Bias in Controlled Text Generation
par: Madhavan, Rahul, et autres
Publié: (2023)
par: Madhavan, Rahul, et autres
Publié: (2023)
Med-HEAL: Analyzing and Mitigating Hallucinations in Medical LLMs with Hallucination-Aware In-Context Learning
par: Liao, Yiming, et autres
Publié: (2026)
par: Liao, Yiming, et autres
Publié: (2026)
Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
A Concise Review of Hallucinations in LLMs and their Mitigation
par: Pulkundwar, Parth, et autres
Publié: (2025)
par: Pulkundwar, Parth, et autres
Publié: (2025)
On-Policy Self-Alignment with Fine-grained Knowledge Feedback for Hallucination Mitigation
par: Wen, Xueru, et autres
Publié: (2024)
par: Wen, Xueru, et autres
Publié: (2024)
Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
par: Chang, Kai-Po, et autres
Publié: (2025)
par: Chang, Kai-Po, et autres
Publié: (2025)
Rowen: Adaptive Retrieval-Augmented Generation for Hallucination Mitigation in LLMs
par: Ding, Hanxing, et autres
Publié: (2024)
par: Ding, Hanxing, et autres
Publié: (2024)
Balancing Safety and Helpfulness in Healthcare AI Assistants through Iterative Preference Alignment
par: Nghiem, Huy, et autres
Publié: (2025)
par: Nghiem, Huy, et autres
Publié: (2025)
On the Interplay of Human-AI Alignment,Fairness, and Performance Trade-offs in Medical Imaging
par: Luo, Haozhe, et autres
Publié: (2025)
par: Luo, Haozhe, et autres
Publié: (2025)
Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation
par: Hahm, Dongyoon, et autres
Publié: (2025)
par: Hahm, Dongyoon, et autres
Publié: (2025)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
par: Pan, Birong, et autres
Publié: (2025)
par: Pan, Birong, et autres
Publié: (2025)
When Personalization Misleads: Understanding and Mitigating Hallucinations in Personalized LLMs
par: Sun, Zhongxiang, et autres
Publié: (2026)
par: Sun, Zhongxiang, et autres
Publié: (2026)
Mitigating Hallucinations in Healthcare LLMs with Granular Fact-Checking and Domain-Specific Adaptation
par: Zeba, Musarrat, et autres
Publié: (2025)
par: Zeba, Musarrat, et autres
Publié: (2025)
Learning to Trust Your Feelings: Leveraging Self-awareness in LLMs for Hallucination Mitigation
par: Liang, Yuxin, et autres
Publié: (2024)
par: Liang, Yuxin, et autres
Publié: (2024)
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
par: Lou, Xinyue, et autres
Publié: (2025)
par: Lou, Xinyue, et autres
Publié: (2025)
FVA-RAG: Falsification-Verification Alignment for Mitigating Sycophantic Hallucinations
par: Ravishankara, Mayank
Publié: (2025)
par: Ravishankara, Mayank
Publié: (2025)
Mitigating Hallucination on Hallucination in RAG via Ensemble Voting
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations
par: Tomani, Christian, et autres
Publié: (2024)
par: Tomani, Christian, et autres
Publié: (2024)
Hallucination Detection and Hallucination Mitigation: An Investigation
par: Luo, Junliang, et autres
Publié: (2024)
par: Luo, Junliang, et autres
Publié: (2024)
Unintended Harms of Value-Aligned LLMs: Psychological and Empirical Insights
par: Choi, Sooyung, et autres
Publié: (2025)
par: Choi, Sooyung, et autres
Publié: (2025)
Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
DRAG: Distilling RAG for SLMs from LLMs to Transfer Knowledge and Mitigate Hallucination via Evidence and Graph-based Distillation
par: Chen, Jennifer, et autres
Publié: (2025)
par: Chen, Jennifer, et autres
Publié: (2025)
Pun Unintended: LLMs and the Illusion of Humor Understanding
par: Zangari, Alessandro, et autres
Publié: (2025)
par: Zangari, Alessandro, et autres
Publié: (2025)
FinTradeBench: A Financial Reasoning Benchmark for LLMs
par: Agrawal, Yogesh, et autres
Publié: (2026)
par: Agrawal, Yogesh, et autres
Publié: (2026)
Diagnosing the Performance Trade-off in Moral Alignment: A Case Study on Gender Stereotypes
par: Liu, Guangliang, et autres
Publié: (2025)
par: Liu, Guangliang, et autres
Publié: (2025)
Assessing Socio-Cultural Alignment and Technical Safety of Sovereign LLMs
par: Chae, Kyubyung, et autres
Publié: (2025)
par: Chae, Kyubyung, et autres
Publié: (2025)
Documents similaires
-
Improving Multilingual Language Models by Aligning Representations through Steering
par: Mahmoud, Omar, et autres
Publié: (2025) -
Human-Aligned Skill Discovery: Balancing Behaviour Exploration and Alignment
par: Hussonnois, Maxence, et autres
Publié: (2025) -
ECoDe: A Sample-Efficient Method for Co-Design of Robotic Agents
par: Nagiredla, Kishan R., et autres
Publié: (2023) -
Dynamic Policy Fusion for User Alignment Without Re-Interaction
par: Palattuparambil, Ajsal Shereef, et autres
Publié: (2024) -
Leveraging Human Feedback for Semantically-Relevant Skill Discovery
par: Hussonnois, Maxence, et autres
Publié: (2026)