Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Taraghi, Mina, Pequignot, Yann, Nikanjam, Amin, Merzouk, Mohamed Amine, Khomh, Foutse |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prism: Dynamic and Flexible Benchmarking of LLMs Code Generation with Monte Carlo Tree Search
di: Majdinasab, Vahid, et al.
Pubblicazione: (2025)
di: Majdinasab, Vahid, et al.
Pubblicazione: (2025)
DeepCodeProbe: Towards Understanding What Models Trained on Code Learn
di: Majdinasab, Vahid, et al.
Pubblicazione: (2024)
di: Majdinasab, Vahid, et al.
Pubblicazione: (2024)
ReCatcher: Towards LLMs Regression Testing for Code Generation
di: Abbassi, Altaf Allah, et al.
Pubblicazione: (2025)
di: Abbassi, Altaf Allah, et al.
Pubblicazione: (2025)
Common Challenges of Deep Reinforcement Learning Applications Development: An Empirical Study
di: Morovati, Mohammad Mehdi, et al.
Pubblicazione: (2023)
di: Morovati, Mohammad Mehdi, et al.
Pubblicazione: (2023)
TaskEval: Assessing Difficulty of Code Generation Tasks for Large Language Models
di: Tambon, Florian, et al.
Pubblicazione: (2024)
di: Tambon, Florian, et al.
Pubblicazione: (2024)
Adversarial Moral Stress Testing of Large Language Models
di: Jamshidi, Saeid, et al.
Pubblicazione: (2026)
di: Jamshidi, Saeid, et al.
Pubblicazione: (2026)
Bugs in Large Language Models Generated Code: An Empirical Study
di: Tambon, Florian, et al.
Pubblicazione: (2024)
di: Tambon, Florian, et al.
Pubblicazione: (2024)
Real Faults in Model Context Protocol (MCP) Software: a Comprehensive Taxonomy
di: Taraghi, Mina, et al.
Pubblicazione: (2026)
di: Taraghi, Mina, et al.
Pubblicazione: (2026)
Secure Tool Manifest and Digital Signing Solution for Verifiable MCP and LLM Pipelines
di: Jamshidi, Saeid, et al.
Pubblicazione: (2026)
di: Jamshidi, Saeid, et al.
Pubblicazione: (2026)
Trained Without My Consent: Detecting Code Inclusion In Language Models Trained on Code
di: Majdinasab, Vahid, et al.
Pubblicazione: (2024)
di: Majdinasab, Vahid, et al.
Pubblicazione: (2024)
Toward Debugging Deep Reinforcement Learning Programs with RLExplorer
di: Bouchoucha, Rached, et al.
Pubblicazione: (2024)
di: Bouchoucha, Rached, et al.
Pubblicazione: (2024)
An Efficient Model Maintenance Approach for MLOps
di: Majidi, Forough, et al.
Pubblicazione: (2024)
di: Majidi, Forough, et al.
Pubblicazione: (2024)
LLMs and Stack Overflow Discussions: Reliability, Impact, and Challenges
di: Da Silva, Leuson, et al.
Pubblicazione: (2024)
di: Da Silva, Leuson, et al.
Pubblicazione: (2024)
Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms
di: Le, Linh, et al.
Pubblicazione: (2026)
di: Le, Linh, et al.
Pubblicazione: (2026)
Fault Localization in Deep Learning-based Software: A System-level Approach
di: Morovati, Mohammad Mehdi, et al.
Pubblicazione: (2024)
di: Morovati, Mohammad Mehdi, et al.
Pubblicazione: (2024)
Machine Learning Robustness: A Primer
di: Braiek, Houssem Ben, et al.
Pubblicazione: (2024)
di: Braiek, Houssem Ben, et al.
Pubblicazione: (2024)
PathOCL: Path-Based Prompt Augmentation for OCL Generation with GPT-4
di: Abukhalaf, Seif, et al.
Pubblicazione: (2024)
di: Abukhalaf, Seif, et al.
Pubblicazione: (2024)
RefAgent: A Multi-agent LLM-based Framework for Automatic Software Refactoring
di: Oueslati, Khouloud, et al.
Pubblicazione: (2025)
di: Oueslati, Khouloud, et al.
Pubblicazione: (2025)
Chain of Targeted Verification Questions to Improve the Reliability of Code Generated by LLMs
di: Ngassom, Sylvain Kouemo, et al.
Pubblicazione: (2024)
di: Ngassom, Sylvain Kouemo, et al.
Pubblicazione: (2024)
Deep Learning Model Reuse in the HuggingFace Community: Challenges, Benefit and Trends
di: Taraghi, Mina, et al.
Pubblicazione: (2024)
di: Taraghi, Mina, et al.
Pubblicazione: (2024)
Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation
di: Jamshidi, Saeid, et al.
Pubblicazione: (2025)
di: Jamshidi, Saeid, et al.
Pubblicazione: (2025)
What Information Contributes to Log-based Anomaly Detection? Insights from a Configurable Transformer-Based Approach
di: Wu, Xingfang, et al.
Pubblicazione: (2024)
di: Wu, Xingfang, et al.
Pubblicazione: (2024)
From LLMs to Edge: Parameter-Efficient Fine-Tuning on Edge Devices
di: Slamanig, Georg, et al.
Pubblicazione: (2025)
di: Slamanig, Georg, et al.
Pubblicazione: (2025)
Leveraging Machine Learning Techniques in Intrusion Detection Systems for Internet of Things
di: Jamshidi, Saeid, et al.
Pubblicazione: (2025)
di: Jamshidi, Saeid, et al.
Pubblicazione: (2025)
Evaluating Machine Learning-Driven Intrusion Detection Systems in IoT: Performance and Energy Consumption
di: Jamshidi, Saeid, et al.
Pubblicazione: (2025)
di: Jamshidi, Saeid, et al.
Pubblicazione: (2025)
SDLog: A Deep Learning Framework for Detecting Sensitive Information in Software Logs
di: Aghili, Roozbeh, et al.
Pubblicazione: (2025)
di: Aghili, Roozbeh, et al.
Pubblicazione: (2025)
FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
Understanding and Preserving Safety in Fine-Tuned LLMs
di: Zhang, Jiawen, et al.
Pubblicazione: (2026)
di: Zhang, Jiawen, et al.
Pubblicazione: (2026)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
di: Kim, Jaehan, et al.
Pubblicazione: (2025)
di: Kim, Jaehan, et al.
Pubblicazione: (2025)
Parameter-Efficient Fine-Tuning With Adapters
di: Chen, Keyu, et al.
Pubblicazione: (2024)
di: Chen, Keyu, et al.
Pubblicazione: (2024)
Analysing Safety Risks in LLMs Fine-Tuned with Pseudo-Malicious Cyber Security Data
di: ElZemity, Adel, et al.
Pubblicazione: (2025)
di: ElZemity, Adel, et al.
Pubblicazione: (2025)
NaRA: Noise-Aware LoRA for Parameter-Efficient Fine-Tuning of Diffusion LLMs
di: Wang, Shuaidi, et al.
Pubblicazione: (2026)
di: Wang, Shuaidi, et al.
Pubblicazione: (2026)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
di: Giordani, Jeremiah
Pubblicazione: (2025)
di: Giordani, Jeremiah
Pubblicazione: (2025)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
di: Pan, Birong, et al.
Pubblicazione: (2025)
di: Pan, Birong, et al.
Pubblicazione: (2025)
Partial Order in Chaos: Consensus on Feature Attributions in the Rashomon Set
di: Laberge, Gabriel, et al.
Pubblicazione: (2021)
di: Laberge, Gabriel, et al.
Pubblicazione: (2021)
Diffusion-based Adversarial Purification for Intrusion Detection
di: Merzouk, Mohamed Amine, et al.
Pubblicazione: (2024)
di: Merzouk, Mohamed Amine, et al.
Pubblicazione: (2024)
Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents
di: Gulati, Idhant, et al.
Pubblicazione: (2026)
di: Gulati, Idhant, et al.
Pubblicazione: (2026)
Parameter Efficiency Is Not Memory Efficiency: Rethinking Fine-Tuning for On-Device LLM Adaptation
di: Tenison, Irene, et al.
Pubblicazione: (2026)
di: Tenison, Irene, et al.
Pubblicazione: (2026)
Securing Time in Energy IoT: A Clock-Dynamics-Aware Spatio-Temporal Graph Attention Network for Clock Drift Attacks and Y2K38 Failures
di: Jamshidi, Saeid, et al.
Pubblicazione: (2026)
di: Jamshidi, Saeid, et al.
Pubblicazione: (2026)
Imitation Game: Reproducing Deep Learning Bugs Leveraging an Intelligent Agent
di: Shah, Mehil B, et al.
Pubblicazione: (2025)
di: Shah, Mehil B, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Prism: Dynamic and Flexible Benchmarking of LLMs Code Generation with Monte Carlo Tree Search
di: Majdinasab, Vahid, et al.
Pubblicazione: (2025) -
DeepCodeProbe: Towards Understanding What Models Trained on Code Learn
di: Majdinasab, Vahid, et al.
Pubblicazione: (2024) -
ReCatcher: Towards LLMs Regression Testing for Code Generation
di: Abbassi, Altaf Allah, et al.
Pubblicazione: (2025) -
Common Challenges of Deep Reinforcement Learning Applications Development: An Empirical Study
di: Morovati, Mohammad Mehdi, et al.
Pubblicazione: (2023) -
TaskEval: Assessing Difficulty of Code Generation Tasks for Large Language Models
di: Tambon, Florian, et al.
Pubblicazione: (2024)