Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Ang, Mo, Yichuan, Li, Mingjie, Wang, Yifei, Wang, Yisen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
di: Wei, Zeming, et al.
Pubblicazione: (2023)
di: Wei, Zeming, et al.
Pubblicazione: (2023)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
PID: Prompt-Independent Data Protection Against Latent Diffusion Models
di: Li, Ang, et al.
Pubblicazione: (2024)
di: Li, Ang, et al.
Pubblicazione: (2024)
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
di: Li, Mingjie, et al.
Pubblicazione: (2026)
di: Li, Mingjie, et al.
Pubblicazione: (2026)
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
di: Mo, Yichuan, et al.
Pubblicazione: (2026)
di: Mo, Yichuan, et al.
Pubblicazione: (2026)
TERD: A Unified Framework for Safeguarding Diffusion Models Against Backdoors
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
di: Chen, Taiye, et al.
Pubblicazione: (2025)
di: Chen, Taiye, et al.
Pubblicazione: (2025)
Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training
di: Wang, Yisen, et al.
Pubblicazione: (2025)
di: Wang, Yisen, et al.
Pubblicazione: (2025)
Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts
di: Chen, Hongyu, et al.
Pubblicazione: (2025)
di: Chen, Hongyu, et al.
Pubblicazione: (2025)
STAR-1: Safer Alignment of Reasoning LLMs with 1K Data
di: Wang, Zijun, et al.
Pubblicazione: (2025)
di: Wang, Zijun, et al.
Pubblicazione: (2025)
Using LLMs for Automated Privacy Policy Analysis: Prompt Engineering, Fine-Tuning and Explainability
di: Chen, Yuxin, et al.
Pubblicazione: (2025)
di: Chen, Yuxin, et al.
Pubblicazione: (2025)
Preventing Catastrophic Forgetting: Behavior-Aware Sampling for Safer Language Model Fine-Tuning
di: Pham, Anh, et al.
Pubblicazione: (2025)
di: Pham, Anh, et al.
Pubblicazione: (2025)
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
di: Thomas, Rohan Subramanian, et al.
Pubblicazione: (2026)
di: Thomas, Rohan Subramanian, et al.
Pubblicazione: (2026)
Safety-Aware Fine-Tuning of Large Language Models
di: Choi, Hyeong Kyu, et al.
Pubblicazione: (2024)
di: Choi, Hyeong Kyu, et al.
Pubblicazione: (2024)
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
di: Li, Wu, et al.
Pubblicazione: (2026)
di: Li, Wu, et al.
Pubblicazione: (2026)
When More is Less: Understanding Chain-of-Thought Length in LLMs
di: Wu, Yuyang, et al.
Pubblicazione: (2025)
di: Wu, Yuyang, et al.
Pubblicazione: (2025)
G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning
di: Guo, Xiaojun, et al.
Pubblicazione: (2025)
di: Guo, Xiaojun, et al.
Pubblicazione: (2025)
RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models
di: An, Bang, et al.
Pubblicazione: (2025)
di: An, Bang, et al.
Pubblicazione: (2025)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
di: Chen, Pin-Yu, et al.
Pubblicazione: (2025)
di: Chen, Pin-Yu, et al.
Pubblicazione: (2025)
DynMoLE: Boosting Mixture of LoRA Experts Fine-Tuning with a Hybrid Routing Mechanism
di: Li, Dengchun, et al.
Pubblicazione: (2025)
di: Li, Dengchun, et al.
Pubblicazione: (2025)
PAFT: Prompt-Agnostic Fine-Tuning
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
Rethinking Invariance in In-context Learning
di: Fang, Lizhe, et al.
Pubblicazione: (2025)
di: Fang, Lizhe, et al.
Pubblicazione: (2025)
Prior Prompt Engineering for Reinforcement Fine-Tuning
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2025)
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2025)
Explore the Reasoning Capability of LLMs in the Chess Testbed
di: Wang, Shu, et al.
Pubblicazione: (2024)
di: Wang, Shu, et al.
Pubblicazione: (2024)
InvThink: Premortem Reasoning for Safer Language Models
di: Kim, Yubin, et al.
Pubblicazione: (2025)
di: Kim, Yubin, et al.
Pubblicazione: (2025)
Informed Routing in LLMs: Smarter Token-Level Computation for Faster Inference
di: Han, Chao, et al.
Pubblicazione: (2025)
di: Han, Chao, et al.
Pubblicazione: (2025)
Deconfounded Causality-aware Parameter-Efficient Fine-Tuning for Problem-Solving Improvement of LLMs
di: Wang, Ruoyu, et al.
Pubblicazione: (2024)
di: Wang, Ruoyu, et al.
Pubblicazione: (2024)
Prompting and Fine-Tuning of Small LLMs for Length-Controllable Telephone Call Summarization
di: Thulke, David, et al.
Pubblicazione: (2024)
di: Thulke, David, et al.
Pubblicazione: (2024)
TsqLoRA: Towards Sensitivity and Quality Low-Rank Adaptation for Efficient Fine-Tuning
di: Chen, Yu, et al.
Pubblicazione: (2025)
di: Chen, Yu, et al.
Pubblicazione: (2025)
MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs
di: Lu, Zimu, et al.
Pubblicazione: (2024)
di: Lu, Zimu, et al.
Pubblicazione: (2024)
Parameter-Efficient Fine-Tuning for Medical Text Summarization: A Comparative Study of Lora, Prompt Tuning, and Full Fine-Tuning
di: Shernazarov, Ulugbek, et al.
Pubblicazione: (2026)
di: Shernazarov, Ulugbek, et al.
Pubblicazione: (2026)
RankAdaptor: Hierarchical Rank Allocation for Efficient Fine-Tuning Pruned LLMs via Performance Model
di: Zhou, Changhai, et al.
Pubblicazione: (2024)
di: Zhou, Changhai, et al.
Pubblicazione: (2024)
Selective Prompting Tuning for Personalized Conversations with LLMs
di: Huang, Qiushi, et al.
Pubblicazione: (2024)
di: Huang, Qiushi, et al.
Pubblicazione: (2024)
60 Data Points are Sufficient to Fine-Tune LLMs for Question-Answering
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach
di: Cheng, Xiang, et al.
Pubblicazione: (2025)
di: Cheng, Xiang, et al.
Pubblicazione: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
On the Adversarial Transferability of Generalized "Skip Connections"
di: Wang, Yisen, et al.
Pubblicazione: (2024)
di: Wang, Yisen, et al.
Pubblicazione: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
di: Giordani, Jeremiah
Pubblicazione: (2025)
di: Giordani, Jeremiah
Pubblicazione: (2025)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
di: Pan, Birong, et al.
Pubblicazione: (2025)
di: Pan, Birong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
di: Wei, Zeming, et al.
Pubblicazione: (2023) -
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
di: Mo, Yichuan, et al.
Pubblicazione: (2024) -
PID: Prompt-Independent Data Protection Against Latent Diffusion Models
di: Li, Ang, et al.
Pubblicazione: (2024) -
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
di: Li, Mingjie, et al.
Pubblicazione: (2026) -
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
di: Mo, Yichuan, et al.
Pubblicazione: (2026)