Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Ang, Mo, Yichuan, Li, Mingjie, Wang, Yifei, Wang, Yisen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
por: Wei, Zeming, et al.
Publicado: (2023)
por: Wei, Zeming, et al.
Publicado: (2023)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
por: Mo, Yichuan, et al.
Publicado: (2024)
por: Mo, Yichuan, et al.
Publicado: (2024)
PID: Prompt-Independent Data Protection Against Latent Diffusion Models
por: Li, Ang, et al.
Publicado: (2024)
por: Li, Ang, et al.
Publicado: (2024)
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
por: Li, Mingjie, et al.
Publicado: (2026)
por: Li, Mingjie, et al.
Publicado: (2026)
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
por: Mo, Yichuan, et al.
Publicado: (2026)
por: Mo, Yichuan, et al.
Publicado: (2026)
TERD: A Unified Framework for Safeguarding Diffusion Models Against Backdoors
por: Mo, Yichuan, et al.
Publicado: (2024)
por: Mo, Yichuan, et al.
Publicado: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training
por: Wang, Yisen, et al.
Publicado: (2025)
por: Wang, Yisen, et al.
Publicado: (2025)
Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts
por: Chen, Hongyu, et al.
Publicado: (2025)
por: Chen, Hongyu, et al.
Publicado: (2025)
STAR-1: Safer Alignment of Reasoning LLMs with 1K Data
por: Wang, Zijun, et al.
Publicado: (2025)
por: Wang, Zijun, et al.
Publicado: (2025)
Using LLMs for Automated Privacy Policy Analysis: Prompt Engineering, Fine-Tuning and Explainability
por: Chen, Yuxin, et al.
Publicado: (2025)
por: Chen, Yuxin, et al.
Publicado: (2025)
Preventing Catastrophic Forgetting: Behavior-Aware Sampling for Safer Language Model Fine-Tuning
por: Pham, Anh, et al.
Publicado: (2025)
por: Pham, Anh, et al.
Publicado: (2025)
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
por: Thomas, Rohan Subramanian, et al.
Publicado: (2026)
por: Thomas, Rohan Subramanian, et al.
Publicado: (2026)
Safety-Aware Fine-Tuning of Large Language Models
por: Choi, Hyeong Kyu, et al.
Publicado: (2024)
por: Choi, Hyeong Kyu, et al.
Publicado: (2024)
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
por: Li, Wu, et al.
Publicado: (2026)
por: Li, Wu, et al.
Publicado: (2026)
When More is Less: Understanding Chain-of-Thought Length in LLMs
por: Wu, Yuyang, et al.
Publicado: (2025)
por: Wu, Yuyang, et al.
Publicado: (2025)
G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning
por: Guo, Xiaojun, et al.
Publicado: (2025)
por: Guo, Xiaojun, et al.
Publicado: (2025)
RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models
por: An, Bang, et al.
Publicado: (2025)
por: An, Bang, et al.
Publicado: (2025)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
por: Chen, Pin-Yu, et al.
Publicado: (2025)
por: Chen, Pin-Yu, et al.
Publicado: (2025)
DynMoLE: Boosting Mixture of LoRA Experts Fine-Tuning with a Hybrid Routing Mechanism
por: Li, Dengchun, et al.
Publicado: (2025)
por: Li, Dengchun, et al.
Publicado: (2025)
PAFT: Prompt-Agnostic Fine-Tuning
por: Wei, Chenxing, et al.
Publicado: (2025)
por: Wei, Chenxing, et al.
Publicado: (2025)
Rethinking Invariance in In-context Learning
por: Fang, Lizhe, et al.
Publicado: (2025)
por: Fang, Lizhe, et al.
Publicado: (2025)
Prior Prompt Engineering for Reinforcement Fine-Tuning
por: Taveekitworachai, Pittawat, et al.
Publicado: (2025)
por: Taveekitworachai, Pittawat, et al.
Publicado: (2025)
Explore the Reasoning Capability of LLMs in the Chess Testbed
por: Wang, Shu, et al.
Publicado: (2024)
por: Wang, Shu, et al.
Publicado: (2024)
InvThink: Premortem Reasoning for Safer Language Models
por: Kim, Yubin, et al.
Publicado: (2025)
por: Kim, Yubin, et al.
Publicado: (2025)
Informed Routing in LLMs: Smarter Token-Level Computation for Faster Inference
por: Han, Chao, et al.
Publicado: (2025)
por: Han, Chao, et al.
Publicado: (2025)
Deconfounded Causality-aware Parameter-Efficient Fine-Tuning for Problem-Solving Improvement of LLMs
por: Wang, Ruoyu, et al.
Publicado: (2024)
por: Wang, Ruoyu, et al.
Publicado: (2024)
Prompting and Fine-Tuning of Small LLMs for Length-Controllable Telephone Call Summarization
por: Thulke, David, et al.
Publicado: (2024)
por: Thulke, David, et al.
Publicado: (2024)
TsqLoRA: Towards Sensitivity and Quality Low-Rank Adaptation for Efficient Fine-Tuning
por: Chen, Yu, et al.
Publicado: (2025)
por: Chen, Yu, et al.
Publicado: (2025)
MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs
por: Lu, Zimu, et al.
Publicado: (2024)
por: Lu, Zimu, et al.
Publicado: (2024)
Parameter-Efficient Fine-Tuning for Medical Text Summarization: A Comparative Study of Lora, Prompt Tuning, and Full Fine-Tuning
por: Shernazarov, Ulugbek, et al.
Publicado: (2026)
por: Shernazarov, Ulugbek, et al.
Publicado: (2026)
RankAdaptor: Hierarchical Rank Allocation for Efficient Fine-Tuning Pruned LLMs via Performance Model
por: Zhou, Changhai, et al.
Publicado: (2024)
por: Zhou, Changhai, et al.
Publicado: (2024)
Selective Prompting Tuning for Personalized Conversations with LLMs
por: Huang, Qiushi, et al.
Publicado: (2024)
por: Huang, Qiushi, et al.
Publicado: (2024)
60 Data Points are Sufficient to Fine-Tune LLMs for Question-Answering
por: Ye, Junjie, et al.
Publicado: (2024)
por: Ye, Junjie, et al.
Publicado: (2024)
LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach
por: Cheng, Xiang, et al.
Publicado: (2025)
por: Cheng, Xiang, et al.
Publicado: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
por: Wang, Yanbo, et al.
Publicado: (2026)
por: Wang, Yanbo, et al.
Publicado: (2026)
On the Adversarial Transferability of Generalized "Skip Connections"
por: Wang, Yisen, et al.
Publicado: (2024)
por: Wang, Yisen, et al.
Publicado: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
por: Sun, Haoyuan, et al.
Publicado: (2025)
por: Sun, Haoyuan, et al.
Publicado: (2025)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
por: Giordani, Jeremiah
Publicado: (2025)
por: Giordani, Jeremiah
Publicado: (2025)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
por: Pan, Birong, et al.
Publicado: (2025)
por: Pan, Birong, et al.
Publicado: (2025)
Ejemplares similares
-
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
por: Wei, Zeming, et al.
Publicado: (2023) -
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
por: Mo, Yichuan, et al.
Publicado: (2024) -
PID: Prompt-Independent Data Protection Against Latent Diffusion Models
por: Li, Ang, et al.
Publicado: (2024) -
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
por: Li, Mingjie, et al.
Publicado: (2026) -
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
por: Mo, Yichuan, et al.
Publicado: (2026)