Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Si, Wai Man, Li, Mingjie, Backes, Michael, Zhang, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Excessive Reasoning Attack on Reasoning LLMs
di: Si, Wai Man, et al.
Pubblicazione: (2025)
di: Si, Wai Man, et al.
Pubblicazione: (2025)
A Systematic Study of Training-Free Methods for Trustworthy Large Language Models
di: Si, Wai Man, et al.
Pubblicazione: (2026)
di: Si, Wai Man, et al.
Pubblicazione: (2026)
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
di: Li, Mingjie, et al.
Pubblicazione: (2026)
di: Li, Mingjie, et al.
Pubblicazione: (2026)
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
SaLoRA: Safety-Alignment Preserved Low-Rank Adaptation
di: Li, Mingjie, et al.
Pubblicazione: (2025)
di: Li, Mingjie, et al.
Pubblicazione: (2025)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
ICLGuard: Controlling In-Context Learning Behavior for Applicability Authorization
di: Si, Wai Man, et al.
Pubblicazione: (2024)
di: Si, Wai Man, et al.
Pubblicazione: (2024)
On Pruning State-Space LLMs
di: Ghattas, Tamer, et al.
Pubblicazione: (2025)
di: Ghattas, Tamer, et al.
Pubblicazione: (2025)
On Importance of Pruning and Distillation for Efficient Low Resource NLP
di: Mirashi, Aishwarya, et al.
Pubblicazione: (2024)
di: Mirashi, Aishwarya, et al.
Pubblicazione: (2024)
Mixture Compressor for Mixture-of-Experts LLMs Gains More
di: Huang, Wei, et al.
Pubblicazione: (2024)
di: Huang, Wei, et al.
Pubblicazione: (2024)
Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMs
di: Fu, Yao, et al.
Pubblicazione: (2025)
di: Fu, Yao, et al.
Pubblicazione: (2025)
DenoiseRotator: Enhance Pruning Robustness for LLMs via Importance Concentration
di: Gu, Tianteng, et al.
Pubblicazione: (2025)
di: Gu, Tianteng, et al.
Pubblicazione: (2025)
Random Masking Finds Winning Tickets for Parameter Efficient Fine-tuning
di: Xu, Jing, et al.
Pubblicazione: (2024)
di: Xu, Jing, et al.
Pubblicazione: (2024)
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
di: Mo, Yichuan, et al.
Pubblicazione: (2026)
di: Mo, Yichuan, et al.
Pubblicazione: (2026)
Towards Safer Pretraining: Analyzing and Filtering Harmful Content in Webscale datasets for Responsible LLMs
di: Mendu, Sai Krishna, et al.
Pubblicazione: (2025)
di: Mendu, Sai Krishna, et al.
Pubblicazione: (2025)
Evaluating Defences against Unsafe Feedback in RLHF
di: Rosati, Domenic, et al.
Pubblicazione: (2024)
di: Rosati, Domenic, et al.
Pubblicazione: (2024)
Early Transformers: A study on Efficient Training of Transformer Models through Early-Bird Lottery Tickets
di: Cheekati, Shravan
Pubblicazione: (2024)
di: Cheekati, Shravan
Pubblicazione: (2024)
Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes
di: Kolawole, Steven, et al.
Pubblicazione: (2024)
di: Kolawole, Steven, et al.
Pubblicazione: (2024)
Learning and Forgetting Unsafe Examples in Large Language Models
di: Zhao, Jiachen, et al.
Pubblicazione: (2023)
di: Zhao, Jiachen, et al.
Pubblicazione: (2023)
Pruning Strategies for Backdoor Defense in LLMs
di: Chapagain, Santosh, et al.
Pubblicazione: (2025)
di: Chapagain, Santosh, et al.
Pubblicazione: (2025)
A Simple and Effective Pruning Approach for Large Language Models
di: Sun, Mingjie, et al.
Pubblicazione: (2023)
di: Sun, Mingjie, et al.
Pubblicazione: (2023)
Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
di: Le, Qi, et al.
Pubblicazione: (2025)
di: Le, Qi, et al.
Pubblicazione: (2025)
2SSP: A Two-Stage Framework for Structured Pruning of LLMs
di: Sandri, Fabrizio, et al.
Pubblicazione: (2025)
di: Sandri, Fabrizio, et al.
Pubblicazione: (2025)
Safer Policy Compliance with Dynamic Epistemic Fallback
di: Imperial, Joseph Marvin, et al.
Pubblicazione: (2026)
di: Imperial, Joseph Marvin, et al.
Pubblicazione: (2026)
Cram Less to Fit More: Training Data Pruning Improves Memorization of Facts
di: Ye, Jiayuan, et al.
Pubblicazione: (2026)
di: Ye, Jiayuan, et al.
Pubblicazione: (2026)
EfficientXpert: Efficient Domain Adaptation for Large Language Models via Propagation-Aware Pruning
di: Zhao, Songlin, et al.
Pubblicazione: (2025)
di: Zhao, Songlin, et al.
Pubblicazione: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
Towards Robust and Parameter-Efficient Knowledge Unlearning for LLMs
di: Cha, Sungmin, et al.
Pubblicazione: (2024)
di: Cha, Sungmin, et al.
Pubblicazione: (2024)
FaultProfIT: Hierarchical Fault Profiling of Incident Tickets in Large-scale Cloud Systems
di: Huang, Junjie, et al.
Pubblicazione: (2024)
di: Huang, Junjie, et al.
Pubblicazione: (2024)
LLMGuard: Guarding Against Unsafe LLM Behavior
di: Goyal, Shubh, et al.
Pubblicazione: (2024)
di: Goyal, Shubh, et al.
Pubblicazione: (2024)
Beyond Size: How Gradients Shape Pruning Decisions in Large Language Models
di: Das, Rocktim Jyoti, et al.
Pubblicazione: (2023)
di: Das, Rocktim Jyoti, et al.
Pubblicazione: (2023)
Two-stage LLM Fine-tuning with Less Specialization and More Generalization
di: Wang, Yihan, et al.
Pubblicazione: (2022)
di: Wang, Yihan, et al.
Pubblicazione: (2022)
ROSE: Reordered SparseGPT for More Accurate One-Shot Large Language Models Pruning
di: Su, Mingluo, et al.
Pubblicazione: (2026)
di: Su, Mingluo, et al.
Pubblicazione: (2026)
Adaptive LoRA Merge with Parameter Pruning for Low-Resource Generation
di: Miyano, Ryota, et al.
Pubblicazione: (2025)
di: Miyano, Ryota, et al.
Pubblicazione: (2025)
On Importance of Layer Pruning for Smaller BERT Models and Low Resource Languages
di: Shirke, Mayur, et al.
Pubblicazione: (2025)
di: Shirke, Mayur, et al.
Pubblicazione: (2025)
MoreauPruner: Robust Pruning of Large Language Models against Weight Perturbations
di: Wang, Zixiao, et al.
Pubblicazione: (2024)
di: Wang, Zixiao, et al.
Pubblicazione: (2024)
KS-Lottery: Finding Certified Lottery Tickets for Multilingual Language Models
di: Yuan, Fei, et al.
Pubblicazione: (2024)
di: Yuan, Fei, et al.
Pubblicazione: (2024)
Less is More: Extreme Gradient Boost Rank-1 Adaption for Efficient Finetuning of LLMs
di: Zhang, Yifei, et al.
Pubblicazione: (2024)
di: Zhang, Yifei, et al.
Pubblicazione: (2024)
Why Are Web AI Agents More Vulnerable Than Standalone LLMs? A Security Analysis
di: Chiang, Jeffrey Yang Fan, et al.
Pubblicazione: (2025)
di: Chiang, Jeffrey Yang Fan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Excessive Reasoning Attack on Reasoning LLMs
di: Si, Wai Man, et al.
Pubblicazione: (2025) -
A Systematic Study of Training-Free Methods for Trustworthy Large Language Models
di: Si, Wai Man, et al.
Pubblicazione: (2026) -
Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
di: Li, Mingjie, et al.
Pubblicazione: (2026) -
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
di: Jiang, Yukun, et al.
Pubblicazione: (2026) -
SaLoRA: Safety-Alignment Preserved Low-Rank Adaptation
di: Li, Mingjie, et al.
Pubblicazione: (2025)