Token-level Data Selection for Safe LLM Fine-tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yanping, Liu, Zhening, Li, Zijian, Lin, Zehong, Zhang, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RemedyGS: Defend 3D Gaussian Splatting against Computation Cost Attacks
di: Li, Yanping, et al.
Pubblicazione: (2025)
di: Li, Yanping, et al.
Pubblicazione: (2025)
Window-based Membership Inference Attacks Against Fine-tuned Large Language Models
di: Chen, Yuetian, et al.
Pubblicazione: (2026)
di: Chen, Yuetian, et al.
Pubblicazione: (2026)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
di: Ran, Delong, et al.
Pubblicazione: (2025)
di: Ran, Delong, et al.
Pubblicazione: (2025)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
di: Lu, Guoxin, et al.
Pubblicazione: (2026)
di: Lu, Guoxin, et al.
Pubblicazione: (2026)
SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
di: Lee, Hong kyu, et al.
Pubblicazione: (2025)
di: Lee, Hong kyu, et al.
Pubblicazione: (2025)
SentinelLMs: Encrypted Input Adaptation and Fine-tuning of Language Models for Private and Secure Inference
di: Mishra, Abhijit, et al.
Pubblicazione: (2023)
di: Mishra, Abhijit, et al.
Pubblicazione: (2023)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
di: Li, Tianhao, et al.
Pubblicazione: (2024)
di: Li, Tianhao, et al.
Pubblicazione: (2024)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
A Study of Backdoors in Instruction Fine-tuned Language Models
di: Raghuram, Jayaram, et al.
Pubblicazione: (2024)
di: Raghuram, Jayaram, et al.
Pubblicazione: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding
di: Qiu, Huming, et al.
Pubblicazione: (2024)
di: Qiu, Huming, et al.
Pubblicazione: (2024)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
LoopLLM: Transferable Energy-Latency Attacks in LLMs via Repetitive Generation
di: Li, Xingyu, et al.
Pubblicazione: (2025)
di: Li, Xingyu, et al.
Pubblicazione: (2025)
IPIGuard: A Novel Tool Dependency Graph-Based Defense Against Indirect Prompt Injection in LLM Agents
di: An, Hengyu, et al.
Pubblicazione: (2025)
di: An, Hengyu, et al.
Pubblicazione: (2025)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning
di: Zhou, Kaiwen, et al.
Pubblicazione: (2025)
di: Zhou, Kaiwen, et al.
Pubblicazione: (2025)
GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents
di: Li, Xueyi, et al.
Pubblicazione: (2026)
di: Li, Xueyi, et al.
Pubblicazione: (2026)
When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems
di: Xu, Naen, et al.
Pubblicazione: (2026)
di: Xu, Naen, et al.
Pubblicazione: (2026)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
di: Mu, Junjie, et al.
Pubblicazione: (2025)
di: Mu, Junjie, et al.
Pubblicazione: (2025)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
Token-wise Influential Training Data Retrieval for Large Language Models
di: Lin, Huawei, et al.
Pubblicazione: (2024)
di: Lin, Huawei, et al.
Pubblicazione: (2024)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
di: Ouyang, Yang, et al.
Pubblicazione: (2025)
di: Ouyang, Yang, et al.
Pubblicazione: (2025)
ObfuscaTune: Obfuscated Offsite Fine-tuning and Inference of Proprietary LLMs on Private Datasets
di: Frikha, Ahmed, et al.
Pubblicazione: (2024)
di: Frikha, Ahmed, et al.
Pubblicazione: (2024)
Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning Paradigm
di: Kim, Jaehan, et al.
Pubblicazione: (2024)
di: Kim, Jaehan, et al.
Pubblicazione: (2024)
LLM for Barcodes: Generating Diverse Synthetic Data for Identity Documents
di: Patel, Hitesh Laxmichand, et al.
Pubblicazione: (2024)
di: Patel, Hitesh Laxmichand, et al.
Pubblicazione: (2024)
Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage
di: Hoque, Shahinul, et al.
Pubblicazione: (2026)
di: Hoque, Shahinul, et al.
Pubblicazione: (2026)
Universal and Context-Independent Triggers for Precise Control of LLM Outputs
di: Liang, Jiashuo, et al.
Pubblicazione: (2024)
di: Liang, Jiashuo, et al.
Pubblicazione: (2024)
LLM Jailbreak Detection for (Almost) Free!
di: Chen, Guorui, et al.
Pubblicazione: (2025)
di: Chen, Guorui, et al.
Pubblicazione: (2025)
Large Language Model Sentinel: LLM Agent for Adversarial Purification
di: Lin, Guang, et al.
Pubblicazione: (2024)
di: Lin, Guang, et al.
Pubblicazione: (2024)
Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization
di: Liu, Tiantian, et al.
Pubblicazione: (2024)
di: Liu, Tiantian, et al.
Pubblicazione: (2024)
OneShield -- the Next Generation of LLM Guardrails
di: DeLuca, Chad, et al.
Pubblicazione: (2025)
di: DeLuca, Chad, et al.
Pubblicazione: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)
Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs
di: Kim, Jinhwa, et al.
Pubblicazione: (2025)
di: Kim, Jinhwa, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RemedyGS: Defend 3D Gaussian Splatting against Computation Cost Attacks
di: Li, Yanping, et al.
Pubblicazione: (2025) -
Window-based Membership Inference Attacks Against Fine-tuned Large Language Models
di: Chen, Yuetian, et al.
Pubblicazione: (2026) -
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
di: Zhang, Junbo, et al.
Pubblicazione: (2026) -
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
di: Ran, Delong, et al.
Pubblicazione: (2025) -
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)