Layer-Targeted Multilingual Knowledge Erasure in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Taoran, Chandrasekaran, Varun, Yu, Zhiyuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation
di: Jia, Hengrui, et al.
Pubblicazione: (2025)
di: Jia, Hengrui, et al.
Pubblicazione: (2025)
SoK: Understanding (New) Security Issues Across AI4Code Use Cases
di: Wu, Qilong, et al.
Pubblicazione: (2025)
di: Wu, Qilong, et al.
Pubblicazione: (2025)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
di: Wang, Xiangwen, et al.
Pubblicazione: (2026)
di: Wang, Xiangwen, et al.
Pubblicazione: (2026)
The Efficacy of Transfer-based No-box Attacks on Image Watermarking: A Pragmatic Analysis
di: Wu, Qilong, et al.
Pubblicazione: (2024)
di: Wu, Qilong, et al.
Pubblicazione: (2024)
MEraser: An Effective Fingerprint Erasure Approach for Large Language Models
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)
Zk-SNARK for String Match
di: Li, Taoran, et al.
Pubblicazione: (2025)
di: Li, Taoran, et al.
Pubblicazione: (2025)
Privately Aligning Language Models with Reinforcement Learning
di: Wu, Fan, et al.
Pubblicazione: (2023)
di: Wu, Fan, et al.
Pubblicazione: (2023)
AMUN: Adversarial Machine UNlearning
di: Ebrahimpour-Boroojeny, Ali, et al.
Pubblicazione: (2025)
di: Ebrahimpour-Boroojeny, Ali, et al.
Pubblicazione: (2025)
Bypassing LLM Watermarks with Color-Aware Substitutions
di: Wu, Qilong, et al.
Pubblicazione: (2024)
di: Wu, Qilong, et al.
Pubblicazione: (2024)
A Survey On Secure Machine Learning
di: Liao, Taobo, et al.
Pubblicazione: (2025)
di: Liao, Taobo, et al.
Pubblicazione: (2025)
Challenges in Enabling Private Data Valuation
di: Fu, Yiwei, et al.
Pubblicazione: (2026)
di: Fu, Yiwei, et al.
Pubblicazione: (2026)
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
di: Li, Shuai, et al.
Pubblicazione: (2023)
di: Li, Shuai, et al.
Pubblicazione: (2023)
Empirical Evaluation of Memory-Erasure Protocols
di: Gil-Pons, Reynaldo, et al.
Pubblicazione: (2025)
di: Gil-Pons, Reynaldo, et al.
Pubblicazione: (2025)
Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
di: Xu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Xu, Zhiyuan, et al.
Pubblicazione: (2025)
PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancement
di: Yue, Xubin, et al.
Pubblicazione: (2025)
di: Yue, Xubin, et al.
Pubblicazione: (2025)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
di: Zhao, Yunhan, et al.
Pubblicazione: (2026)
di: Zhao, Yunhan, et al.
Pubblicazione: (2026)
R-CoT: A Reasoning-Layer Watermark via Redundant Chain-of-Thought in Large Language Models
di: Zhang, Ziming, et al.
Pubblicazione: (2026)
di: Zhang, Ziming, et al.
Pubblicazione: (2026)
KUDA: Knowledge Unlearning by Deviating Representation for Large Language Models
di: Fang, Ce, et al.
Pubblicazione: (2026)
di: Fang, Ce, et al.
Pubblicazione: (2026)
Transferring Backdoors between Large Language Models by Knowledge Distillation
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
An Automated Attack Investigation Approach Leveraging Threat-Knowledge-Augmented Large Language Models
di: Dai, Rujie, et al.
Pubblicazione: (2025)
di: Dai, Rujie, et al.
Pubblicazione: (2025)
AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models
di: Li, Fengpeng, et al.
Pubblicazione: (2026)
di: Li, Fengpeng, et al.
Pubblicazione: (2026)
Safety Layers in Aligned Large Language Models: The Key to LLM Security
di: Li, Shen, et al.
Pubblicazione: (2024)
di: Li, Shen, et al.
Pubblicazione: (2024)
Rethinking Robust Adversarial Concept Erasure in Diffusion Models
di: Yin, Qinghong, et al.
Pubblicazione: (2025)
di: Yin, Qinghong, et al.
Pubblicazione: (2025)
zkLLM: Zero Knowledge Proofs for Large Language Models
di: Sun, Haochen, et al.
Pubblicazione: (2024)
di: Sun, Haochen, et al.
Pubblicazione: (2024)
A Survey: Towards Privacy and Security in Mobile Large Language Models
di: Xu, Honghui, et al.
Pubblicazione: (2025)
di: Xu, Honghui, et al.
Pubblicazione: (2025)
Software-Based Memory Erasure with relaxed isolation requirements: Extended Version
di: Bursuc, Sergiu, et al.
Pubblicazione: (2024)
di: Bursuc, Sergiu, et al.
Pubblicazione: (2024)
LLMAtKGE: Large Language Models as Explainable Attackers against Knowledge Graph Embeddings
di: Li, Ting, et al.
Pubblicazione: (2025)
di: Li, Ting, et al.
Pubblicazione: (2025)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
di: Li, Songze, et al.
Pubblicazione: (2026)
di: Li, Songze, et al.
Pubblicazione: (2026)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
CoreUnlearn: Rethinking Concept Unlearning through Disentangled Component-Level Erasure in Text-guided Diffusion Models
di: Zhao, Mengnan, et al.
Pubblicazione: (2026)
di: Zhao, Mengnan, et al.
Pubblicazione: (2026)
BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models
di: Rachapudi, Jagadeesh, et al.
Pubblicazione: (2026)
di: Rachapudi, Jagadeesh, et al.
Pubblicazione: (2026)
AEGIS: No Tool Call Left Unchecked -- A Pre-Execution Firewall and Audit Layer for AI Agents
di: Yuan, Aojie, et al.
Pubblicazione: (2026)
di: Yuan, Aojie, et al.
Pubblicazione: (2026)
EditMark: Watermarking Large Language Models based on Model Editing
di: Li, Shuai, et al.
Pubblicazione: (2025)
di: Li, Shuai, et al.
Pubblicazione: (2025)
Practical Reasoning Interruption Attacks on Reasoning Large Language Models
di: Cui, Yu, et al.
Pubblicazione: (2025)
di: Cui, Yu, et al.
Pubblicazione: (2025)
PortGPT: Towards Automated Backporting Using Large Language Models
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
AICrypto: Evaluating Cryptography Capabilities of Large Language Models
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models
di: Yang, Yu, et al.
Pubblicazione: (2025)
di: Yang, Yu, et al.
Pubblicazione: (2025)
Cross-Modal Backdoors in Multimodal Large Language Models
di: Wang, Runhe, et al.
Pubblicazione: (2026)
di: Wang, Runhe, et al.
Pubblicazione: (2026)
External Data Extraction Attacks against Retrieval-Augmented Large Language Models
di: He, Yu, et al.
Pubblicazione: (2025)
di: He, Yu, et al.
Pubblicazione: (2025)
DP-FedLoRA: Privacy-Enhanced Federated Fine-Tuning for On-Device Large Language Models
di: Xu, Honghui, et al.
Pubblicazione: (2025)
di: Xu, Honghui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation
di: Jia, Hengrui, et al.
Pubblicazione: (2025) -
SoK: Understanding (New) Security Issues Across AI4Code Use Cases
di: Wu, Qilong, et al.
Pubblicazione: (2025) -
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
di: Wang, Xiangwen, et al.
Pubblicazione: (2026) -
The Efficacy of Transfer-based No-box Attacks on Image Watermarking: A Pragmatic Analysis
di: Wu, Qilong, et al.
Pubblicazione: (2024) -
MEraser: An Effective Fingerprint Erasure Approach for Large Language Models
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)