Layer-Targeted Multilingual Knowledge Erasure in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Taoran, Chandrasekaran, Varun, Yu, Zhiyuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation
von: Jia, Hengrui, et al.
Veröffentlicht: (2025)
von: Jia, Hengrui, et al.
Veröffentlicht: (2025)
SoK: Understanding (New) Security Issues Across AI4Code Use Cases
von: Wu, Qilong, et al.
Veröffentlicht: (2025)
von: Wu, Qilong, et al.
Veröffentlicht: (2025)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
von: Wang, Xiangwen, et al.
Veröffentlicht: (2026)
von: Wang, Xiangwen, et al.
Veröffentlicht: (2026)
The Efficacy of Transfer-based No-box Attacks on Image Watermarking: A Pragmatic Analysis
von: Wu, Qilong, et al.
Veröffentlicht: (2024)
von: Wu, Qilong, et al.
Veröffentlicht: (2024)
MEraser: An Effective Fingerprint Erasure Approach for Large Language Models
von: Zhang, Jingxuan, et al.
Veröffentlicht: (2025)
von: Zhang, Jingxuan, et al.
Veröffentlicht: (2025)
Zk-SNARK for String Match
von: Li, Taoran, et al.
Veröffentlicht: (2025)
von: Li, Taoran, et al.
Veröffentlicht: (2025)
Privately Aligning Language Models with Reinforcement Learning
von: Wu, Fan, et al.
Veröffentlicht: (2023)
von: Wu, Fan, et al.
Veröffentlicht: (2023)
AMUN: Adversarial Machine UNlearning
von: Ebrahimpour-Boroojeny, Ali, et al.
Veröffentlicht: (2025)
von: Ebrahimpour-Boroojeny, Ali, et al.
Veröffentlicht: (2025)
Bypassing LLM Watermarks with Color-Aware Substitutions
von: Wu, Qilong, et al.
Veröffentlicht: (2024)
von: Wu, Qilong, et al.
Veröffentlicht: (2024)
A Survey On Secure Machine Learning
von: Liao, Taobo, et al.
Veröffentlicht: (2025)
von: Liao, Taobo, et al.
Veröffentlicht: (2025)
Challenges in Enabling Private Data Valuation
von: Fu, Yiwei, et al.
Veröffentlicht: (2026)
von: Fu, Yiwei, et al.
Veröffentlicht: (2026)
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
von: Li, Shuai, et al.
Veröffentlicht: (2023)
von: Li, Shuai, et al.
Veröffentlicht: (2023)
Empirical Evaluation of Memory-Erasure Protocols
von: Gil-Pons, Reynaldo, et al.
Veröffentlicht: (2025)
von: Gil-Pons, Reynaldo, et al.
Veröffentlicht: (2025)
Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
von: Xu, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Xu, Zhiyuan, et al.
Veröffentlicht: (2025)
PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancement
von: Yue, Xubin, et al.
Veröffentlicht: (2025)
von: Yue, Xubin, et al.
Veröffentlicht: (2025)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
von: Zhao, Yunhan, et al.
Veröffentlicht: (2026)
von: Zhao, Yunhan, et al.
Veröffentlicht: (2026)
R-CoT: A Reasoning-Layer Watermark via Redundant Chain-of-Thought in Large Language Models
von: Zhang, Ziming, et al.
Veröffentlicht: (2026)
von: Zhang, Ziming, et al.
Veröffentlicht: (2026)
KUDA: Knowledge Unlearning by Deviating Representation for Large Language Models
von: Fang, Ce, et al.
Veröffentlicht: (2026)
von: Fang, Ce, et al.
Veröffentlicht: (2026)
Transferring Backdoors between Large Language Models by Knowledge Distillation
von: Cheng, Pengzhou, et al.
Veröffentlicht: (2024)
von: Cheng, Pengzhou, et al.
Veröffentlicht: (2024)
An Automated Attack Investigation Approach Leveraging Threat-Knowledge-Augmented Large Language Models
von: Dai, Rujie, et al.
Veröffentlicht: (2025)
von: Dai, Rujie, et al.
Veröffentlicht: (2025)
AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models
von: Li, Fengpeng, et al.
Veröffentlicht: (2026)
von: Li, Fengpeng, et al.
Veröffentlicht: (2026)
Safety Layers in Aligned Large Language Models: The Key to LLM Security
von: Li, Shen, et al.
Veröffentlicht: (2024)
von: Li, Shen, et al.
Veröffentlicht: (2024)
Rethinking Robust Adversarial Concept Erasure in Diffusion Models
von: Yin, Qinghong, et al.
Veröffentlicht: (2025)
von: Yin, Qinghong, et al.
Veröffentlicht: (2025)
zkLLM: Zero Knowledge Proofs for Large Language Models
von: Sun, Haochen, et al.
Veröffentlicht: (2024)
von: Sun, Haochen, et al.
Veröffentlicht: (2024)
A Survey: Towards Privacy and Security in Mobile Large Language Models
von: Xu, Honghui, et al.
Veröffentlicht: (2025)
von: Xu, Honghui, et al.
Veröffentlicht: (2025)
Software-Based Memory Erasure with relaxed isolation requirements: Extended Version
von: Bursuc, Sergiu, et al.
Veröffentlicht: (2024)
von: Bursuc, Sergiu, et al.
Veröffentlicht: (2024)
LLMAtKGE: Large Language Models as Explainable Attackers against Knowledge Graph Embeddings
von: Li, Ting, et al.
Veröffentlicht: (2025)
von: Li, Ting, et al.
Veröffentlicht: (2025)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
von: Li, Songze, et al.
Veröffentlicht: (2026)
von: Li, Songze, et al.
Veröffentlicht: (2026)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
von: Yu, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Yu, Zhiyuan, et al.
Veröffentlicht: (2024)
CoreUnlearn: Rethinking Concept Unlearning through Disentangled Component-Level Erasure in Text-guided Diffusion Models
von: Zhao, Mengnan, et al.
Veröffentlicht: (2026)
von: Zhao, Mengnan, et al.
Veröffentlicht: (2026)
BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models
von: Rachapudi, Jagadeesh, et al.
Veröffentlicht: (2026)
von: Rachapudi, Jagadeesh, et al.
Veröffentlicht: (2026)
AEGIS: No Tool Call Left Unchecked -- A Pre-Execution Firewall and Audit Layer for AI Agents
von: Yuan, Aojie, et al.
Veröffentlicht: (2026)
von: Yuan, Aojie, et al.
Veröffentlicht: (2026)
EditMark: Watermarking Large Language Models based on Model Editing
von: Li, Shuai, et al.
Veröffentlicht: (2025)
von: Li, Shuai, et al.
Veröffentlicht: (2025)
Practical Reasoning Interruption Attacks on Reasoning Large Language Models
von: Cui, Yu, et al.
Veröffentlicht: (2025)
von: Cui, Yu, et al.
Veröffentlicht: (2025)
PortGPT: Towards Automated Backporting Using Large Language Models
von: Li, Zhaoyang, et al.
Veröffentlicht: (2025)
von: Li, Zhaoyang, et al.
Veröffentlicht: (2025)
AICrypto: Evaluating Cryptography Capabilities of Large Language Models
von: Wang, Yu, et al.
Veröffentlicht: (2025)
von: Wang, Yu, et al.
Veröffentlicht: (2025)
Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models
von: Yang, Yu, et al.
Veröffentlicht: (2025)
von: Yang, Yu, et al.
Veröffentlicht: (2025)
Cross-Modal Backdoors in Multimodal Large Language Models
von: Wang, Runhe, et al.
Veröffentlicht: (2026)
von: Wang, Runhe, et al.
Veröffentlicht: (2026)
External Data Extraction Attacks against Retrieval-Augmented Large Language Models
von: He, Yu, et al.
Veröffentlicht: (2025)
von: He, Yu, et al.
Veröffentlicht: (2025)
DP-FedLoRA: Privacy-Enhanced Federated Fine-Tuning for On-Device Large Language Models
von: Xu, Honghui, et al.
Veröffentlicht: (2025)
von: Xu, Honghui, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation
von: Jia, Hengrui, et al.
Veröffentlicht: (2025) -
SoK: Understanding (New) Security Issues Across AI4Code Use Cases
von: Wu, Qilong, et al.
Veröffentlicht: (2025) -
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
von: Wang, Xiangwen, et al.
Veröffentlicht: (2026) -
The Efficacy of Transfer-based No-box Attacks on Image Watermarking: A Pragmatic Analysis
von: Wu, Qilong, et al.
Veröffentlicht: (2024) -
MEraser: An Effective Fingerprint Erasure Approach for Large Language Models
von: Zhang, Jingxuan, et al.
Veröffentlicht: (2025)