Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Chen, Sun, Yuchen, Gao, Jiaxin, Gong, Xueluan, Wang, Qian, Wang, Ziyao, Zheng, Yongsen, Lam, Kwok-Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Neutralizing Backdoors through Information Conflicts for Large Language Models
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents
di: Chen, Chen, et al.
Pubblicazione: (2026)
di: Chen, Chen, et al.
Pubblicazione: (2026)
Attribution Techniques for Mitigating Hallucinated Information in RAG Systems: A Survey
di: Zhao, Yuqing, et al.
Pubblicazione: (2026)
di: Zhao, Yuqing, et al.
Pubblicazione: (2026)
Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations
di: Chen, Chen, et al.
Pubblicazione: (2026)
di: Chen, Chen, et al.
Pubblicazione: (2026)
Hidden Data Privacy Breaches in Federated Learning
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
Why Multi-Interest Fairness Matters: Hypergraph Contrastive Multi-Interest Learning for Fair Conversational Recommender System
di: Zheng, Yongsen, et al.
Pubblicazione: (2025)
di: Zheng, Yongsen, et al.
Pubblicazione: (2025)
AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems
di: Gao, Jiaxin, et al.
Pubblicazione: (2025)
di: Gao, Jiaxin, et al.
Pubblicazione: (2025)
Investigating the (De)Composition Capabilities of Large Language Models in Natural-to-Formal Language Conversion
di: Xu, Ziyao, et al.
Pubblicazione: (2025)
di: Xu, Ziyao, et al.
Pubblicazione: (2025)
Survey on Knowledge Distillation for Large Language Models: Methods, Evaluation, and Application
di: Yang, Chuanpeng, et al.
Pubblicazione: (2024)
di: Yang, Chuanpeng, et al.
Pubblicazione: (2024)
Detecting Stealthy Backdoor Samples based on Intra-class Distance for Large Language Models
di: Chen, Jinwen, et al.
Pubblicazione: (2025)
di: Chen, Jinwen, et al.
Pubblicazione: (2025)
Purifying Large Language Models by Ensembling a Small Language Model
di: Li, Tianlin, et al.
Pubblicazione: (2024)
di: Li, Tianlin, et al.
Pubblicazione: (2024)
Threats, Attacks, and Defenses in Machine Unlearning: A Survey
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
Detecting Corpus-Level Knowledge Inconsistencies in Wikipedia with Large Language Models
di: Semnani, Sina J., et al.
Pubblicazione: (2025)
di: Semnani, Sina J., et al.
Pubblicazione: (2025)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
di: Yan, Jun, et al.
Pubblicazione: (2023)
di: Yan, Jun, et al.
Pubblicazione: (2023)
Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations
di: Mo, Wenjie, et al.
Pubblicazione: (2023)
di: Mo, Wenjie, et al.
Pubblicazione: (2023)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
How Do Document Parsers Break? Auditing Structural Vulnerability in Document Intelligence
di: Chen, Yue, et al.
Pubblicazione: (2026)
di: Chen, Yue, et al.
Pubblicazione: (2026)
KICGPT: Large Language Model with Knowledge in Context for Knowledge Graph Completion
di: Wei, Yanbin, et al.
Pubblicazione: (2024)
di: Wei, Yanbin, et al.
Pubblicazione: (2024)
Knowledge Editing for Large Language Models: A Survey
di: Wang, Song, et al.
Pubblicazione: (2023)
di: Wang, Song, et al.
Pubblicazione: (2023)
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering
di: Sun, Xin, et al.
Pubblicazione: (2025)
di: Sun, Xin, et al.
Pubblicazione: (2025)
Mechanistic Circuit-Based Knowledge Editing in Large Language Models
di: Zhao, Tianyi, et al.
Pubblicazione: (2026)
di: Zhao, Tianyi, et al.
Pubblicazione: (2026)
Backdoor Attack with Sparse and Invisible Trigger
di: Gao, Yinghua, et al.
Pubblicazione: (2023)
di: Gao, Yinghua, et al.
Pubblicazione: (2023)
Megatron: Evasive Clean-Label Backdoor Attacks against Vision Transformer
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
di: An, Wenbin, et al.
Pubblicazione: (2024)
di: An, Wenbin, et al.
Pubblicazione: (2024)
Feature Alignment-Based Knowledge Distillation for Efficient Compression of Large Language Models
di: Wang, Shuo, et al.
Pubblicazione: (2024)
di: Wang, Shuo, et al.
Pubblicazione: (2024)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Knowledge Distillation for Temporal Knowledge Graph Reasoning with Large Language Models
di: Xing, Wang, et al.
Pubblicazione: (2026)
di: Xing, Wang, et al.
Pubblicazione: (2026)
CLR-Fact: Evaluating the Complex Logical Reasoning Capability of Large Language Models over Factual Knowledge
di: Zheng, Tianshi, et al.
Pubblicazione: (2024)
di: Zheng, Tianshi, et al.
Pubblicazione: (2024)
Think-on-Graph: Deep and Responsible Reasoning of Large Language Model on Knowledge Graph
di: Sun, Jiashuo, et al.
Pubblicazione: (2023)
di: Sun, Jiashuo, et al.
Pubblicazione: (2023)
Large Language Models are Limited in Out-of-Context Knowledge Reasoning
di: Hu, Peng, et al.
Pubblicazione: (2024)
di: Hu, Peng, et al.
Pubblicazione: (2024)
UniEdit: A Unified Knowledge Editing Benchmark for Large Language Models
di: Chen, Qizhou, et al.
Pubblicazione: (2025)
di: Chen, Qizhou, et al.
Pubblicazione: (2025)
An Effective and Resilient Backdoor Attack Framework against Deep Neural Networks and Vision Transformers
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
Speculate, then Collaborate: Fusing Knowledge of Language Models during Decoding
di: Wang, Ziyao, et al.
Pubblicazione: (2025)
di: Wang, Ziyao, et al.
Pubblicazione: (2025)
Knowledge Distillation of Black-Box Large Language Models
di: Chen, Hongzhan, et al.
Pubblicazione: (2024)
di: Chen, Hongzhan, et al.
Pubblicazione: (2024)
Toward Informal Language Processing: Knowledge of Slang in Large Language Models
di: Sun, Zhewei, et al.
Pubblicazione: (2024)
di: Sun, Zhewei, et al.
Pubblicazione: (2024)
Contrastive Learning for Knowledge-Based Question Generation in Large Language Models
di: Zhang, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhang, Zhenhong, et al.
Pubblicazione: (2024)
Benchmarking and Rethinking Knowledge Editing for Large Language Models
di: He, Guoxiu, et al.
Pubblicazione: (2025)
di: He, Guoxiu, et al.
Pubblicazione: (2025)
Beyond Max Tokens: Stealthy Resource Amplification via Tool Calling Chains in LLM Agents
di: Zhou, Kaiyu, et al.
Pubblicazione: (2026)
di: Zhou, Kaiyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Neutralizing Backdoors through Information Conflicts for Large Language Models
di: Chen, Chen, et al.
Pubblicazione: (2024) -
The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents
di: Chen, Chen, et al.
Pubblicazione: (2026) -
Attribution Techniques for Mitigating Hallucinated Information in RAG Systems: A Survey
di: Zhao, Yuqing, et al.
Pubblicazione: (2026) -
Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations
di: Chen, Chen, et al.
Pubblicazione: (2026) -
Hidden Data Privacy Breaches in Federated Learning
di: Gong, Xueluan, et al.
Pubblicazione: (2024)