BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Rachapudi, Jagadeesh, Vatsi, Ritali, Singh, Pranav, Hambarde, Praful, Shukla, Amit |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RePAIR: Interactive Machine Unlearning through Prompt-Aware Model Repair
by: Rachapudi, Jagadeesh, et al.
Published: (2026)
by: Rachapudi, Jagadeesh, et al.
Published: (2026)
BID-LoRA: A Parameter-Efficient Framework for Continual Learning and Unlearning
by: Rachapudi, Jagadeesh, et al.
Published: (2026)
by: Rachapudi, Jagadeesh, et al.
Published: (2026)
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
by: Li, Haoran, et al.
Published: (2024)
by: Li, Haoran, et al.
Published: (2024)
Isolate Trigger: Detecting and Eliminating Adaptive Backdoor Attacks
by: Sun, Chengrui, et al.
Published: (2025)
by: Sun, Chengrui, et al.
Published: (2025)
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
by: Li, Shuai, et al.
Published: (2023)
by: Li, Shuai, et al.
Published: (2023)
Transferring Backdoors between Large Language Models by Knowledge Distillation
by: Cheng, Pengzhou, et al.
Published: (2024)
by: Cheng, Pengzhou, et al.
Published: (2024)
VOW: Verifiable and Oblivious Watermark Detection for Large Language Models
by: Luan, Xiaokun, et al.
Published: (2026)
by: Luan, Xiaokun, et al.
Published: (2026)
SeDT: Sentence-Transformer Decision-Transformer Conditioning for Multi-Turn Conversation Reliability
by: Setti, Ramakrishna Vamsi, et al.
Published: (2026)
by: Setti, Ramakrishna Vamsi, et al.
Published: (2026)
Backdooring Bias in Large Language Models
by: Das, Anudeep, et al.
Published: (2026)
by: Das, Anudeep, et al.
Published: (2026)
Protecting Copyright of Medical Pre-trained Language Models: Training-Free Backdoor Model Watermarking
by: Kong, Cong, et al.
Published: (2024)
by: Kong, Cong, et al.
Published: (2024)
A Nested Watermark for Large Language Models
by: Nagatsuka, Koichi, et al.
Published: (2025)
by: Nagatsuka, Koichi, et al.
Published: (2025)
PRIVMARK: Private Large Language Models Watermarking with MPC
by: Fargues, Thomas, et al.
Published: (2025)
by: Fargues, Thomas, et al.
Published: (2025)
A Certified Robust Watermark For Large Language Models
by: Feng, Xianheng, et al.
Published: (2024)
by: Feng, Xianheng, et al.
Published: (2024)
Harmless Backdoor-based Client-side Watermarking in Federated Learning
by: Luo, Kaijing, et al.
Published: (2024)
by: Luo, Kaijing, et al.
Published: (2024)
zkFi: Privacy-Preserving and Regulation Compliant Transactions using Zero Knowledge Proofs
by: Chaudhary, Amit
Published: (2023)
by: Chaudhary, Amit
Published: (2023)
Cross-Modal Backdoors in Multimodal Large Language Models
by: Wang, Runhe, et al.
Published: (2026)
by: Wang, Runhe, et al.
Published: (2026)
Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models
by: Li, Xi, et al.
Published: (2024)
by: Li, Xi, et al.
Published: (2024)
BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
by: Wang, Zihan, et al.
Published: (2026)
by: Wang, Zihan, et al.
Published: (2026)
MorphMark: Flexible Adaptive Watermarking for Large Language Models
by: Wang, Zongqi, et al.
Published: (2025)
by: Wang, Zongqi, et al.
Published: (2025)
Watermarking Text Data on Large Language Models for Dataset Copyright
by: Liu, Yixin, et al.
Published: (2023)
by: Liu, Yixin, et al.
Published: (2023)
EditMark: Watermarking Large Language Models based on Model Editing
by: Li, Shuai, et al.
Published: (2025)
by: Li, Shuai, et al.
Published: (2025)
An End-to-End Model for Logits-Based Large Language Models Watermarking
by: Wong, Kahim, et al.
Published: (2025)
by: Wong, Kahim, et al.
Published: (2025)
A Resilient and Accessible Distribution-Preserving Watermark for Large Language Models
by: Wu, Yihan, et al.
Published: (2023)
by: Wu, Yihan, et al.
Published: (2023)
ShapeMark: Robust and Diversity-Preserving Watermarking for Diffusion Models
by: Qian, Yuqi, et al.
Published: (2026)
by: Qian, Yuqi, et al.
Published: (2026)
Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
by: Fu, Hang, et al.
Published: (2026)
by: Fu, Hang, et al.
Published: (2026)
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
by: Yuan, Zenghui, et al.
Published: (2025)
by: Yuan, Zenghui, et al.
Published: (2025)
On the Weaknesses of Backdoor-based Model Watermarking: An Information-theoretic Perspective
by: Hu, Aoting, et al.
Published: (2024)
by: Hu, Aoting, et al.
Published: (2024)
Signal Watermark on Large Language Models
by: Xu, Zhenyu, et al.
Published: (2024)
by: Xu, Zhenyu, et al.
Published: (2024)
Coward: Collision-based OOD Watermarking for Practical Proactive Federated Backdoor Detection
by: Li, Wenjie, et al.
Published: (2025)
by: Li, Wenjie, et al.
Published: (2025)
Forging the Unforgeable: On the Feasibility of Counterfeit Watermarks in Backdoor-Based Dataset Ownership Verification
by: Li, Zhiying, et al.
Published: (2024)
by: Li, Zhiying, et al.
Published: (2024)
Let Watermarks Speak: A Robust and Unforgeable Watermark for Language Models
by: Bai, Minhao
Published: (2024)
by: Bai, Minhao
Published: (2024)
Double Backdoored: Converting Code Large Language Model Backdoors to Traditional Malware via Adversarial Instruction Tuning Attacks
by: Hossen, Md Imran, et al.
Published: (2024)
by: Hossen, Md Imran, et al.
Published: (2024)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Black-Box Detection of Language Model Watermarks
by: Gloaguen, Thibaud, et al.
Published: (2024)
by: Gloaguen, Thibaud, et al.
Published: (2024)
A Robust Semantics-based Watermark for Large Language Model against Paraphrasing
by: Ren, Jie, et al.
Published: (2023)
by: Ren, Jie, et al.
Published: (2023)
Yet Another Watermark for Large Language Models
by: Bao, Siyuan, et al.
Published: (2025)
by: Bao, Siyuan, et al.
Published: (2025)
Functional Subspace Watermarking for Large Language Models
by: Ding, Zikang, et al.
Published: (2026)
by: Ding, Zikang, et al.
Published: (2026)
Rethinking Backdoor Detection Evaluation for Language Models
by: Yan, Jun, et al.
Published: (2024)
by: Yan, Jun, et al.
Published: (2024)
Physical Backdoor Attack can Jeopardize Driving with Vision-Large-Language Models
by: Ni, Zhenyang, et al.
Published: (2024)
by: Ni, Zhenyang, et al.
Published: (2024)
Asking Back: Interaction-Layer Antidistillation Watermarks
by: Yang, Guang, et al.
Published: (2026)
by: Yang, Guang, et al.
Published: (2026)
Similar Items
-
RePAIR: Interactive Machine Unlearning through Prompt-Aware Model Repair
by: Rachapudi, Jagadeesh, et al.
Published: (2026) -
BID-LoRA: A Parameter-Efficient Framework for Continual Learning and Unlearning
by: Rachapudi, Jagadeesh, et al.
Published: (2026) -
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
by: Li, Haoran, et al.
Published: (2024) -
Isolate Trigger: Detecting and Eliminating Adaptive Backdoor Attacks
by: Sun, Chengrui, et al.
Published: (2025) -
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
by: Li, Shuai, et al.
Published: (2023)