Detecting Stealthy Backdoor Samples based on Intra-class Distance for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Jinwen, Zhang, Hainan, Sun, Fei, Zhang, Qinnan, Wen, Sijia, Wang, Ziwei, Zheng, Zhiming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FedSEA-LLaMA: A Secure, Efficient and Adaptive Federated Splitting Framework for Large Language Models
di: Zhang, Zishuai, et al.
Pubblicazione: (2025)
di: Zhang, Zishuai, et al.
Pubblicazione: (2025)
From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models
di: Zhang, Ruiqi, et al.
Pubblicazione: (2026)
di: Zhang, Ruiqi, et al.
Pubblicazione: (2026)
CodeBC: A More Secure Large Language Model for Smart Contract Code Generation in Blockchain
di: Wang, Lingxiang, et al.
Pubblicazione: (2025)
di: Wang, Lingxiang, et al.
Pubblicazione: (2025)
FedDTRE: Federated Dialogue Generation Models Powered by Trustworthiness Evaluation
di: Lu, Shule, et al.
Pubblicazione: (2025)
di: Lu, Shule, et al.
Pubblicazione: (2025)
AdaComp: Extractive Context Compression with Adaptive Predictor for Retrieval-Augmented Large Language Models
di: Zhang, Qianchi, et al.
Pubblicazione: (2024)
di: Zhang, Qianchi, et al.
Pubblicazione: (2024)
MaFeRw: Query Rewriting with Multi-Aspect Feedbacks for Retrieval-Augmented Large Language Models
di: Wang, Yujing, et al.
Pubblicazione: (2024)
di: Wang, Yujing, et al.
Pubblicazione: (2024)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
di: Xue, Eric, et al.
Pubblicazione: (2025)
di: Xue, Eric, et al.
Pubblicazione: (2025)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
Beyond the Surface: A Solution-Aware Retrieval Model for Competition-level Code Generation
di: Zhang, Shiwen, et al.
Pubblicazione: (2025)
di: Zhang, Shiwen, et al.
Pubblicazione: (2025)
Learning to Erase Private Knowledge from Multi-Documents for Retrieval-Augmented Large Language Models
di: Wang, Yujing, et al.
Pubblicazione: (2025)
di: Wang, Yujing, et al.
Pubblicazione: (2025)
Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation
di: Zhang, Ruiqi, et al.
Pubblicazione: (2026)
di: Zhang, Ruiqi, et al.
Pubblicazione: (2026)
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
di: Li, Ziqiang, et al.
Pubblicazione: (2024)
di: Li, Ziqiang, et al.
Pubblicazione: (2024)
Stealthy Attack on Large Language Model based Recommendation
di: Zhang, Jinghao, et al.
Pubblicazione: (2024)
di: Zhang, Jinghao, et al.
Pubblicazione: (2024)
Privacy-Preserving Reasoning with Knowledge-Distilled Parametric Retrieval Augmented Generation
di: Chen, Jinwen, et al.
Pubblicazione: (2025)
di: Chen, Jinwen, et al.
Pubblicazione: (2025)
Stable-RAG: Mitigating Retrieval-Permutation-Induced Hallucinations in Retrieval-Augmented Generation
di: Zhang, Qianchi, et al.
Pubblicazione: (2026)
di: Zhang, Qianchi, et al.
Pubblicazione: (2026)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
di: Wei, Jiali, et al.
Pubblicazione: (2026)
di: Wei, Jiali, et al.
Pubblicazione: (2026)
BadApex: Backdoor Attack Based on Adaptive Optimization Mechanism of Black-box Large Language Models
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs
di: Zhao, Gejian, et al.
Pubblicazione: (2025)
di: Zhao, Gejian, et al.
Pubblicazione: (2025)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
di: Qian, Cheng, et al.
Pubblicazione: (2024)
di: Qian, Cheng, et al.
Pubblicazione: (2024)
Less is More: Compact Clue Selection for Efficient Retrieval-Augmented Generation Reasoning
di: Zhang, Qianchi, et al.
Pubblicazione: (2025)
di: Zhang, Qianchi, et al.
Pubblicazione: (2025)
CTCC: A Robust and Stealthy Fingerprinting Framework for Large Language Models via Cross-Turn Contextual Correlation Backdoor
di: Xu, Zhenhua, et al.
Pubblicazione: (2025)
di: Xu, Zhenhua, et al.
Pubblicazione: (2025)
Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference
di: Chen, Zhuo, et al.
Pubblicazione: (2025)
di: Chen, Zhuo, et al.
Pubblicazione: (2025)
LocalSUG: City-Preference-Enhanced LLM for Query Suggestion in Local-Life Services
di: Chen, Jinwen, et al.
Pubblicazione: (2026)
di: Chen, Jinwen, et al.
Pubblicazione: (2026)
Neutralizing Backdoors through Information Conflicts for Large Language Models
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
di: Wu, Zongru, et al.
Pubblicazione: (2024)
di: Wu, Zongru, et al.
Pubblicazione: (2024)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
di: Liu, Xiaogeng, et al.
Pubblicazione: (2023)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2023)
Mask-Free Privacy Extraction and Rewriting: A Domain-Aware Approach via Prototype Learning
di: Li, Xiaodong, et al.
Pubblicazione: (2026)
di: Li, Xiaodong, et al.
Pubblicazione: (2026)
Global-Recent Semantic Reasoning on Dynamic Text-Attributed Graphs with Large Language Models
di: Wang, Yunan, et al.
Pubblicazione: (2025)
di: Wang, Yunan, et al.
Pubblicazione: (2025)
Parameter Importance-Driven Continual Learning for Foundation Models
di: Wang, Lingxiang, et al.
Pubblicazione: (2025)
di: Wang, Lingxiang, et al.
Pubblicazione: (2025)
MEGen: Generative Backdoor into Large Language Models via Model Editing
di: Qiu, Jiyang, et al.
Pubblicazione: (2024)
di: Qiu, Jiyang, et al.
Pubblicazione: (2024)
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
Can Large Language Models Replace Data Scientists in Biomedical Research?
di: Wang, Zifeng, et al.
Pubblicazione: (2024)
di: Wang, Zifeng, et al.
Pubblicazione: (2024)
VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding Manipulation
di: Ye, Ziang, et al.
Pubblicazione: (2025)
di: Ye, Ziang, et al.
Pubblicazione: (2025)
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
di: Yin, Rui, et al.
Pubblicazione: (2026)
di: Yin, Rui, et al.
Pubblicazione: (2026)
iCLP: Large Language Model Reasoning with Implicit Cognition Latent Planning
di: Chen, Sijia, et al.
Pubblicazione: (2025)
di: Chen, Sijia, et al.
Pubblicazione: (2025)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FedSEA-LLaMA: A Secure, Efficient and Adaptive Federated Splitting Framework for Large Language Models
di: Zhang, Zishuai, et al.
Pubblicazione: (2025) -
From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models
di: Zhang, Ruiqi, et al.
Pubblicazione: (2026) -
CodeBC: A More Secure Large Language Model for Smart Contract Code Generation in Blockchain
di: Wang, Lingxiang, et al.
Pubblicazione: (2025) -
FedDTRE: Federated Dialogue Generation Models Powered by Trustworthiness Evaluation
di: Lu, Shule, et al.
Pubblicazione: (2025) -
AdaComp: Extractive Context Compression with Adaptive Predictor for Retrieval-Augmented Large Language Models
di: Zhang, Qianchi, et al.
Pubblicazione: (2024)