Denial-of-Service Poisoning Attacks against Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Kuofeng, Pang, Tianyu, Du, Chao, Yang, Yong, Xia, Shu-Tao, Lin, Min |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
Test-Time Backdoor Attacks on Multimodal Large Language Models
di: Lu, Dong, et al.
Pubblicazione: (2024)
di: Lu, Dong, et al.
Pubblicazione: (2024)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
Benchmarking Large Multimodal Models against Common Corruptions
di: Zhang, Jiawei, et al.
Pubblicazione: (2024)
di: Zhang, Jiawei, et al.
Pubblicazione: (2024)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
di: Zou, Qingsong, et al.
Pubblicazione: (2025)
di: Zou, Qingsong, et al.
Pubblicazione: (2025)
PRSA: Prompt Stealing Attacks against Real-World Prompt Services
di: Yang, Yong, et al.
Pubblicazione: (2024)
di: Yang, Yong, et al.
Pubblicazione: (2024)
SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
di: Afane, Mohamed, et al.
Pubblicazione: (2025)
di: Afane, Mohamed, et al.
Pubblicazione: (2025)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
di: Fu, Wenjie, et al.
Pubblicazione: (2023)
di: Fu, Wenjie, et al.
Pubblicazione: (2023)
Towards Dataset Copyright Evasion Attack against Personalized Text-to-Image Diffusion Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
LLMAtKGE: Large Language Models as Explainable Attackers against Knowledge Graph Embeddings
di: Li, Ting, et al.
Pubblicazione: (2025)
di: Li, Ting, et al.
Pubblicazione: (2025)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Lifelong Safety Alignment for Language Models
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Towards Label-Only Membership Inference Attack against Pre-trained Large Language Models
di: He, Yu, et al.
Pubblicazione: (2025)
di: He, Yu, et al.
Pubblicazione: (2025)
Improving Your Model Ranking on Chatbot Arena by Vote Rigging
di: Min, Rui, et al.
Pubblicazione: (2025)
di: Min, Rui, et al.
Pubblicazione: (2025)
Prompt Stealing Attacks Against Large Language Models
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
Denial-of-Service or Fine-Grained Control: Towards Flexible Model Poisoning Attacks on Federated Learning
di: Zhang, Hangtao, et al.
Pubblicazione: (2023)
di: Zhang, Hangtao, et al.
Pubblicazione: (2023)
Meta-Unlearning on Diffusion Models: Preventing Relearning Unlearned Concepts
di: Gao, Hongcheng, et al.
Pubblicazione: (2024)
di: Gao, Hongcheng, et al.
Pubblicazione: (2024)
RAG Safety: Exploring Knowledge Poisoning Attacks to Retrieval-Augmented Generation
di: Zhao, Tianzhe, et al.
Pubblicazione: (2025)
di: Zhao, Tianzhe, et al.
Pubblicazione: (2025)
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
di: Li, Ziqiang, et al.
Pubblicazione: (2024)
di: Li, Ziqiang, et al.
Pubblicazione: (2024)
Learnable Linguistic Watermarks for Tracing Model Extraction Attacks on Large Language Models
di: Bai, Minhao, et al.
Pubblicazione: (2024)
di: Bai, Minhao, et al.
Pubblicazione: (2024)
Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Cheating Automatic LLM Benchmarks: Null Models Achieve High Win Rates
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
Jailbreaking Attack against Multimodal Large Language Model
di: Niu, Zhenxing, et al.
Pubblicazione: (2024)
di: Niu, Zhenxing, et al.
Pubblicazione: (2024)
Learning to Poison Large Language Models for Downstream Manipulation
di: Zhou, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhou, Xiangyu, et al.
Pubblicazione: (2024)
Task-Agnostic Detector for Insertion-Based Backdoor Attacks
di: Lyu, Weimin, et al.
Pubblicazione: (2024)
di: Lyu, Weimin, et al.
Pubblicazione: (2024)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
di: Li, Bangxin, et al.
Pubblicazione: (2024)
di: Li, Bangxin, et al.
Pubblicazione: (2024)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
di: Wang, Jiongxiao, et al.
Pubblicazione: (2023)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2023)
Fact2Fiction: Targeted Poisoning Attack to Agentic Fact-checking System
di: He, Haorui, et al.
Pubblicazione: (2025)
di: He, Haorui, et al.
Pubblicazione: (2025)
Privacy in Large Language Models: Attacks, Defenses and Future Directions
di: Li, Haoran, et al.
Pubblicazione: (2023)
di: Li, Haoran, et al.
Pubblicazione: (2023)
Privacy-Preserving Parameter-Efficient Fine-Tuning for Large Language Model Services
di: Li, Yansong, et al.
Pubblicazione: (2023)
di: Li, Yansong, et al.
Pubblicazione: (2023)
SEEP: Training Dynamics Grounds Latent Representation Search for Mitigating Backdoor Poisoning Attacks
di: He, Xuanli, et al.
Pubblicazione: (2024)
di: He, Xuanli, et al.
Pubblicazione: (2024)
FraudShield: Knowledge Graph Empowered Defense for LLMs against Fraud Attacks
di: Xu, Naen, et al.
Pubblicazione: (2026)
di: Xu, Naen, et al.
Pubblicazione: (2026)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
di: Dong, Yiting, et al.
Pubblicazione: (2024)
di: Dong, Yiting, et al.
Pubblicazione: (2024)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
di: Wang, Haoran, et al.
Pubblicazione: (2023)
di: Wang, Haoran, et al.
Pubblicazione: (2023)
Not All Prompts Are Secure: A Switchable Backdoor Attack Against Pre-trained Vision Transformers
di: Yang, Sheng, et al.
Pubblicazione: (2024)
di: Yang, Sheng, et al.
Pubblicazione: (2024)
Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
di: Baumgärtner, Tim, et al.
Pubblicazione: (2024)
di: Baumgärtner, Tim, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025) -
Test-Time Backdoor Attacks on Multimodal Large Language Models
di: Lu, Dong, et al.
Pubblicazione: (2024) -
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024) -
Benchmarking Large Multimodal Models against Common Corruptions
di: Zhang, Jiawei, et al.
Pubblicazione: (2024) -
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
di: Zou, Qingsong, et al.
Pubblicazione: (2025)