AdvBDGen: Adversarially Fortified Prompt-Specific Fuzzy Backdoor Generator Against LLM Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Pathmanathan, Pankayaraj, Sehwag, Udari Madhushani, Panaitescu-Liess, Michael-Andrei, Huang, Furong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RAGPart & RAGMask: Retrieval-Stage Defenses Against Corpus Poisoning in Retrieval-Augmented Generation
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2026)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2026)
PoisonedParrot: Subtle Data Poisoning Attacks to Elicit Copyright-Infringing Content from Large Language Models
di: Panaitescu-Liess, Michael-Andrei, et al.
Pubblicazione: (2025)
di: Panaitescu-Liess, Michael-Andrei, et al.
Pubblicazione: (2025)
Can Watermarking Large Language Models Prevent Copyrighted Text Generation and Hide Training Data?
di: Panaitescu-Liess, Michael-Andrei, et al.
Pubblicazione: (2024)
di: Panaitescu-Liess, Michael-Andrei, et al.
Pubblicazione: (2024)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
di: An, Bang, et al.
Pubblicazione: (2024)
di: An, Bang, et al.
Pubblicazione: (2024)
PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2025)
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2025)
Compositional Adversarial Training for Robust Visual Watermarking
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
Like Oil and Water: Group Robustness Methods and Poisoning Defenses May Be at Odds
di: Panaitescu-Liess, Michael-Andrei, et al.
Pubblicazione: (2025)
di: Panaitescu-Liess, Michael-Andrei, et al.
Pubblicazione: (2025)
Is poisoning a real threat to LLM alignment? Maybe more so than you think
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2024)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2024)
PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts
di: An, Bang, et al.
Pubblicazione: (2023)
di: An, Bang, et al.
Pubblicazione: (2023)
GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2026)
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2026)
Collab: Controlled Decoding using Mixture of Agents for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2025)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2025)
In-Context Learning with Topological Information for Knowledge Graph Completion
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2024)
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2024)
Using Curiosity for an Even Representation of Tasks in Continual Offline Reinforcement Learning
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2023)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2023)
Can LLMs be Scammed? A Baseline Measurement Study
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2024)
di: Sehwag, Udari Madhushani, et al.
Pubblicazione: (2024)
LHAW: Controllable Underspecification for Long-Horizon Tasks
di: Pu, George, et al.
Pubblicazione: (2026)
di: Pu, George, et al.
Pubblicazione: (2026)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
di: Campbell, David, et al.
Pubblicazione: (2026)
di: Campbell, David, et al.
Pubblicazione: (2026)
Continual Learning of Domain Knowledge from Human Feedback in Text-to-SQL
di: Cook, Thomas, et al.
Pubblicazione: (2025)
di: Cook, Thomas, et al.
Pubblicazione: (2025)
Krait: A Backdoor Attack Against Graph Prompt Tuning
di: Song, Ying, et al.
Pubblicazione: (2024)
di: Song, Ying, et al.
Pubblicazione: (2024)
PromptFix: Few-shot Backdoor Removal via Adversarial Prompt Tuning
di: Zhang, Tianrong, et al.
Pubblicazione: (2024)
di: Zhang, Tianrong, et al.
Pubblicazione: (2024)
Rethinking Adversarial Policies: A Generalized Attack Formulation and Provable Defense in RL
di: Liu, Xiangyu, et al.
Pubblicazione: (2023)
di: Liu, Xiangyu, et al.
Pubblicazione: (2023)
Adversarial Feature Map Pruning for Backdoor
di: Huang, Dong, et al.
Pubblicazione: (2023)
di: Huang, Dong, et al.
Pubblicazione: (2023)
AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration
di: Karthikeyan, Harish, et al.
Pubblicazione: (2025)
di: Karthikeyan, Harish, et al.
Pubblicazione: (2025)
Adapting to Evolving Adversaries with Regularized Continual Robust Training
di: Dai, Sihui, et al.
Pubblicazione: (2025)
di: Dai, Sihui, et al.
Pubblicazione: (2025)
AdvBlur: Adversarial Blur for Robust Diabetic Retinopathy Classification and Cross-Domain Generalization
di: Kanagalingam, Heethanjan, et al.
Pubblicazione: (2025)
di: Kanagalingam, Heethanjan, et al.
Pubblicazione: (2025)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
Backdoor or Manipulation? Graph Mixture of Experts Can Defend Against Various Graph Adversarial Attacks
di: Feng, Yuyuan, et al.
Pubblicazione: (2025)
di: Feng, Yuyuan, et al.
Pubblicazione: (2025)
Transfer Q Star: Principled Decoding for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
Adversarially Guided Stateful Defense Against Backdoor Attacks in Federated Deep Learning
di: Ali, Hassan, et al.
Pubblicazione: (2024)
di: Ali, Hassan, et al.
Pubblicazione: (2024)
Fortifying Fully Convolutional Generative Adversarial Networks for Image Super-Resolution Using Divergence Measures
di: Basu, Arkaprabha, et al.
Pubblicazione: (2024)
di: Basu, Arkaprabha, et al.
Pubblicazione: (2024)
On the Robustness of Graph Reduction Against GNN Backdoor
di: Zhu, Yuxuan, et al.
Pubblicazione: (2024)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2024)
AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs
di: Paulus, Anselm, et al.
Pubblicazione: (2024)
di: Paulus, Anselm, et al.
Pubblicazione: (2024)
Instruction Backdoor Attacks Against Customized LLMs
di: Zhang, Rui, et al.
Pubblicazione: (2024)
di: Zhang, Rui, et al.
Pubblicazione: (2024)
Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs
di: Zizzo, Giulio, et al.
Pubblicazione: (2025)
di: Zizzo, Giulio, et al.
Pubblicazione: (2025)
Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content
di: Pandey, Rohan, et al.
Pubblicazione: (2026)
di: Pandey, Rohan, et al.
Pubblicazione: (2026)
The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents
di: Jia, Feiran, et al.
Pubblicazione: (2024)
di: Jia, Feiran, et al.
Pubblicazione: (2024)
Boosting Graph Robustness Against Backdoor Attacks: An Over-Similarity Perspective
di: Liu, Chang, et al.
Pubblicazione: (2025)
di: Liu, Chang, et al.
Pubblicazione: (2025)
Enhance Modality Robustness in Text-Centric Multimodal Alignment with Adversarial Prompting
di: Tsai, Yun-Da, et al.
Pubblicazione: (2024)
di: Tsai, Yun-Da, et al.
Pubblicazione: (2024)
Documenti analoghi
-
RAGPart & RAGMask: Retrieval-Stage Defenses Against Corpus Poisoning in Retrieval-Augmented Generation
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025) -
Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2026) -
PoisonedParrot: Subtle Data Poisoning Attacks to Elicit Copyright-Infringing Content from Large Language Models
di: Panaitescu-Liess, Michael-Andrei, et al.
Pubblicazione: (2025) -
Can Watermarking Large Language Models Prevent Copyrighted Text Generation and Hide Training Data?
di: Panaitescu-Liess, Michael-Andrei, et al.
Pubblicazione: (2024) -
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)