Fooling SHAP with Output Shuffling Attacks
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Jun, Dasgupta, Aritra |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis
di: Thornton, Scott
Pubblicazione: (2026)
di: Thornton, Scott
Pubblicazione: (2026)
Near-Optimal Reinforcement Learning with Shuffle Differential Privacy
di: Bai, Shaojie, et al.
Pubblicazione: (2024)
di: Bai, Shaojie, et al.
Pubblicazione: (2024)
Differentially Private Block-wise Gradient Shuffle for Deep Learning
di: Zagardo, David
Pubblicazione: (2024)
di: Zagardo, David
Pubblicazione: (2024)
Detecting Cybersecurity Threats by Integrating Explainable AI with SHAP Interpretability and Strategic Data Sampling
di: Srisumrith, Norrakith, et al.
Pubblicazione: (2026)
di: Srisumrith, Norrakith, et al.
Pubblicazione: (2026)
A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos
di: Yao, Yang, et al.
Pubblicazione: (2025)
di: Yao, Yang, et al.
Pubblicazione: (2025)
Output Supervision Can Obfuscate the Chain of Thought
di: Drori, Jacob, et al.
Pubblicazione: (2025)
di: Drori, Jacob, et al.
Pubblicazione: (2025)
Untargeted Adversarial Attack on Knowledge Graph Embeddings
di: Zhao, Tianzhe, et al.
Pubblicazione: (2024)
di: Zhao, Tianzhe, et al.
Pubblicazione: (2024)
The Jailbreak Tax: How Useful are Your Jailbreak Outputs?
di: Nikolić, Kristina, et al.
Pubblicazione: (2025)
di: Nikolić, Kristina, et al.
Pubblicazione: (2025)
SoK: Benchmarking Poisoning Attacks and Defenses in Federated Learning
di: Zhang, Heyi, et al.
Pubblicazione: (2025)
di: Zhang, Heyi, et al.
Pubblicazione: (2025)
PLeak: Prompt Leaking Attacks against Large Language Model Applications
di: Hui, Bo, et al.
Pubblicazione: (2024)
di: Hui, Bo, et al.
Pubblicazione: (2024)
Differentially Private Synthetic Data Release for Topics API Outputs
di: Dick, Travis, et al.
Pubblicazione: (2025)
di: Dick, Travis, et al.
Pubblicazione: (2025)
Remote Rowhammer Attack using Adversarial Observations on Federated Learning Clients
di: Yuan, Jinsheng, et al.
Pubblicazione: (2025)
di: Yuan, Jinsheng, et al.
Pubblicazione: (2025)
Verification of Bit-Flip Attacks against Quantized Neural Networks
di: Zhang, Yedi, et al.
Pubblicazione: (2025)
di: Zhang, Yedi, et al.
Pubblicazione: (2025)
Crypto Miner Attack: GPU Remote Code Execution Attacks
di: Szabo, Ariel, et al.
Pubblicazione: (2025)
di: Szabo, Ariel, et al.
Pubblicazione: (2025)
SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains
di: Saiem, Bijoy Ahmed, et al.
Pubblicazione: (2024)
di: Saiem, Bijoy Ahmed, et al.
Pubblicazione: (2024)
Precise Extraction of Deep Learning Models via Side-Channel Attacks on Edge/Endpoint Devices
di: Lee, Younghan, et al.
Pubblicazione: (2024)
di: Lee, Younghan, et al.
Pubblicazione: (2024)
Privacy Auditing of Multi-domain Graph Pre-trained Model under Membership Inference Attacks
di: Luo, Jiayi, et al.
Pubblicazione: (2025)
di: Luo, Jiayi, et al.
Pubblicazione: (2025)
Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs
di: Yuan, Leitao, et al.
Pubblicazione: (2026)
di: Yuan, Leitao, et al.
Pubblicazione: (2026)
Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models
di: Guo, Qiming, et al.
Pubblicazione: (2025)
di: Guo, Qiming, et al.
Pubblicazione: (2025)
Heterogeneous Graph Backdoor Attack
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
SurvAttack: Black-Box Attack On Survival Models through Ontology-Informed EHR Perturbation
di: Kerdabadi, Mohsen Nayebi, et al.
Pubblicazione: (2024)
di: Kerdabadi, Mohsen Nayebi, et al.
Pubblicazione: (2024)
Adaptive Discounting of Training Time Attacks
di: Bector, Ridhima, et al.
Pubblicazione: (2024)
di: Bector, Ridhima, et al.
Pubblicazione: (2024)
Feature Inference Attack on Shapley Values
di: Luo, Xinjian, et al.
Pubblicazione: (2024)
di: Luo, Xinjian, et al.
Pubblicazione: (2024)
Attacks and Defenses Against LLM Fingerprinting
di: Kurian, Kevin, et al.
Pubblicazione: (2025)
di: Kurian, Kevin, et al.
Pubblicazione: (2025)
Membership Inference Attack with Partial Features
di: Wang, Xurun, et al.
Pubblicazione: (2025)
di: Wang, Xurun, et al.
Pubblicazione: (2025)
On Membership Inference Attacks in Knowledge Distillation
di: Cui, Ziyao, et al.
Pubblicazione: (2025)
di: Cui, Ziyao, et al.
Pubblicazione: (2025)
Compromising Embodied Agents with Contextual Backdoor Attacks
di: Liu, Aishan, et al.
Pubblicazione: (2024)
di: Liu, Aishan, et al.
Pubblicazione: (2024)
Optimal Defenses Against Gradient Reconstruction Attacks
di: Chen, Yuxiao, et al.
Pubblicazione: (2024)
di: Chen, Yuxiao, et al.
Pubblicazione: (2024)
Attribute Inference Attacks for Federated Regression Tasks
di: Diana, Francesco, et al.
Pubblicazione: (2024)
di: Diana, Francesco, et al.
Pubblicazione: (2024)
Relationship between Uncertainty in DNNs and Adversarial Attacks
di: Ogonna, Mabel, et al.
Pubblicazione: (2024)
di: Ogonna, Mabel, et al.
Pubblicazione: (2024)
Unlearning Inversion Attacks for Graph Neural Networks
di: Zhang, Jiahao, et al.
Pubblicazione: (2025)
di: Zhang, Jiahao, et al.
Pubblicazione: (2025)
Confidence Is All You Need for MI Attacks
di: Sinha, Abhishek, et al.
Pubblicazione: (2023)
di: Sinha, Abhishek, et al.
Pubblicazione: (2023)
An In-Depth Analysis of Cyber Attacks in Secured Platforms
di: Ozoh, Parick, et al.
Pubblicazione: (2025)
di: Ozoh, Parick, et al.
Pubblicazione: (2025)
Fair Finetuning Mitigates Distribution Inference Attacks
di: Naidu, Rakshit
Pubblicazione: (2026)
di: Naidu, Rakshit
Pubblicazione: (2026)
Attacking Byzantine Robust Aggregation in High Dimensions
di: Choudhary, Sarthak, et al.
Pubblicazione: (2023)
di: Choudhary, Sarthak, et al.
Pubblicazione: (2023)
On the Robustness of Bayesian Neural Networks to Adversarial Attacks
di: Bortolussi, Luca, et al.
Pubblicazione: (2022)
di: Bortolussi, Luca, et al.
Pubblicazione: (2022)
Adversarial Attacks on Transformers-Based Malware Detectors
di: Jakhotiya, Yash, et al.
Pubblicazione: (2022)
di: Jakhotiya, Yash, et al.
Pubblicazione: (2022)
Prompt Injection Attacks on Large Language Models in Oncology
di: Clusmann, Jan, et al.
Pubblicazione: (2024)
di: Clusmann, Jan, et al.
Pubblicazione: (2024)
Federated Learning Resilient to Byzantine Attacks and Data Heterogeneity
di: Zuo, Shiyuan, et al.
Pubblicazione: (2024)
di: Zuo, Shiyuan, et al.
Pubblicazione: (2024)
UIFV: Data Reconstruction Attack in Vertical Federated Learning
di: Yang, Jirui, et al.
Pubblicazione: (2024)
di: Yang, Jirui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis
di: Thornton, Scott
Pubblicazione: (2026) -
Near-Optimal Reinforcement Learning with Shuffle Differential Privacy
di: Bai, Shaojie, et al.
Pubblicazione: (2024) -
Differentially Private Block-wise Gradient Shuffle for Deep Learning
di: Zagardo, David
Pubblicazione: (2024) -
Detecting Cybersecurity Threats by Integrating Explainable AI with SHAP Interpretability and Strategic Data Sampling
di: Srisumrith, Norrakith, et al.
Pubblicazione: (2026) -
A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos
di: Yao, Yang, et al.
Pubblicazione: (2025)