Contract And Conquer: How to Provably Compute Adversarial Examples for a Black-Box Model?
Fuente:
arXiv
Salvato in:
| Autori principali: | Chistyakova, Anna, Pautov, Mikhail |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Model Mimic Attack: Knowledge Distillation for Provably Transferable Adversarial Examples
di: Lukyanov, Kirill, et al.
Pubblicazione: (2024)
di: Lukyanov, Kirill, et al.
Pubblicazione: (2024)
RandMark: On Random Watermarking of Visual Foundation Models
di: Chistyakova, Anna, et al.
Pubblicazione: (2026)
di: Chistyakova, Anna, et al.
Pubblicazione: (2026)
ActiveMark: on watermarking of visual foundation models via massive activations
di: Chistyakova, Anna, et al.
Pubblicazione: (2025)
di: Chistyakova, Anna, et al.
Pubblicazione: (2025)
GLiRA: Black-Box Membership Inference Attack via Knowledge Distillation
di: Galichin, Andrey V., et al.
Pubblicazione: (2024)
di: Galichin, Andrey V., et al.
Pubblicazione: (2024)
MemLoss: Enhancing Adversarial Training with Recycling Adversarial Examples
di: Mahdi, Soroush, et al.
Pubblicazione: (2025)
di: Mahdi, Soroush, et al.
Pubblicazione: (2025)
Towards Interpretable Adversarial Examples via Sparse Adversarial Attack
di: Lin, Fudong, et al.
Pubblicazione: (2025)
di: Lin, Fudong, et al.
Pubblicazione: (2025)
Adversarial Examples Might be Avoidable: The Role of Data Concentration in Adversarial Robustness
di: Pal, Ambar, et al.
Pubblicazione: (2023)
di: Pal, Ambar, et al.
Pubblicazione: (2023)
How to Train Your Advisor: Steering Black-Box LLMs with Advisor Models
di: Asawa, Parth, et al.
Pubblicazione: (2025)
di: Asawa, Parth, et al.
Pubblicazione: (2025)
Towards a Novel Perspective on Adversarial Examples Driven by Frequency
di: Zhang, Zhun, et al.
Pubblicazione: (2024)
di: Zhang, Zhun, et al.
Pubblicazione: (2024)
A New Type of Adversarial Examples
di: Nie, Xingyang, et al.
Pubblicazione: (2025)
di: Nie, Xingyang, et al.
Pubblicazione: (2025)
In Search of Trees: Decision-Tree Policy Synthesis for Black-Box Systems via Search
di: Demirović, Emir, et al.
Pubblicazione: (2024)
di: Demirović, Emir, et al.
Pubblicazione: (2024)
Counter-Samples: A Stateless Strategy to Neutralize Black Box Adversarial Attacks
di: Bokobza, Roey, et al.
Pubblicazione: (2024)
di: Bokobza, Roey, et al.
Pubblicazione: (2024)
Analyzing the Impact of Adversarial Examples on Explainable Machine Learning
di: Devabhakthini, Prathyusha, et al.
Pubblicazione: (2023)
di: Devabhakthini, Prathyusha, et al.
Pubblicazione: (2023)
Knowledgeable Language Models as Black-Box Optimizers for Personalized Medicine
di: Yao, Michael S., et al.
Pubblicazione: (2025)
di: Yao, Michael S., et al.
Pubblicazione: (2025)
Jailbreaking Black Box Large Language Models in Twenty Queries
di: Chao, Patrick, et al.
Pubblicazione: (2023)
di: Chao, Patrick, et al.
Pubblicazione: (2023)
Certifiable Black-Box Attacks with Randomized Adversarial Examples: Breaking Defenses with Provable Confidence
di: Hong, Hanbin, et al.
Pubblicazione: (2023)
di: Hong, Hanbin, et al.
Pubblicazione: (2023)
Sharpness-Aware Black-Box Optimization
di: Ye, Feiyang, et al.
Pubblicazione: (2024)
di: Ye, Feiyang, et al.
Pubblicazione: (2024)
Rethinking Adversarial Policies: A Generalized Attack Formulation and Provable Defense in RL
di: Liu, Xiangyu, et al.
Pubblicazione: (2023)
di: Liu, Xiangyu, et al.
Pubblicazione: (2023)
Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer
di: Liu, Zhihan, et al.
Pubblicazione: (2024)
di: Liu, Zhihan, et al.
Pubblicazione: (2024)
ExecTune: Effective Steering of Black-Box LLMs with Guide Models
di: Lingam, Vijay, et al.
Pubblicazione: (2026)
di: Lingam, Vijay, et al.
Pubblicazione: (2026)
Compute-Optimal LLMs Provably Generalize Better With Scale
di: Finzi, Marc, et al.
Pubblicazione: (2025)
di: Finzi, Marc, et al.
Pubblicazione: (2025)
FINCH: Locally Visualizing Higher-Order Feature Interactions in Black Box Models
di: Kleinau, Anna, et al.
Pubblicazione: (2025)
di: Kleinau, Anna, et al.
Pubblicazione: (2025)
Benchmarking Instance-Centric Counterfactual Algorithms for XAI: From White Box to Black Box
di: Moreira, Catarina, et al.
Pubblicazione: (2022)
di: Moreira, Catarina, et al.
Pubblicazione: (2022)
In-Context Black-Box Optimization with Unreliable Feedback
di: Blumer, Nicolas Samuel, et al.
Pubblicazione: (2026)
di: Blumer, Nicolas Samuel, et al.
Pubblicazione: (2026)
Generating Realistic Adversarial Examples for Business Processes using Variational Autoencoders
di: Stevens, Alexander, et al.
Pubblicazione: (2024)
di: Stevens, Alexander, et al.
Pubblicazione: (2024)
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
di: Ji, Xiang, et al.
Pubblicazione: (2024)
di: Ji, Xiang, et al.
Pubblicazione: (2024)
TRAP: Targeted Random Adversarial Prompt Honeypot for Black-Box Identification
di: Gubri, Martin, et al.
Pubblicazione: (2024)
di: Gubri, Martin, et al.
Pubblicazione: (2024)
ADBA:Approximation Decision Boundary Approach for Black-Box Adversarial Attacks
di: Wang, Feiyang, et al.
Pubblicazione: (2024)
di: Wang, Feiyang, et al.
Pubblicazione: (2024)
Revitalizing Black-Box Interpretability: Actionable Interpretability for LLMs via Proxy Models
di: Liu, Junhao, et al.
Pubblicazione: (2025)
di: Liu, Junhao, et al.
Pubblicazione: (2025)
Beyond Linear Surrogates: High-Fidelity Local Explanations for Black-Box Models
di: Shrestha, Sanjeev, et al.
Pubblicazione: (2025)
di: Shrestha, Sanjeev, et al.
Pubblicazione: (2025)
How to Protect Models against Adversarial Unlearning?
di: Jasiorski, Patryk, et al.
Pubblicazione: (2025)
di: Jasiorski, Patryk, et al.
Pubblicazione: (2025)
Robust Guided Diffusion for Offline Black-Box Optimization
di: Chen, Can Sam, et al.
Pubblicazione: (2024)
di: Chen, Can Sam, et al.
Pubblicazione: (2024)
Semantic Prototypes: Enhancing Transparency Without Black Boxes
di: Menis-Mastromichalakis, Orfeas, et al.
Pubblicazione: (2024)
di: Menis-Mastromichalakis, Orfeas, et al.
Pubblicazione: (2024)
OptunaHub: A Platform for Black-Box Optimization
di: Ozaki, Yoshihiko, et al.
Pubblicazione: (2025)
di: Ozaki, Yoshihiko, et al.
Pubblicazione: (2025)
An Adversarial Example for Direct Logit Attribution: Memory Management in GELU-4L
di: Janiak, Jett, et al.
Pubblicazione: (2023)
di: Janiak, Jett, et al.
Pubblicazione: (2023)
How to Provably Improve Return Conditioned Supervised Learning?
di: Liu, Zhishuai, et al.
Pubblicazione: (2025)
di: Liu, Zhishuai, et al.
Pubblicazione: (2025)
Black-Box Time-Series Domain Adaptation via Cross-Prompt Foundation Models
di: Furqon, M. T., et al.
Pubblicazione: (2025)
di: Furqon, M. T., et al.
Pubblicazione: (2025)
Optimizing the Unknown: Black Box Bayesian Optimization with Energy-Based Model and Reinforcement Learning
di: Miao, Ruiyao, et al.
Pubblicazione: (2025)
di: Miao, Ruiyao, et al.
Pubblicazione: (2025)
FAST: Feature Aware Similarity Thresholding for Weak Unlearning in Black-Box Generative Models
di: Panda, Subhodip, et al.
Pubblicazione: (2023)
di: Panda, Subhodip, et al.
Pubblicazione: (2023)
How Do Diffusion Models Improve Adversarial Robustness?
di: Yuezhang, Liu, et al.
Pubblicazione: (2025)
di: Yuezhang, Liu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Model Mimic Attack: Knowledge Distillation for Provably Transferable Adversarial Examples
di: Lukyanov, Kirill, et al.
Pubblicazione: (2024) -
RandMark: On Random Watermarking of Visual Foundation Models
di: Chistyakova, Anna, et al.
Pubblicazione: (2026) -
ActiveMark: on watermarking of visual foundation models via massive activations
di: Chistyakova, Anna, et al.
Pubblicazione: (2025) -
GLiRA: Black-Box Membership Inference Attack via Knowledge Distillation
di: Galichin, Andrey V., et al.
Pubblicazione: (2024) -
MemLoss: Enhancing Adversarial Training with Recycling Adversarial Examples
di: Mahdi, Soroush, et al.
Pubblicazione: (2025)