Confidential Guardian: Cryptographically Prohibiting the Abuse of Model Abstention
Fuente:
arXiv
Salvato in:
| Autori principali: | Rabanser, Stephan, Shamsabadi, Ali Shahin, Franzese, Olive, Wang, Xiao, Weller, Adrian, Papernot, Nicolas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Secure and Confidential Certificates of Online Fairness
di: Franzese, Olive, et al.
Pubblicazione: (2024)
di: Franzese, Olive, et al.
Pubblicazione: (2024)
Breach By A Thousand Leaks: Unsafe Information Leakage in `Safe' AI Responses
di: Glukhov, David, et al.
Pubblicazione: (2024)
di: Glukhov, David, et al.
Pubblicazione: (2024)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
Countering Autonomous Cyber Threats
di: Heckel, Kade M., et al.
Pubblicazione: (2024)
di: Heckel, Kade M., et al.
Pubblicazione: (2024)
Suitability Filter: A Statistical Framework for Classifier Evaluation in Real-World Deployment Settings
di: Pouget, Angéline, et al.
Pubblicazione: (2025)
di: Pouget, Angéline, et al.
Pubblicazione: (2025)
What Does It Take to Build a Performant Selective Classifier?
di: Rabanser, Stephan, et al.
Pubblicazione: (2025)
di: Rabanser, Stephan, et al.
Pubblicazione: (2025)
Efficient Public Verification of Private ML via Regularization
di: Bell, Zoë Ruha, et al.
Pubblicazione: (2025)
di: Bell, Zoë Ruha, et al.
Pubblicazione: (2025)
Have it your way: Individualized Privacy Assignment for DP-SGD
di: Boenisch, Franziska, et al.
Pubblicazione: (2023)
di: Boenisch, Franziska, et al.
Pubblicazione: (2023)
Fast Exact Unlearning for In-Context Learning Data for LLMs
di: Muresanu, Andrei I., et al.
Pubblicazione: (2024)
di: Muresanu, Andrei I., et al.
Pubblicazione: (2024)
Gradients Look Alike: Sensitivity is Often Overestimated in DP-SGD
di: Thudi, Anvith, et al.
Pubblicazione: (2023)
di: Thudi, Anvith, et al.
Pubblicazione: (2023)
Cryptographic Runtime Governance for Autonomous AI Systems: The Aegis Architecture for Verifiable Policy Enforcement
di: Mazzocchetti, Adam Massimo
Pubblicazione: (2026)
di: Mazzocchetti, Adam Massimo
Pubblicazione: (2026)
ExpProof : Operationalizing Explanations for Confidential Models with ZKPs
di: Yadav, Chhavi, et al.
Pubblicazione: (2025)
di: Yadav, Chhavi, et al.
Pubblicazione: (2025)
Backdoor Detection through Replicated Execution of Outsourced Training
di: Jia, Hengrui, et al.
Pubblicazione: (2025)
di: Jia, Hengrui, et al.
Pubblicazione: (2025)
FairProof : Confidential and Certifiable Fairness for Neural Networks
di: Yadav, Chhavi, et al.
Pubblicazione: (2024)
di: Yadav, Chhavi, et al.
Pubblicazione: (2024)
Secure Confidential Business Information When Sharing Machine Learning Models
di: Yang, Yunfan, et al.
Pubblicazione: (2025)
di: Yang, Yunfan, et al.
Pubblicazione: (2025)
A Middle Path for On-Premises LLM Deployment: Preserving Privacy Without Sacrificing Model Confidentiality
di: Huang, Hanbo, et al.
Pubblicazione: (2024)
di: Huang, Hanbo, et al.
Pubblicazione: (2024)
AgentGuardian: Learning Access Control Policies to Govern AI Agent Behavior
di: Abaev, Nadya, et al.
Pubblicazione: (2026)
di: Abaev, Nadya, et al.
Pubblicazione: (2026)
SoK: Enhancing Cryptographic Collaborative Learning with Differential Privacy
di: Capano, Francesco, et al.
Pubblicazione: (2026)
di: Capano, Francesco, et al.
Pubblicazione: (2026)
A Cryptographic Perspective on Mitigation vs. Detection in Machine Learning
di: Gluch, Greg, et al.
Pubblicazione: (2025)
di: Gluch, Greg, et al.
Pubblicazione: (2025)
PUFFLE: Balancing Privacy, Utility, and Fairness in Federated Learning
di: Corbucci, Luca, et al.
Pubblicazione: (2024)
di: Corbucci, Luca, et al.
Pubblicazione: (2024)
A Multiparty Homomorphic Encryption Approach to Confidential Federated Kaplan Meier Survival Analysis
di: Veeraragavan, Narasimha Raghavan, et al.
Pubblicazione: (2024)
di: Veeraragavan, Narasimha Raghavan, et al.
Pubblicazione: (2024)
Uncertainty-Driven Reliability: Selective Prediction and Trustworthy Deployment in Modern Machine Learning
di: Rabanser, Stephan
Pubblicazione: (2025)
di: Rabanser, Stephan
Pubblicazione: (2025)
NoEsis: Differentially Private Knowledge Transfer in Modular LLM Adaptation
di: Romijnders, Rob, et al.
Pubblicazione: (2025)
di: Romijnders, Rob, et al.
Pubblicazione: (2025)
Privacy-Preserving Data Sharing in Agriculture: Enforcing Policy Rules for Secure and Confidential Data Synthesis
di: Kotal, Anantaa, et al.
Pubblicazione: (2023)
di: Kotal, Anantaa, et al.
Pubblicazione: (2023)
CryptoScope: Utilizing Large Language Models for Automated Cryptographic Logic Vulnerability Detection
di: Li, Zhihao, et al.
Pubblicazione: (2025)
di: Li, Zhihao, et al.
Pubblicazione: (2025)
Trustless Audits without Revealing Data or Models
di: Waiwitlikhit, Suppakit, et al.
Pubblicazione: (2024)
di: Waiwitlikhit, Suppakit, et al.
Pubblicazione: (2024)
Robust Safety Monitoring of Language Models via Activation Watermarking
di: Aremu, Toluwani, et al.
Pubblicazione: (2026)
di: Aremu, Toluwani, et al.
Pubblicazione: (2026)
Automated Creation of Source Code Variants of a Cryptographic Hash Function Implementation Using Generative Pre-Trained Transformer Models
di: Pelofske, Elijah, et al.
Pubblicazione: (2024)
di: Pelofske, Elijah, et al.
Pubblicazione: (2024)
Making AI-Assisted Grant Evaluation Auditable without Exposing the Model
di: Bicakci, Kemal
Pubblicazione: (2026)
di: Bicakci, Kemal
Pubblicazione: (2026)
A Survey of Privacy-Preserving Model Explanations: Privacy Risks, Attacks, and Countermeasures
di: Nguyen, Thanh Tam, et al.
Pubblicazione: (2024)
di: Nguyen, Thanh Tam, et al.
Pubblicazione: (2024)
Privacy Bias in Language Models: A Contextual Integrity-based Auditing Metric
di: Shvartzshnaider, Yan, et al.
Pubblicazione: (2024)
di: Shvartzshnaider, Yan, et al.
Pubblicazione: (2024)
Knowledge Distillation-Based Model Extraction Attack using GAN-based Private Counterfactual Explanations
di: Ezzeddine, Fatima, et al.
Pubblicazione: (2024)
di: Ezzeddine, Fatima, et al.
Pubblicazione: (2024)
Language Models May Verbatim Complete Text They Were Not Explicitly Trained On
di: Liu, Ken Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ken Ziyu, et al.
Pubblicazione: (2025)
Benchmark Early and Red Team Often: A Framework for Assessing and Managing Dual-Use Hazards of AI Foundation Models
di: Barrett, Anthony M., et al.
Pubblicazione: (2024)
di: Barrett, Anthony M., et al.
Pubblicazione: (2024)
SoK: On the Offensive Potential of AI
di: Schröer, Saskia Laura, et al.
Pubblicazione: (2024)
di: Schröer, Saskia Laura, et al.
Pubblicazione: (2024)
Privacy-Preserving Decentralized AI with Confidential Computing
di: Lee, Dayeol, et al.
Pubblicazione: (2024)
di: Lee, Dayeol, et al.
Pubblicazione: (2024)
AbuseGPT: Abuse of Generative AI ChatBots to Create Smishing Campaigns
di: Shibli, Ashfak Md, et al.
Pubblicazione: (2024)
di: Shibli, Ashfak Md, et al.
Pubblicazione: (2024)
Distilled Large Language Model in Confidential Computing Environment for System-on-Chip Design
di: Ben, Dong, et al.
Pubblicazione: (2025)
di: Ben, Dong, et al.
Pubblicazione: (2025)
On the Weaknesses of Backdoor-based Model Watermarking: An Information-theoretic Perspective
di: Hu, Aoting, et al.
Pubblicazione: (2024)
di: Hu, Aoting, et al.
Pubblicazione: (2024)
Dstack: A Zero Trust Framework for Confidential Containers
di: Zhou, Shunfan, et al.
Pubblicazione: (2025)
di: Zhou, Shunfan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Secure and Confidential Certificates of Online Fairness
di: Franzese, Olive, et al.
Pubblicazione: (2024) -
Breach By A Thousand Leaks: Unsafe Information Leakage in `Safe' AI Responses
di: Glukhov, David, et al.
Pubblicazione: (2024) -
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
di: Chang, Hongyan, et al.
Pubblicazione: (2024) -
Countering Autonomous Cyber Threats
di: Heckel, Kade M., et al.
Pubblicazione: (2024) -
Suitability Filter: A Statistical Framework for Classifier Evaluation in Real-World Deployment Settings
di: Pouget, Angéline, et al.
Pubblicazione: (2025)