Gaming the Metric, Not the Harm: Certifying Safety Audits against Strategic Platform Manipulation
Fuente:
arXiv
Salvato in:
| Autori principali: | Burnat, Florian A. D., Davidson, Brittany I. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Differentially Private Auditing Under Strategic Response
di: Burnat, Florian A. D.
Pubblicazione: (2026)
di: Burnat, Florian A. D.
Pubblicazione: (2026)
Quotient Semivalues for False-Name-Resistant Data Attribution
di: Burnat, Florian A. D., et al.
Pubblicazione: (2026)
di: Burnat, Florian A. D., et al.
Pubblicazione: (2026)
A Benchmark for Strategic Auditee Gaming Under Continuous Compliance Monitoring
di: Burnat, Florian A. D., et al.
Pubblicazione: (2026)
di: Burnat, Florian A. D., et al.
Pubblicazione: (2026)
Auditing Privacy in Multi-Tenant RAG under Account Collusion
di: Burnat, Florian A. D.
Pubblicazione: (2026)
di: Burnat, Florian A. D.
Pubblicazione: (2026)
Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)
FairDP: Certified Fairness with Differential Privacy
di: Tran, Khang, et al.
Pubblicazione: (2023)
di: Tran, Khang, et al.
Pubblicazione: (2023)
Privacy Bias in Language Models: A Contextual Integrity-based Auditing Metric
di: Shvartzshnaider, Yan, et al.
Pubblicazione: (2024)
di: Shvartzshnaider, Yan, et al.
Pubblicazione: (2024)
Synthetic Artifact Auditing: Tracing LLM-Generated Synthetic Data Usage in Downstream Applications
di: Wu, Yixin, et al.
Pubblicazione: (2025)
di: Wu, Yixin, et al.
Pubblicazione: (2025)
Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects
di: Li, Na, et al.
Pubblicazione: (2024)
di: Li, Na, et al.
Pubblicazione: (2024)
Certifying LLM Safety against Adversarial Prompting
di: Kumar, Aounon, et al.
Pubblicazione: (2023)
di: Kumar, Aounon, et al.
Pubblicazione: (2023)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
di: An, Bang, et al.
Pubblicazione: (2024)
di: An, Bang, et al.
Pubblicazione: (2024)
"bot lane noob" Towards Deployment of NLP-based Toxicity Detectors in Video Games
di: Ave, Jonas, et al.
Pubblicazione: (2026)
di: Ave, Jonas, et al.
Pubblicazione: (2026)
Trustless Audits without Revealing Data or Models
di: Waiwitlikhit, Suppakit, et al.
Pubblicazione: (2024)
di: Waiwitlikhit, Suppakit, et al.
Pubblicazione: (2024)
Privacy Constrained Fairness Estimation for Decision Trees
di: van der Steen, Florian, et al.
Pubblicazione: (2023)
di: van der Steen, Florian, et al.
Pubblicazione: (2023)
Certifiably Robust RAG against Retrieval Corruption
di: Xiang, Chong, et al.
Pubblicazione: (2024)
di: Xiang, Chong, et al.
Pubblicazione: (2024)
Making AI-Assisted Grant Evaluation Auditable without Exposing the Model
di: Bicakci, Kemal
Pubblicazione: (2026)
di: Bicakci, Kemal
Pubblicazione: (2026)
Know Your Scientist: KYC as Biosecurity Infrastructure
di: Feldman, Jonathan, et al.
Pubblicazione: (2026)
di: Feldman, Jonathan, et al.
Pubblicazione: (2026)
SafeCOMM: A Study on Safety Degradation in Fine-Tuned Telecom Large Language Models
di: Djuhera, Aladin, et al.
Pubblicazione: (2025)
di: Djuhera, Aladin, et al.
Pubblicazione: (2025)
Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential
di: Akiri, Charankumar, et al.
Pubblicazione: (2025)
di: Akiri, Charankumar, et al.
Pubblicazione: (2025)
Pump and Dumps in the Bitcoin Era: Real Time Detection of Cryptocurrency Market Manipulations
di: La Morgia, Massimo, et al.
Pubblicazione: (2020)
di: La Morgia, Massimo, et al.
Pubblicazione: (2020)
Robust Safety Monitoring of Language Models via Activation Watermarking
di: Aremu, Toluwani, et al.
Pubblicazione: (2026)
di: Aremu, Toluwani, et al.
Pubblicazione: (2026)
Collective Certified Robustness against Graph Injection Attacks
di: Lai, Yuni, et al.
Pubblicazione: (2024)
di: Lai, Yuni, et al.
Pubblicazione: (2024)
Text-CRS: A Generalized Certified Robustness Framework against Textual Adversarial Attacks
di: Zhang, Xinyu, et al.
Pubblicazione: (2023)
di: Zhang, Xinyu, et al.
Pubblicazione: (2023)
CR-UTP: Certified Robustness against Universal Text Perturbations on Large Language Models
di: Lou, Qian, et al.
Pubblicazione: (2024)
di: Lou, Qian, et al.
Pubblicazione: (2024)
Towards a Systematic Risk Assessment of Deep Neural Network Limitations in Autonomous Driving Perception
di: Pavlitska, Svetlana, et al.
Pubblicazione: (2026)
di: Pavlitska, Svetlana, et al.
Pubblicazione: (2026)
Rethinking Anonymity Claims in Synthetic Data Generation: A Model-Centric Privacy Attack Perspective
di: Ganev, Georgi, et al.
Pubblicazione: (2026)
di: Ganev, Georgi, et al.
Pubblicazione: (2026)
Self-Sovereign Agent
di: Qu, Wenjie, et al.
Pubblicazione: (2026)
di: Qu, Wenjie, et al.
Pubblicazione: (2026)
FNDaaS: Content-agnostic Detection of Fake News sites
di: Papadopoulos, Panagiotis, et al.
Pubblicazione: (2022)
di: Papadopoulos, Panagiotis, et al.
Pubblicazione: (2022)
On the Impact of Multi-dimensional Local Differential Privacy on Fairness
di: Makhlouf, Karima, et al.
Pubblicazione: (2023)
di: Makhlouf, Karima, et al.
Pubblicazione: (2023)
LDPKiT: Superimposing Remote Queries for Privacy-Preserving Local Model Training
di: Li, Kexin, et al.
Pubblicazione: (2024)
di: Li, Kexin, et al.
Pubblicazione: (2024)
Position Paper: Assessing Robustness, Privacy, and Fairness in Federated Learning Integrated with Foundation Models
di: Wang, Jiaqi, et al.
Pubblicazione: (2024)
di: Wang, Jiaqi, et al.
Pubblicazione: (2024)
Sharing is CAIRing: Characterizing Principles and Assessing Properties of Universal Privacy Evaluation for Synthetic Tabular Data
di: Hyrup, Tobias, et al.
Pubblicazione: (2023)
di: Hyrup, Tobias, et al.
Pubblicazione: (2023)
Differentially Private Post-Processing for Fair Regression
di: Xian, Ruicheng, et al.
Pubblicazione: (2024)
di: Xian, Ruicheng, et al.
Pubblicazione: (2024)
Personalized Differential Privacy for Ridge Regression
di: Acharya, Krishna, et al.
Pubblicazione: (2024)
di: Acharya, Krishna, et al.
Pubblicazione: (2024)
Privacy-Preserving Data Linkage Across Private and Public Datasets for Collaborative Agriculture Research
di: Zafar, Osama, et al.
Pubblicazione: (2024)
di: Zafar, Osama, et al.
Pubblicazione: (2024)
Disparate Impact on Group Accuracy of Linearization for Private Inference
di: Das, Saswat, et al.
Pubblicazione: (2024)
di: Das, Saswat, et al.
Pubblicazione: (2024)
Minerva: A File-Based Ransomware Detector
di: Hitaj, Dorjan, et al.
Pubblicazione: (2023)
di: Hitaj, Dorjan, et al.
Pubblicazione: (2023)
Blameless Users in a Clean Room: Defining Copyright Protection for Generative Models
di: Cohen, Aloni
Pubblicazione: (2025)
di: Cohen, Aloni
Pubblicazione: (2025)
Privacy-Preserving Dataset Combination
di: Fuentes, Keren, et al.
Pubblicazione: (2025)
di: Fuentes, Keren, et al.
Pubblicazione: (2025)
Towards eco friendly cybersecurity: machine learning based anomaly detection with carbon and energy metrics
di: Aashish, KC, et al.
Pubblicazione: (2025)
di: Aashish, KC, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Differentially Private Auditing Under Strategic Response
di: Burnat, Florian A. D.
Pubblicazione: (2026) -
Quotient Semivalues for False-Name-Resistant Data Attribution
di: Burnat, Florian A. D., et al.
Pubblicazione: (2026) -
A Benchmark for Strategic Auditee Gaming Under Continuous Compliance Monitoring
di: Burnat, Florian A. D., et al.
Pubblicazione: (2026) -
Auditing Privacy in Multi-Tenant RAG under Account Collusion
di: Burnat, Florian A. D.
Pubblicazione: (2026) -
Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)