When Machine Learning Models Leak: An Exploration of Synthetic Training Data
Fuente:
arXiv
Guardado en:
| Autores principales: | Slokom, Manel, de Wolf, Peter-Paul, Larson, Martha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FedFlex: Federated Learning for Diverse Netflix Recommendations
por: Lankester, Sven, et al.
Publicado: (2025)
por: Lankester, Sven, et al.
Publicado: (2025)
From Zero to Hero: Detecting Leaked Data through Synthetic Data Injection and Model Querying
por: Wu, Biao, et al.
Publicado: (2023)
por: Wu, Biao, et al.
Publicado: (2023)
Curation Leaks: Membership Inference Attacks against Data Curation for Machine Learning
por: Wahdany, Dariush, et al.
Publicado: (2026)
por: Wahdany, Dariush, et al.
Publicado: (2026)
bioLeak: Leakage-Aware Modeling and Diagnostics for Machine Learning in R
por: Korkmaz, Selçuk
Publicado: (2026)
por: Korkmaz, Selçuk
Publicado: (2026)
Neural Emulator Superiority: When Machine Learning for PDEs Surpasses its Training Data
por: Koehler, Felix, et al.
Publicado: (2025)
por: Koehler, Felix, et al.
Publicado: (2025)
When Privacy Isn't Synthetic: Hidden Data Leakage in Generative AI Models
por: Mustaqim, S. M., et al.
Publicado: (2025)
por: Mustaqim, S. M., et al.
Publicado: (2025)
Beyond Centralization: User-Controlled Federated Recommendations in Practice
por: Slokom, Manel, et al.
Publicado: (2026)
por: Slokom, Manel, et al.
Publicado: (2026)
When Tables Leak: Attacking String Memorization in LLM-Based Tabular Data Generation
por: Ward, Joshua, et al.
Publicado: (2025)
por: Ward, Joshua, et al.
Publicado: (2025)
Synthetic Sandbox for Training Machine Learning Engineering Agents
por: Zhou, Yuhang, et al.
Publicado: (2026)
por: Zhou, Yuhang, et al.
Publicado: (2026)
Machine Learning for Synthetic Data Generation: A Review
por: Lu, Yingzhou, et al.
Publicado: (2023)
por: Lu, Yingzhou, et al.
Publicado: (2023)
Centered Masking for Language-Image Pre-Training
por: Liang, Mingliang, et al.
Publicado: (2024)
por: Liang, Mingliang, et al.
Publicado: (2024)
Defect Detection in Photolithographic Patterns Using Deep Learning Models Trained on Synthetic Data
por: Shinde, Prashant P., et al.
Publicado: (2025)
por: Shinde, Prashant P., et al.
Publicado: (2025)
The Challenger: When Do New Data Sources Justify Switching Machine Learning Models?
por: Digalakis Jr, Vassilis, et al.
Publicado: (2025)
por: Digalakis Jr, Vassilis, et al.
Publicado: (2025)
LLMDiRec: LLM-Enhanced Intent Diffusion for Sequential Recommendation
por: Chen, Bo-Chian, et al.
Publicado: (2025)
por: Chen, Bo-Chian, et al.
Publicado: (2025)
TMI! Finetuned Models Leak Private Information from their Pretraining Data
por: Abascal, John, et al.
Publicado: (2023)
por: Abascal, John, et al.
Publicado: (2023)
Hybrid Data can Enhance the Utility of Synthetic Data for Training Anti-Money Laundering Models
por: Chung, Rachel, et al.
Publicado: (2025)
por: Chung, Rachel, et al.
Publicado: (2025)
Less is More: Adaptive Coverage for Synthetic Training Data
por: Tavakkol, Sasan, et al.
Publicado: (2025)
por: Tavakkol, Sasan, et al.
Publicado: (2025)
Synthetic Augmentation in Imbalanced Learning: When It Helps, When It Hurts, and How Much to Add
por: Ma, Zhengchi, et al.
Publicado: (2026)
por: Ma, Zhengchi, et al.
Publicado: (2026)
Using Synthetic Data for Machine Learning-based Childhood Vaccination Prediction in Narok, Kenya
por: Bach, Jimmy, et al.
Publicado: (2026)
por: Bach, Jimmy, et al.
Publicado: (2026)
When to Stop Federated Learning: Zero-Shot Generation of Synthetic Validation Data with Generative AI for Early Stopping
por: Lee, Youngjoon, et al.
Publicado: (2025)
por: Lee, Youngjoon, et al.
Publicado: (2025)
MedLeak: Multimodal Medical Data Leakage in Secure Federated Learning with Crafted Models
por: Shi, Shanghao, et al.
Publicado: (2024)
por: Shi, Shanghao, et al.
Publicado: (2024)
Do Vision-Language Models Leak What They Learn? Adaptive Token-Weighted Model Inversion Attacks
por: Nguyen, Ngoc-Bao, et al.
Publicado: (2025)
por: Nguyen, Ngoc-Bao, et al.
Publicado: (2025)
Fairness Feedback Loops: Training on Synthetic Data Amplifies Bias
por: Wyllie, Sierra, et al.
Publicado: (2024)
por: Wyllie, Sierra, et al.
Publicado: (2024)
A Technical Exploration of Causal Inference with Hybrid LLM Synthetic Data
por: Kim, Dana, et al.
Publicado: (2025)
por: Kim, Dana, et al.
Publicado: (2025)
Novel Concept-Oriented Synthetic Data approach for Training Generative AI-Driven Crystal Grain Analysis Using Diffusion Model
por: Saleh, Ahmed Sobhi, et al.
Publicado: (2025)
por: Saleh, Ahmed Sobhi, et al.
Publicado: (2025)
Synthetic vs. Real Training Data for Visual Navigation
por: Suomela, Lauri, et al.
Publicado: (2025)
por: Suomela, Lauri, et al.
Publicado: (2025)
When Data Is Scarce: Scaling Sparse Language Models with Repeated Training
por: Wu, Boqian, et al.
Publicado: (2026)
por: Wu, Boqian, et al.
Publicado: (2026)
Data Pipeline Training: Integrating AutoML to Optimize the Data Flow of Machine Learning Models
por: Wu, Jiang, et al.
Publicado: (2024)
por: Wu, Jiang, et al.
Publicado: (2024)
From Data Leak to Secret Misses: The Impact of Data Leakage on Secret Detection Models
por: Soltaniani, Farnaz, et al.
Publicado: (2026)
por: Soltaniani, Farnaz, et al.
Publicado: (2026)
Can Moran Eigenvectors Improve Machine Learning of Spatial Data? Insights from Synthetic Data Validation
por: Li, Ziqi, et al.
Publicado: (2025)
por: Li, Ziqi, et al.
Publicado: (2025)
Quantamination: Dynamic Quantization Leaks Your Data Across the Batch
por: Foerster, Hanna, et al.
Publicado: (2026)
por: Foerster, Hanna, et al.
Publicado: (2026)
Explanations Leak: Membership Inference with Differential Privacy and Active Learning Defense
por: Ezzeddine, Fatima, et al.
Publicado: (2026)
por: Ezzeddine, Fatima, et al.
Publicado: (2026)
Exploration and Evaluation of Bias in Cyberbullying Detection with Machine Learning
por: Root, Andrew, et al.
Publicado: (2024)
por: Root, Andrew, et al.
Publicado: (2024)
Exoplanet Detection Using Machine Learning Models Trained on Synthetic Light Curves
por: Lo, Ethan, et al.
Publicado: (2025)
por: Lo, Ethan, et al.
Publicado: (2025)
Synthetic Survival Control: Extending Synthetic Controls for "When-If" Decision
por: Han, Jessy Xinyi, et al.
Publicado: (2025)
por: Han, Jessy Xinyi, et al.
Publicado: (2025)
Attesting Distributional Properties of Training Data for Machine Learning
por: Duddu, Vasisht, et al.
Publicado: (2023)
por: Duddu, Vasisht, et al.
Publicado: (2023)
Training Machine Learning Models on Human Spatio-temporal Mobility Data: An Experimental Study [Experiment Paper]
por: Liu, Yueyang, et al.
Publicado: (2025)
por: Liu, Yueyang, et al.
Publicado: (2025)
Does Training on Synthetic Data Make Models Less Robust?
por: Zhang, Lingze, et al.
Publicado: (2025)
por: Zhang, Lingze, et al.
Publicado: (2025)
How to Diversify any Personalized Recommender?
por: Slokom, Manel, et al.
Publicado: (2024)
por: Slokom, Manel, et al.
Publicado: (2024)
Systematic Evaluation of Synthetic Data Augmentation for Multi-class NetFlow Traffic
por: Wolf, Maximilian, et al.
Publicado: (2024)
por: Wolf, Maximilian, et al.
Publicado: (2024)
Ejemplares similares
-
FedFlex: Federated Learning for Diverse Netflix Recommendations
por: Lankester, Sven, et al.
Publicado: (2025) -
From Zero to Hero: Detecting Leaked Data through Synthetic Data Injection and Model Querying
por: Wu, Biao, et al.
Publicado: (2023) -
Curation Leaks: Membership Inference Attacks against Data Curation for Machine Learning
por: Wahdany, Dariush, et al.
Publicado: (2026) -
bioLeak: Leakage-Aware Modeling and Diagnostics for Machine Learning in R
por: Korkmaz, Selçuk
Publicado: (2026) -
Neural Emulator Superiority: When Machine Learning for PDEs Surpasses its Training Data
por: Koehler, Felix, et al.
Publicado: (2025)