Can Generative Artificial Intelligence Survive Data Contamination? Theoretical Guarantees under Contaminated Recursive Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Kevin, Niu, Hongqian, Li, Didong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Understanding Overparametrization in Survival Models through Interpolation
par: Liu, Yin, et autres
Publié: (2025)
par: Liu, Yin, et autres
Publié: (2025)
Minimax Statistical Estimation under Wasserstein Contamination
par: Chao, Patrick, et autres
Publié: (2023)
par: Chao, Patrick, et autres
Publié: (2023)
On the Optimality of the Median-of-Means Estimator under Adversarial Contamination
par: de Juan, Xabier, et autres
Publié: (2025)
par: de Juan, Xabier, et autres
Publié: (2025)
On the Provable Performance Guarantee of Efficient Reasoning Models
par: Zeng, Hao, et autres
Publié: (2025)
par: Zeng, Hao, et autres
Publié: (2025)
Tail-Aware Information-Theoretic Generalization for RLHF and SGLD
par: Zhang, Huiming, et autres
Publié: (2026)
par: Zhang, Huiming, et autres
Publié: (2026)
Neural Networks Learn Generic Multi-Index Models Near Information-Theoretic Limit
par: Zhang, Bohan, et autres
Publié: (2025)
par: Zhang, Bohan, et autres
Publié: (2025)
A Computational Theory for Efficient Mini Agent Evaluation with Causal Guarantees
par: Yan, Hedong
Publié: (2025)
par: Yan, Hedong
Publié: (2025)
Training Implicit Generative Models via an Invariant Statistical Loss
par: de Frutos, José Manuel, et autres
Publié: (2024)
par: de Frutos, José Manuel, et autres
Publié: (2024)
From Data-Driven to Purpose-Driven Artificial Intelligence: Systems Thinking for Data-Analytic Automation of Patient Care
par: Anadria, Daniel, et autres
Publié: (2025)
par: Anadria, Daniel, et autres
Publié: (2025)
From Collapse to Improvement: Statistical Perspectives on the Evolutionary Dynamics of Iterative Training on Contaminated Sources
par: Bakshi, Soham, et autres
Publié: (2026)
par: Bakshi, Soham, et autres
Publié: (2026)
Neural Networks Generalize on Low Complexity Data
par: Chatterjee, Sourav, et autres
Publié: (2024)
par: Chatterjee, Sourav, et autres
Publié: (2024)
On the Statistical Properties of Generative Adversarial Models for Low Intrinsic Data Dimension
par: Chakraborty, Saptarshi, et autres
Publié: (2024)
par: Chakraborty, Saptarshi, et autres
Publié: (2024)
Heavy-tailed Contamination is Easier than Adversarial Contamination
par: Cherapanamjeri, Yeshwanth, et autres
Publié: (2024)
par: Cherapanamjeri, Yeshwanth, et autres
Publié: (2024)
O(d/T) Convergence Theory for Diffusion Probabilistic Models under Minimal Assumptions
par: Li, Gen, et autres
Publié: (2024)
par: Li, Gen, et autres
Publié: (2024)
Generalization Properties of Score-matching Diffusion Models for Intrinsically Low-dimensional Data
par: Chakraborty, Saptarshi, et autres
Publié: (2026)
par: Chakraborty, Saptarshi, et autres
Publié: (2026)
When Can We Reuse a Calibration Set for Multiple Conformal Predictions?
par: Balinsky, A. A., et autres
Publié: (2025)
par: Balinsky, A. A., et autres
Publié: (2025)
A Quantitative Characterization of Forgetting in Post-Training
par: Balasubramanian, Krishnakumar, et autres
Publié: (2026)
par: Balasubramanian, Krishnakumar, et autres
Publié: (2026)
Search-Time Data Contamination
par: Han, Ziwen, et autres
Publié: (2025)
par: Han, Ziwen, et autres
Publié: (2025)
Cyclic Counterfactuals under Shift-Scale Interventions
par: Saha, Saptarshi, et autres
Publié: (2025)
par: Saha, Saptarshi, et autres
Publié: (2025)
High-Dimensional Gaussian Mean Estimation under Realizable Contamination
par: Diakonikolas, Ilias, et autres
Publié: (2026)
par: Diakonikolas, Ilias, et autres
Publié: (2026)
Generalising realisability in statistical learning theory under epistemic uncertainty
par: Cuzzolin, Fabio
Publié: (2024)
par: Cuzzolin, Fabio
Publié: (2024)
Guaranteed Recovery of Unambiguous Clusters
par: Mazooji, Kayvon, et autres
Publié: (2025)
par: Mazooji, Kayvon, et autres
Publié: (2025)
Le Cam Distortion: A Decision-Theoretic Framework for Robust Transfer Learning
par: Akdemir, Deniz
Publié: (2025)
par: Akdemir, Deniz
Publié: (2025)
Towards Bayesian Data Selection
par: Rodemann, Julian
Publié: (2024)
par: Rodemann, Julian
Publié: (2024)
Anomaly Detection with Adaptive and Aggressive Rejection for Contaminated Training Data
par: Lee, Jungi, et autres
Publié: (2025)
par: Lee, Jungi, et autres
Publié: (2025)
Robust Sparse Estimation for Gaussians with Optimal Error under Huber Contamination
par: Diakonikolas, Ilias, et autres
Publié: (2024)
par: Diakonikolas, Ilias, et autres
Publié: (2024)
Deep Generative Models: Complexity, Dimensionality, and Approximation
par: Wang, Kevin, et autres
Publié: (2025)
par: Wang, Kevin, et autres
Publié: (2025)
Compression, Generalization and Learning
par: Campi, Marco C., et autres
Publié: (2023)
par: Campi, Marco C., et autres
Publié: (2023)
Scaling Laws in Linear Regression: Compute, Parameters, and Data
par: Lin, Licong, et autres
Publié: (2024)
par: Lin, Licong, et autres
Publié: (2024)
Convergence of Shallow ReLU Networks on Weakly Interacting Data
par: Dana, Léo, et autres
Publié: (2025)
par: Dana, Léo, et autres
Publié: (2025)
On the Statistical Capacity of Deep Generative Models
par: Tam, Edric, et autres
Publié: (2025)
par: Tam, Edric, et autres
Publié: (2025)
Maximizing the Potential of Synthetic Data: Insights from Random Matrix Theory
par: Firdoussi, Aymane El, et autres
Publié: (2024)
par: Firdoussi, Aymane El, et autres
Publié: (2024)
Generalization and Scaling Laws for Mixture-of-Experts Transformers
par: Mayaki, Mansour Zoubeirou a
Publié: (2026)
par: Mayaki, Mansour Zoubeirou a
Publié: (2026)
Counterfactual Generative Modeling with Variational Causal Inference
par: Wu, Yulun, et autres
Publié: (2024)
par: Wu, Yulun, et autres
Publié: (2024)
A Statistical Analysis of Deep Federated Learning for Intrinsically Low-dimensional Data
par: Chakraborty, Saptarshi, et autres
Publié: (2024)
par: Chakraborty, Saptarshi, et autres
Publié: (2024)
Improved Guarantees for Heterogeneous Treatment-Effect Estimation via Matrix Completion
par: Mehrotra, Anay, et autres
Publié: (2026)
par: Mehrotra, Anay, et autres
Publié: (2026)
A Theory of the Mechanics of Information: Generalization Through Measurement of Uncertainty (Learning is Measuring)
par: Hazard, Christopher J., et autres
Publié: (2025)
par: Hazard, Christopher J., et autres
Publié: (2025)
A Score-Based Density Formula, with Applications in Diffusion Generative Models
par: Li, Gen, et autres
Publié: (2024)
par: Li, Gen, et autres
Publié: (2024)
Labels or Preferences? Budget-Constrained Learning with Human Judgments over AI-Generated Outputs
par: Dong, Zihan, et autres
Publié: (2026)
par: Dong, Zihan, et autres
Publié: (2026)
U-Nets as Belief Propagation: Efficient Classification, Denoising, and Diffusion in Generative Hierarchical Models
par: Mei, Song
Publié: (2024)
par: Mei, Song
Publié: (2024)
Documents similaires
-
Understanding Overparametrization in Survival Models through Interpolation
par: Liu, Yin, et autres
Publié: (2025) -
Minimax Statistical Estimation under Wasserstein Contamination
par: Chao, Patrick, et autres
Publié: (2023) -
On the Optimality of the Median-of-Means Estimator under Adversarial Contamination
par: de Juan, Xabier, et autres
Publié: (2025) -
On the Provable Performance Guarantee of Efficient Reasoning Models
par: Zeng, Hao, et autres
Publié: (2025) -
Tail-Aware Information-Theoretic Generalization for RLHF and SGLD
par: Zhang, Huiming, et autres
Publié: (2026)