Adaptive auditing of AI systems with anytime-valid guarantees
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Siyu, Vossler, Patrick, Sivaraman, Venkatesh, Mai, Yifan, Feng, Jean |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Statistical Inference for Optimal Transport Maps: Recent Advances and Perspectives
par: Balakrishnan, Sivaraman, et autres
Publié: (2025)
par: Balakrishnan, Sivaraman, et autres
Publié: (2025)
LLMs Judging LLMs: A Simplex Perspective
par: Vossler, Patrick, et autres
Publié: (2025)
par: Vossler, Patrick, et autres
Publié: (2025)
A comparative study of conformal prediction methods for valid uncertainty quantification in machine learning
par: Dewolf, Nicolas
Publié: (2024)
par: Dewolf, Nicolas
Publié: (2024)
Adaptive Sample Aggregation In Transfer Learning
par: Hanneke, Steve, et autres
Publié: (2024)
par: Hanneke, Steve, et autres
Publié: (2024)
Cross-regularization: Adaptive Model Complexity through Validation Gradients
par: Brito, Carlos Stein
Publié: (2025)
par: Brito, Carlos Stein
Publié: (2025)
Perturbative adaptive importance sampling for Bayesian LOO cross-validation
par: Chang, Joshua C, et autres
Publié: (2024)
par: Chang, Joshua C, et autres
Publié: (2024)
Diffusion Models and the Manifold Hypothesis: Log-Domain Smoothing is Geometry Adaptive
par: Farghly, Tyler, et autres
Publié: (2025)
par: Farghly, Tyler, et autres
Publié: (2025)
Provable Robust Overfitting Mitigation in Wasserstein Distributionally Robust Optimization
par: Liu, Shuang, et autres
Publié: (2025)
par: Liu, Shuang, et autres
Publié: (2025)
Generalizability of Neural Networks Minimizing Empirical Risk Based on Expressive Ability
par: Yu, Lijia, et autres
Publié: (2025)
par: Yu, Lijia, et autres
Publié: (2025)
Psychometric Tests for AI Agents and Their Moduli Space
par: Chojecki, Przemyslaw
Publié: (2025)
par: Chojecki, Przemyslaw
Publié: (2025)
Time-sensitive anytime-valid testing
par: Clerico, Eugenio, et autres
Publié: (2026)
par: Clerico, Eugenio, et autres
Publié: (2026)
Solving a Research Problem in Mathematical Statistics with AI Assistance
par: Dobriban, Edgar
Publié: (2025)
par: Dobriban, Edgar
Publié: (2025)
More Than "Means to an End": Supporting Reasoning with Transparently Designed AI Data Science Processes
par: Sivaraman, Venkatesh, et autres
Publié: (2026)
par: Sivaraman, Venkatesh, et autres
Publié: (2026)
Labels or Preferences? Budget-Constrained Learning with Human Judgments over AI-Generated Outputs
par: Dong, Zihan, et autres
Publié: (2026)
par: Dong, Zihan, et autres
Publié: (2026)
Learning with Differentially Private (Sliced) Wasserstein Gradients
par: Rodríguez-Vítores, David, et autres
Publié: (2025)
par: Rodríguez-Vítores, David, et autres
Publié: (2025)
Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality
par: Chen, Siyu, et autres
Publié: (2024)
par: Chen, Siyu, et autres
Publié: (2024)
Unveiling the Statistical Foundations of Chain-of-Thought Prompting Methods
par: Hu, Xinyang, et autres
Publié: (2024)
par: Hu, Xinyang, et autres
Publié: (2024)
Cost-optimal Sequential Testing via Doubly Robust Q-learning
par: Zhou, Doudou, et autres
Publié: (2026)
par: Zhou, Doudou, et autres
Publié: (2026)
Class conditional conformal prediction for multiple inputs by p-value aggregation
par: Fermanian, Jean-Baptiste, et autres
Publié: (2025)
par: Fermanian, Jean-Baptiste, et autres
Publié: (2025)
Optimism Stabilizes Thompson Sampling for Adaptive Inference
par: Yan, Shunxing, et autres
Publié: (2026)
par: Yan, Shunxing, et autres
Publié: (2026)
Evaluating LLMs When They Do Not Know the Answer: Statistical Evaluation of Mathematical Reasoning via Comparative Signals
par: Dong, Zihan, et autres
Publié: (2026)
par: Dong, Zihan, et autres
Publié: (2026)
Optimal rates for density and mode estimation with expand-and-sparsify representations
par: Sinha, Kaushik, et autres
Publié: (2026)
par: Sinha, Kaushik, et autres
Publié: (2026)
Identifiability of Potentially Degenerate Gaussian Mixture Models With Piecewise Affine Mixing
par: Xu, Danru, et autres
Publié: (2026)
par: Xu, Danru, et autres
Publié: (2026)
Generalization Properties of Score-matching Diffusion Models for Intrinsically Low-dimensional Data
par: Chakraborty, Saptarshi, et autres
Publié: (2026)
par: Chakraborty, Saptarshi, et autres
Publié: (2026)
A Fine-Grained Understanding of Uniform Convergence for Halfspaces
par: Kontorovich, Aryeh, et autres
Publié: (2026)
par: Kontorovich, Aryeh, et autres
Publié: (2026)
Finite-Particle Convergence Rates for Conservative and Non-Conservative Drifting Models
par: Balasubramanian, Krishnakumar
Publié: (2026)
par: Balasubramanian, Krishnakumar
Publié: (2026)
Low-Dimensional Adaptation of Rectified Flow: A Diffusion and Stochastic Localization Perspective
par: Roy, Saptarshi, et autres
Publié: (2026)
par: Roy, Saptarshi, et autres
Publié: (2026)
Ordinary Least Squares is a Special Case of Transformer
par: Tan, Xiaojun, et autres
Publié: (2026)
par: Tan, Xiaojun, et autres
Publié: (2026)
A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment
par: Yu, Hao
Publié: (2026)
par: Yu, Hao
Publié: (2026)
On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
par: Ji, Kaixuan, et autres
Publié: (2026)
par: Ji, Kaixuan, et autres
Publié: (2026)
Statistical inference with belief functions: A survey
par: Cuzzolin, Fabio
Publié: (2026)
par: Cuzzolin, Fabio
Publié: (2026)
Conformal Policy Control
par: Prinster, Drew, et autres
Publié: (2026)
par: Prinster, Drew, et autres
Publié: (2026)
Stein-Rule Shrinkage for Stochastic Gradient Estimation in High Dimensions
par: Arashi, M., et autres
Publié: (2026)
par: Arashi, M., et autres
Publié: (2026)
Can Generative Artificial Intelligence Survive Data Contamination? Theoretical Guarantees under Contaminated Recursive Training
par: Wang, Kevin, et autres
Publié: (2026)
par: Wang, Kevin, et autres
Publié: (2026)
Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
par: Ji, Kaixuan, et autres
Publié: (2026)
par: Ji, Kaixuan, et autres
Publié: (2026)
Chemical Reaction Networks Learn Better than Spiking Neural Networks
par: Jaffard, Sophie, et autres
Publié: (2026)
par: Jaffard, Sophie, et autres
Publié: (2026)
Total Variation Rates for Riemannian Flow Matching
par: Guan, Yunrui, et autres
Publié: (2026)
par: Guan, Yunrui, et autres
Publié: (2026)
LIBRA: Language Model Informed Bandit Recourse Algorithm for Personalized Treatment Planning
par: Cao, Junyu, et autres
Publié: (2026)
par: Cao, Junyu, et autres
Publié: (2026)
RACER: Risk-Aware Calibrated Efficient Routing for Large Language Models
par: Hao, Sai, et autres
Publié: (2026)
par: Hao, Sai, et autres
Publié: (2026)
A Diffusion Analysis of Policy Gradient for Stochastic Bandits
par: Lattimore, Tor
Publié: (2026)
par: Lattimore, Tor
Publié: (2026)
Documents similaires
-
Statistical Inference for Optimal Transport Maps: Recent Advances and Perspectives
par: Balakrishnan, Sivaraman, et autres
Publié: (2025) -
LLMs Judging LLMs: A Simplex Perspective
par: Vossler, Patrick, et autres
Publié: (2025) -
A comparative study of conformal prediction methods for valid uncertainty quantification in machine learning
par: Dewolf, Nicolas
Publié: (2024) -
Adaptive Sample Aggregation In Transfer Learning
par: Hanneke, Steve, et autres
Publié: (2024) -
Cross-regularization: Adaptive Model Complexity through Validation Gradients
par: Brito, Carlos Stein
Publié: (2025)