Online Statistical Inference of Constant Sample-averaged Q-Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Panda, Saunak Kumar, Li, Tong, Liu, Ruiqi, Xiang, Yisha |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dynamic resource matching in manufacturing using deep reinforcement learning
di: Panda, Saunak Kumar, et al.
Pubblicazione: (2026)
di: Panda, Saunak Kumar, et al.
Pubblicazione: (2026)
Higher-Order Equilibrium Tracking for EM-Compressible Online Estimation
di: Li, ZhiMing, et al.
Pubblicazione: (2026)
di: Li, ZhiMing, et al.
Pubblicazione: (2026)
Iterative Exploration-Driven Sparse SDP Clustering via Thompson Sampling
di: Mun, Jongmin, et al.
Pubblicazione: (2025)
di: Mun, Jongmin, et al.
Pubblicazione: (2025)
From Non-Identifiability to Goal-Integrated Decision-Making in Parametric Inverse Optimization
di: Ahmadi, Farzin, et al.
Pubblicazione: (2026)
di: Ahmadi, Farzin, et al.
Pubblicazione: (2026)
Machine Learning Algorithms for Improving Black Box Optimization Solvers
di: Kimiaei, Morteza, et al.
Pubblicazione: (2025)
di: Kimiaei, Morteza, et al.
Pubblicazione: (2025)
Dynamic Regularized CBDT: Variance-Calibrated Causal Boosting for Interpretable Heterogeneous Treatment Effects
di: Liu, Yichen
Pubblicazione: (2025)
di: Liu, Yichen
Pubblicazione: (2025)
Distribution-Free Uncertainty Quantification for Continuous AI Agent Evaluation
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
Is Causality Necessary for Efficient Portfolios? A Computational Perspective on Predictive Validity and Model Misspecification
di: Dominguez, Alejandro Rodriguez
Pubblicazione: (2025)
di: Dominguez, Alejandro Rodriguez
Pubblicazione: (2025)
Explainable Bayesian deep learning through input-skip Latent Binary Bayesian Neural Networks
di: Høyheim, Eirik, et al.
Pubblicazione: (2025)
di: Høyheim, Eirik, et al.
Pubblicazione: (2025)
Bayesian Generalized Nonlinear Models Offer Basis Free SINDy With Model Uncertainty
di: Hubin, Aliaksandr
Pubblicazione: (2025)
di: Hubin, Aliaksandr
Pubblicazione: (2025)
FBMS: An R Package for Flexible Bayesian Model Selection and Model Averaging
di: Frommlet, Florian, et al.
Pubblicazione: (2025)
di: Frommlet, Florian, et al.
Pubblicazione: (2025)
Efficient and Near-Optimal Online Portfolio Selection
di: Jézéquel, Rémi, et al.
Pubblicazione: (2022)
di: Jézéquel, Rémi, et al.
Pubblicazione: (2022)
Constant-Target Energy Matching: A Unified Framework for Continuous and Discrete Density Estimation
di: Zeng, Zhijun, et al.
Pubblicazione: (2026)
di: Zeng, Zhijun, et al.
Pubblicazione: (2026)
Sequential Monte Carlo Bandits
di: Urteaga, Iñigo, et al.
Pubblicazione: (2018)
di: Urteaga, Iñigo, et al.
Pubblicazione: (2018)
Proof-Carrying No-Arbitrage Surfaces: Constructive PCA-Smolyak Meets Chain-Consistent Diffusion with c-EMOT Certificates
di: Zhang, Jian'an
Pubblicazione: (2025)
di: Zhang, Jian'an
Pubblicazione: (2025)
Simplifying Hyperparameter Tuning in Online Machine Learning -- The spotRiverGUI
di: Bartz-Beielstein, Thomas
Pubblicazione: (2024)
di: Bartz-Beielstein, Thomas
Pubblicazione: (2024)
From Tail Universality to Bernstein-von Mises: A Unified Statistical Theory of Semi-Implicit Variational Inference
di: Plummer, Sean
Pubblicazione: (2025)
di: Plummer, Sean
Pubblicazione: (2025)
On-Average Stability of Multipass Preconditioned SGD and Effective Dimension
di: Vary, Simon, et al.
Pubblicazione: (2026)
di: Vary, Simon, et al.
Pubblicazione: (2026)
Semi-Supervised Learning guided by the Generalized Bayes Rule under Soft Revision
di: Dietrich, Stefan, et al.
Pubblicazione: (2024)
di: Dietrich, Stefan, et al.
Pubblicazione: (2024)
Bayesian Modeling of Collatz Stopping Times: A Probabilistic Machine Learning Perspective
di: Bonacorsi, Nicolò, et al.
Pubblicazione: (2026)
di: Bonacorsi, Nicolò, et al.
Pubblicazione: (2026)
Accelerated Dopant Screening in Oxide Semiconductors via Multi-Fidelity Contextual Bandits and a Three-Tier DFT Validation Funnel
di: Basu, Abhinaba
Pubblicazione: (2026)
di: Basu, Abhinaba
Pubblicazione: (2026)
Multi-Objective Optimization with Desirability and Morris-Mitchell Criterion
di: Bartz-Beielstein, Thomas, et al.
Pubblicazione: (2025)
di: Bartz-Beielstein, Thomas, et al.
Pubblicazione: (2025)
Accelerated Multi-objective Task Learning using Modified Q-learning Algorithm
di: Rajamohan, Varun Prakash, et al.
Pubblicazione: (2024)
di: Rajamohan, Varun Prakash, et al.
Pubblicazione: (2024)
Multi-Hypothesis Prediction for Portfolio Optimization: A Structured Ensemble Learning Approach to Risk Diversification
di: Dominguez, Alejandro Rodriguez, et al.
Pubblicazione: (2025)
di: Dominguez, Alejandro Rodriguez, et al.
Pubblicazione: (2025)
When to Trust Confidence Thresholding: Calibration Diagnostics for Pseudo-Labelled Regression
di: Kurbucz, Marcell T.
Pubblicazione: (2026)
di: Kurbucz, Marcell T.
Pubblicazione: (2026)
Amortized Variational Inference for Logistic Regression with Missing Covariates
di: Cherifi, M., et al.
Pubblicazione: (2026)
di: Cherifi, M., et al.
Pubblicazione: (2026)
SALE-Based Offline Reinforcement Learning with Ensemble Q-Networks
di: Chun, Zheng
Pubblicazione: (2025)
di: Chun, Zheng
Pubblicazione: (2025)
Model-based Bootstrap of Controlled Markov Chains
di: Su, Ziwei, et al.
Pubblicazione: (2026)
di: Su, Ziwei, et al.
Pubblicazione: (2026)
Bed-Attached Vibration Sensor System: A Machine Learning Approach for Fall Detection in Nursing Homes
di: Bartz-Beielstein, Thomas, et al.
Pubblicazione: (2024)
di: Bartz-Beielstein, Thomas, et al.
Pubblicazione: (2024)
A General Framework for Off-Policy Learning with Partially-Observed Reward
di: Takehi, Rikiya, et al.
Pubblicazione: (2025)
di: Takehi, Rikiya, et al.
Pubblicazione: (2025)
OML-AD: Online Machine Learning for Anomaly Detection in Time Series Data
di: Wette, Sebastian, et al.
Pubblicazione: (2024)
di: Wette, Sebastian, et al.
Pubblicazione: (2024)
Bayesian Conservative Policy Optimization (BCPO): A Novel Uncertainty-Calibrated Offline Reinforcement Learning with Credible Lower Bounds
di: Chatterjee, Debashis
Pubblicazione: (2026)
di: Chatterjee, Debashis
Pubblicazione: (2026)
Beyond Coordinates: Meta-Equivariance in Statistical Inference
di: Cook, William
Pubblicazione: (2025)
di: Cook, William
Pubblicazione: (2025)
Actor-Curator: Co-adaptive Curriculum Learning via Policy-Improvement Bandits for RL Post-Training
di: Gu, Zhengyao, et al.
Pubblicazione: (2026)
di: Gu, Zhengyao, et al.
Pubblicazione: (2026)
Explainable and Class-Revealing Signal Feature Extraction via Scattering Transform and Constrained Zeroth-Order Optimization
di: Saito, Naoki, et al.
Pubblicazione: (2025)
di: Saito, Naoki, et al.
Pubblicazione: (2025)
Non-Heuristic Selection via Hybrid Regularized and Machine Learning Models for Insurance
di: Galvão, Luciano Ribeiro, et al.
Pubblicazione: (2025)
di: Galvão, Luciano Ribeiro, et al.
Pubblicazione: (2025)
Adaptive Conditional Forest Sampling for Spectral Risk Optimisation under Decision-Dependent Uncertainty
di: Kurbucz, Marcell T.
Pubblicazione: (2026)
di: Kurbucz, Marcell T.
Pubblicazione: (2026)
A unified convergence theory for adaptive first-order methods in the nonconvex case, including AdaNorm, full and diagonal AdaGrad, Shampoo and Muo
di: Gratton, S., et al.
Pubblicazione: (2026)
di: Gratton, S., et al.
Pubblicazione: (2026)
Differentiable Optimization Layers for Guaranteed Fairness in Deep Learning
di: Troxell, David, et al.
Pubblicazione: (2026)
di: Troxell, David, et al.
Pubblicazione: (2026)
CDFlow: Building Invertible Layers with Circulant and Diagonal Matrices
di: Feng, Xuchen, et al.
Pubblicazione: (2025)
di: Feng, Xuchen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Dynamic resource matching in manufacturing using deep reinforcement learning
di: Panda, Saunak Kumar, et al.
Pubblicazione: (2026) -
Higher-Order Equilibrium Tracking for EM-Compressible Online Estimation
di: Li, ZhiMing, et al.
Pubblicazione: (2026) -
Iterative Exploration-Driven Sparse SDP Clustering via Thompson Sampling
di: Mun, Jongmin, et al.
Pubblicazione: (2025) -
From Non-Identifiability to Goal-Integrated Decision-Making in Parametric Inverse Optimization
di: Ahmadi, Farzin, et al.
Pubblicazione: (2026) -
Machine Learning Algorithms for Improving Black Box Optimization Solvers
di: Kimiaei, Morteza, et al.
Pubblicazione: (2025)