Enregistré dans:
| Auteurs principaux: | Zhang, Haochen, Zheng, Zhong, Xue, Lingzhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.02859 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Gap-Dependent Bounds for Q-Learning using Reference-Advantage Decomposition
par: Zheng, Zhong, et autres
Publié: (2024)
par: Zheng, Zhong, et autres
Publié: (2024)
Q-Learning with Fine-Grained Gap-Dependent Regret
par: Zhang, Haochen, et autres
Publié: (2025)
par: Zhang, Haochen, et autres
Publié: (2025)
Gap-Dependent Bounds for Nearly Minimax Optimal Reinforcement Learning with Linear Function Approximation
par: Zhang, Haochen, et autres
Publié: (2026)
par: Zhang, Haochen, et autres
Publié: (2026)
Regret-Optimal Q-Learning with Low Cost for Single-Agent and Federated Reinforcement Learning
par: Zhang, Haochen, et autres
Publié: (2025)
par: Zhang, Haochen, et autres
Publié: (2025)
Federated Q-Learning with Reference-Advantage Decomposition: Almost Optimal Regret and Logarithmic Communication Cost
par: Zheng, Zhong, et autres
Publié: (2024)
par: Zheng, Zhong, et autres
Publié: (2024)
Federated Q-Learning: Linear Regret Speedup with Low Communication Cost
par: Zheng, Zhong, et autres
Publié: (2023)
par: Zheng, Zhong, et autres
Publié: (2023)
Smoothed Robust Phase Retrieval
par: Zheng, Zhong, et autres
Publié: (2024)
par: Zheng, Zhong, et autres
Publié: (2024)
A New Inexact Proximal Linear Algorithm with Adaptive Stopping Criteria for Robust Phase Retrieval
par: Zheng, Zhong, et autres
Publié: (2023)
par: Zheng, Zhong, et autres
Publié: (2023)
A Unified Combination Framework for Dependent Tests with Applications to Microbiome Association Studies
par: Yu, Xiufan, et autres
Publié: (2024)
par: Yu, Xiufan, et autres
Publié: (2024)
A Copula Graphical Model for Multi-Attribute Data using Optimal Transport
par: Zhang, Qi, et autres
Publié: (2024)
par: Zhang, Qi, et autres
Publié: (2024)
EXACT: Explicit Attribute-Guided Decoding-Time Personalization
par: Yu, Xin, et autres
Publié: (2026)
par: Yu, Xin, et autres
Publié: (2026)
AltLoRA: Towards Better Gradient Approximation in Low-Rank Adaptation with Alternating Projections
par: Yu, Xin, et autres
Publié: (2025)
par: Yu, Xin, et autres
Publié: (2025)
Understanding the Statistical Accuracy-Communication Trade-off in Personalized Federated Learning with Minimax Guarantees
par: Yu, Xin, et autres
Publié: (2024)
par: Yu, Xin, et autres
Publié: (2024)
Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs
par: Chen, Shulun, et autres
Publié: (2025)
par: Chen, Shulun, et autres
Publié: (2025)
Distributed Networked Multi-task Learning
par: Hong, Lingzhou, et autres
Publié: (2024)
par: Hong, Lingzhou, et autres
Publié: (2024)
Strongly Consistent Community Detection in Popularity Adjusted Block Models
par: Yuan, Quan, et autres
Publié: (2025)
par: Yuan, Quan, et autres
Publié: (2025)
Hypothesis Testing for High-Dimensional Matrix-Valued Data
par: Cui, Shijie, et autres
Publié: (2024)
par: Cui, Shijie, et autres
Publié: (2024)
Structure-Preserving Nonlinear Sufficient Dimension Reduction for Tensors
par: Lin, Dianjun, et autres
Publié: (2025)
par: Lin, Dianjun, et autres
Publié: (2025)
Doubly robust estimation of causal effects for random object outcomes with continuous treatments
par: Bhattacharjee, Satarupa, et autres
Publié: (2025)
par: Bhattacharjee, Satarupa, et autres
Publié: (2025)
Support Basis: Fast Attention Beyond Bounded Entries
par: Aliakbarpour, Maryam, et autres
Publié: (2025)
par: Aliakbarpour, Maryam, et autres
Publié: (2025)
Statistical Convergence Rates of Optimal Transport Map Estimation between General Distributions
par: Ding, Yizhe, et autres
Publié: (2024)
par: Ding, Yizhe, et autres
Publié: (2024)
PrunedLoRA: Robust Gradient-Based structured pruning for Low-rank Adaptation in Fine-tuning
par: Yu, Xin, et autres
Publié: (2025)
par: Yu, Xin, et autres
Publié: (2025)
Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization
par: Yu, Xin, et autres
Publié: (2026)
par: Yu, Xin, et autres
Publié: (2026)
A Finite Sample Complexity Bound for Distributionally Robust Q-learning
par: Wang, Shengbo, et autres
Publié: (2023)
par: Wang, Shengbo, et autres
Publié: (2023)
Q-Distribution guided Q-learning for offline reinforcement learning: Uncertainty penalized Q-value via consistency model
par: Zhang, Jing, et autres
Publié: (2024)
par: Zhang, Jing, et autres
Publié: (2024)
HAVER: Instance-Dependent Error Bounds for Maximum Mean Estimation and Applications to Q-Learning and Monte Carlo Tree Search
par: Nguyen, Tuan Ngo, et autres
Publié: (2024)
par: Nguyen, Tuan Ngo, et autres
Publié: (2024)
Regularized Q-learning
par: Lim, Han-Dong, et autres
Publié: (2022)
par: Lim, Han-Dong, et autres
Publié: (2022)
HyperQ-Opt: Q-learning for Hyperparameter Optimization
par: Hasan, Md. Tarek
Publié: (2024)
par: Hasan, Md. Tarek
Publié: (2024)
The Bounds of Algorithmic Collusion; $Q$-learning, Gradient Learning, and the Folk Theorem
par: Askenazi-Golan, Galit, et autres
Publié: (2024)
par: Askenazi-Golan, Galit, et autres
Publié: (2024)
DualOptim: Enhancing Efficacy and Stability in Machine Unlearning with Dual Optimizers
par: Zhong, Xuyang, et autres
Publié: (2025)
par: Zhong, Xuyang, et autres
Publié: (2025)
Transfer Q-learning
par: Chen, Elynn, et autres
Publié: (2022)
par: Chen, Elynn, et autres
Publié: (2022)
Q-learning with Posterior Sampling
par: Agrawal, Priyank, et autres
Publié: (2025)
par: Agrawal, Priyank, et autres
Publié: (2025)
An Efficient Gradient-Aware Error-Bounded Lossy Compressor for Federated Learning
par: Ye, Zhijing, et autres
Publié: (2025)
par: Ye, Zhijing, et autres
Publié: (2025)
Plug-and-Play Parameter-Efficient Tuning of Embeddings for Federated Recommendation
par: Yuan, Haochen, et autres
Publié: (2025)
par: Yuan, Haochen, et autres
Publié: (2025)
Generalisation in Multitask Fitted Q-Iteration and Offline Q-learning
par: Manda, Kausthubh, et autres
Publié: (2025)
par: Manda, Kausthubh, et autres
Publié: (2025)
Boosting Soft Q-Learning by Bounding
par: Adamczyk, Jacob, et autres
Publié: (2024)
par: Adamczyk, Jacob, et autres
Publié: (2024)
Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization
par: Lei, Xing, et autres
Publié: (2025)
par: Lei, Xing, et autres
Publié: (2025)
Tight Bounds for Jensen's Gap with Applications to Variational Inference
par: Mazur, Marcin, et autres
Publié: (2025)
par: Mazur, Marcin, et autres
Publié: (2025)
Review of deep learning models for crypto price prediction: implementation and evaluation
par: Wu, Jingyang, et autres
Publié: (2024)
par: Wu, Jingyang, et autres
Publié: (2024)
Q-learning as a monotone scheme
par: Yang, Lingyi
Publié: (2024)
par: Yang, Lingyi
Publié: (2024)
Documents similaires
-
Gap-Dependent Bounds for Q-Learning using Reference-Advantage Decomposition
par: Zheng, Zhong, et autres
Publié: (2024) -
Q-Learning with Fine-Grained Gap-Dependent Regret
par: Zhang, Haochen, et autres
Publié: (2025) -
Gap-Dependent Bounds for Nearly Minimax Optimal Reinforcement Learning with Linear Function Approximation
par: Zhang, Haochen, et autres
Publié: (2026) -
Regret-Optimal Q-Learning with Low Cost for Single-Agent and Federated Reinforcement Learning
par: Zhang, Haochen, et autres
Publié: (2025) -
Federated Q-Learning with Reference-Advantage Decomposition: Almost Optimal Regret and Logarithmic Communication Cost
par: Zheng, Zhong, et autres
Publié: (2024)