Sample Efficient Myopic Exploration Through Multitask Reinforcement Learning with Diverse Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Ziping, Xu, Zifan, Jiang, Runxuan, Stone, Peter, Tewari, Ambuj |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Primal-Dual Algorithm for Offline Constrained Reinforcement Learning with Linear MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
Near Optimal Pure Exploration in Logistic Bandits
di: Rivera, Eduardo Ochoa, et al.
Pubblicazione: (2024)
di: Rivera, Eduardo Ochoa, et al.
Pubblicazione: (2024)
If generative AI is the answer, what is the question?
di: Tewari, Ambuj
Pubblicazione: (2025)
di: Tewari, Ambuj
Pubblicazione: (2025)
Offline Constrained Reinforcement Learning under Partial Data Coverage
di: Ko, Seokmin, et al.
Pubblicazione: (2025)
di: Ko, Seokmin, et al.
Pubblicazione: (2025)
Operator Learning: A Statistical Perspective
di: Subedi, Unique, et al.
Pubblicazione: (2025)
di: Subedi, Unique, et al.
Pubblicazione: (2025)
On the Benefits of Active Data Collection in Operator Learning
di: Subedi, Unique, et al.
Pubblicazione: (2024)
di: Subedi, Unique, et al.
Pubblicazione: (2024)
Learning to Partially Defer for Sequences
di: Rayan, Sahana, et al.
Pubblicazione: (2025)
di: Rayan, Sahana, et al.
Pubblicazione: (2025)
A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2025)
di: Hong, Kihyuk, et al.
Pubblicazione: (2025)
Is Zero-Shot Super-Resolution Possible in Operator Learning?
di: Subedi, Unique, et al.
Pubblicazione: (2026)
di: Subedi, Unique, et al.
Pubblicazione: (2026)
Dexterous Legged Locomotion in Confined 3D Spaces with Reinforcement Learning
di: Xu, Zifan, et al.
Pubblicazione: (2024)
di: Xu, Zifan, et al.
Pubblicazione: (2024)
Controlling Statistical, Discretization, and Truncation Errors in Learning Fourier Linear Operators
di: Subedi, Unique, et al.
Pubblicazione: (2024)
di: Subedi, Unique, et al.
Pubblicazione: (2024)
On the Minimax Regret in Online Ranking with Top-k Feedback
di: Zhang, Mingyuan, et al.
Pubblicazione: (2023)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2023)
An Asymptotically Optimal Algorithm for the Convex Hull Membership Problem
di: Qiao, Gang, et al.
Pubblicazione: (2023)
di: Qiao, Gang, et al.
Pubblicazione: (2023)
Quantum Learning Theory Beyond Batch Binary Classification
di: Mohan, Preetham, et al.
Pubblicazione: (2023)
di: Mohan, Preetham, et al.
Pubblicazione: (2023)
Online Learning with Set-Valued Feedback
di: Raman, Vinod, et al.
Pubblicazione: (2023)
di: Raman, Vinod, et al.
Pubblicazione: (2023)
Distribution-Free Robust Predict-Then-Optimize in Function Spaces
di: Patel, Yash, et al.
Pubblicazione: (2026)
di: Patel, Yash, et al.
Pubblicazione: (2026)
Online Infinite-Dimensional Regression: Learning Linear Operators
di: Raman, Vinod, et al.
Pubblicazione: (2023)
di: Raman, Vinod, et al.
Pubblicazione: (2023)
Continuum Transformers Perform In-Context Learning by Operator Gradient Descent
di: Mishra, Abhiti, et al.
Pubblicazione: (2025)
di: Mishra, Abhiti, et al.
Pubblicazione: (2025)
Operator Learning for Schrödinger Equation: Unitarity, Error Bounds, and Time Generalization
di: Patel, Yash, et al.
Pubblicazione: (2025)
di: Patel, Yash, et al.
Pubblicazione: (2025)
Compute Aligned Training: Optimizing for Test Time Inference
di: Ousherovitch, Adam, et al.
Pubblicazione: (2026)
di: Ousherovitch, Adam, et al.
Pubblicazione: (2026)
On Next-Token Prediction in LLMs: How End Goals Determine the Consistency of Decoding Algorithms
di: Trauger, Jacob, et al.
Pubblicazione: (2025)
di: Trauger, Jacob, et al.
Pubblicazione: (2025)
Optimal Thresholding Linear Bandit
di: Rivera, Eduardo Ochoa, et al.
Pubblicazione: (2024)
di: Rivera, Eduardo Ochoa, et al.
Pubblicazione: (2024)
Online Conformal Prediction: Enforcing monotonicity via Online Optimization
di: Rivera, Eduardo Ochoa, et al.
Pubblicazione: (2026)
di: Rivera, Eduardo Ochoa, et al.
Pubblicazione: (2026)
Online Classification with Predictions
di: Raman, Vinod, et al.
Pubblicazione: (2024)
di: Raman, Vinod, et al.
Pubblicazione: (2024)
Generator-Mediated Bandits: Thompson Sampling for GenAI-Powered Adaptive Interventions
di: Brooks, Marc, et al.
Pubblicazione: (2025)
di: Brooks, Marc, et al.
Pubblicazione: (2025)
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
Generation through the lens of learning theory
di: Li, Jiaxun, et al.
Pubblicazione: (2024)
di: Li, Jiaxun, et al.
Pubblicazione: (2024)
The Complexity of Sequential Prediction in Dynamical Systems
di: Raman, Vinod, et al.
Pubblicazione: (2024)
di: Raman, Vinod, et al.
Pubblicazione: (2024)
Smoothed Online Classification can be Harder than Batch Classification
di: Raman, Vinod, et al.
Pubblicazione: (2024)
di: Raman, Vinod, et al.
Pubblicazione: (2024)
A Combinatorial Characterization of Supervised Online Learnability
di: Raman, Vinod, et al.
Pubblicazione: (2023)
di: Raman, Vinod, et al.
Pubblicazione: (2023)
A Characterization of Multioutput Learnability
di: Raman, Vinod, et al.
Pubblicazione: (2023)
di: Raman, Vinod, et al.
Pubblicazione: (2023)
On Generation in Metric Spaces
di: Li, Jiaxun, et al.
Pubblicazione: (2026)
di: Li, Jiaxun, et al.
Pubblicazione: (2026)
Characterizing the Multiclass Learnability of Forgiving 0-1 Loss Functions
di: Trauger, Jacob, et al.
Pubblicazione: (2025)
di: Trauger, Jacob, et al.
Pubblicazione: (2025)
A Greedy PDE Router for Blending Neural Operators and Classical Methods
di: Rayan, Sahana, et al.
Pubblicazione: (2025)
di: Rayan, Sahana, et al.
Pubblicazione: (2025)
Leveraging Offline Data in Linear Latent Contextual Bandits
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
On the Computational Complexity of Private High-dimensional Model Selection
di: Roy, Saptarshi, et al.
Pubblicazione: (2023)
di: Roy, Saptarshi, et al.
Pubblicazione: (2023)
Understanding Best Subset Selection: A Tale of Two C(omplex)ities
di: Roy, Saptarshi, et al.
Pubblicazione: (2023)
di: Roy, Saptarshi, et al.
Pubblicazione: (2023)
Latency-Aware Contextual Bandit: Application to Cryo-EM Data Collection
di: Wei, Lai, et al.
Pubblicazione: (2024)
di: Wei, Lai, et al.
Pubblicazione: (2024)
More Efficient Randomized Exploration for Reinforcement Learning via Approximate Sampling
di: Ishfaq, Haque, et al.
Pubblicazione: (2024)
di: Ishfaq, Haque, et al.
Pubblicazione: (2024)
Bandit Social Learning: Exploration under Myopic Behavior
di: Banihashem, Kiarash, et al.
Pubblicazione: (2023)
di: Banihashem, Kiarash, et al.
Pubblicazione: (2023)
Documenti analoghi
-
A Primal-Dual Algorithm for Offline Constrained Reinforcement Learning with Linear MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2024) -
Near Optimal Pure Exploration in Logistic Bandits
di: Rivera, Eduardo Ochoa, et al.
Pubblicazione: (2024) -
If generative AI is the answer, what is the question?
di: Tewari, Ambuj
Pubblicazione: (2025) -
Offline Constrained Reinforcement Learning under Partial Data Coverage
di: Ko, Seokmin, et al.
Pubblicazione: (2025) -
Operator Learning: A Statistical Perspective
di: Subedi, Unique, et al.
Pubblicazione: (2025)