Balancing optimism and pessimism in offline-to-online learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sentenac, Flore, Lee, Ilbin, Szepesvari, Csaba |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Almost Free: Self-concordance in Natural Exponential Families and an Application to Bandits
par: Liu, Shuai, et autres
Publié: (2024)
par: Liu, Shuai, et autres
Publié: (2024)
Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence
par: György, András, et autres
Publié: (2025)
par: György, András, et autres
Publié: (2025)
Data-driven simulator of multi-animal behavior with unknown dynamics via offline and online reinforcement learning
par: Fujii, Keisuke, et autres
Publié: (2025)
par: Fujii, Keisuke, et autres
Publié: (2025)
Understanding the performance gap between online and offline alignment algorithms
par: Tang, Yunhao, et autres
Publié: (2024)
par: Tang, Yunhao, et autres
Publié: (2024)
To Believe or Not to Believe Your LLM
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
Causal prompting model-based offline reinforcement learning
par: Yu, Xuehui, et autres
Publié: (2024)
par: Yu, Xuehui, et autres
Publié: (2024)
Frontier LLMs Still Struggle with Simple Reasoning Tasks
par: Malek, Alan, et autres
Publié: (2025)
par: Malek, Alan, et autres
Publié: (2025)
Physics-informed offline reinforcement learning eliminates catastrophic fuel waste in maritime routing
par: Bora, Aniruddha, et autres
Publié: (2026)
par: Bora, Aniruddha, et autres
Publié: (2026)
Rethinking the Foundations for Continual Reinforcement Learning
par: Elelimy, Esraa, et autres
Publié: (2025)
par: Elelimy, Esraa, et autres
Publié: (2025)
Simple online learning with consistent oracle
par: Kozachinskiy, Alexander, et autres
Publié: (2023)
par: Kozachinskiy, Alexander, et autres
Publié: (2023)
Sharper Guarantees for Misspecified Kernelized Bandit Optimization
par: Maran, Davide, et autres
Publié: (2026)
par: Maran, Davide, et autres
Publié: (2026)
LoopBench: Discovering Emergent Symmetry Breaking Strategies with LLM Swarms
par: Parsaee, Ali, et autres
Publié: (2025)
par: Parsaee, Ali, et autres
Publié: (2025)
Rate optimal learning of equilibria from data
par: Freihaut, Till, et autres
Publié: (2025)
par: Freihaut, Till, et autres
Publié: (2025)
Rectifying Regression in Reinforcement Learning
par: Ayoub, Alex, et autres
Publié: (2025)
par: Ayoub, Alex, et autres
Publié: (2025)
An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints
par: Zhu, Jiahui, et autres
Publié: (2025)
par: Zhu, Jiahui, et autres
Publié: (2025)
Trajectory Data Suffices for Statistically Efficient Learning in Offline RL with Linear $q^π$-Realizability and Concentrability
par: Tkachuk, Volodymyr, et autres
Publié: (2024)
par: Tkachuk, Volodymyr, et autres
Publié: (2024)
Sharp analysis of linear ensemble sampling
par: Akhavan, Arya, et autres
Publié: (2026)
par: Akhavan, Arya, et autres
Publié: (2026)
Adaptive multiple optimal learning factors for neural network training
par: Challagundla, Jeshwanth
Publié: (2024)
par: Challagundla, Jeshwanth
Publié: (2024)
Asymptotic Midpoint Mixup for Margin Balancing and Moderate Broadening
par: Kim, Hoyong, et autres
Publié: (2024)
par: Kim, Hoyong, et autres
Publié: (2024)
Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs
par: Oh, Giyeong, et autres
Publié: (2026)
par: Oh, Giyeong, et autres
Publié: (2026)
Mitigating LLM Hallucinations via Conformal Abstention
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
Adaptive prediction theory combining offline and online learning
par: Li, Haizheng, et autres
Publié: (2025)
par: Li, Haizheng, et autres
Publié: (2025)
Sensor Calibration Model Balancing Accuracy, Real-time, and Efficiency
par: Yun, Jinyong, et autres
Publié: (2025)
par: Yun, Jinyong, et autres
Publié: (2025)
To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning
par: Lazić, Nevena, et autres
Publié: (2026)
par: Lazić, Nevena, et autres
Publié: (2026)
Ensemble sampling for linear bandits: small ensembles suffice
par: Janz, David, et autres
Publié: (2023)
par: Janz, David, et autres
Publié: (2023)
Confident Natural Policy Gradient for Local Planning in $q_π$-realizable Constrained MDPs
par: Tian, Tian, et autres
Publié: (2024)
par: Tian, Tian, et autres
Publié: (2024)
FIRE: Frobenius-Isometry Reinitialization for Balancing the Stability-Plasticity Tradeoff
par: Han, Isaac, et autres
Publié: (2026)
par: Han, Isaac, et autres
Publié: (2026)
Particle swarm optimization for online sparse streaming feature selection under uncertainty
par: Xu, Ruiyang
Publié: (2025)
par: Xu, Ruiyang
Publié: (2025)
Logic-informed reinforcement learning for cross-domain optimization of large-scale cyber-physical systems
par: Wan, Guangxi, et autres
Publié: (2025)
par: Wan, Guangxi, et autres
Publié: (2025)
BEAT: Balanced Frequency Adaptive Tuning for Long-Term Time-Series Forecasting
par: Li, Zhixuan, et autres
Publié: (2025)
par: Li, Zhixuan, et autres
Publié: (2025)
The Challenger: When Do New Data Sources Justify Switching Machine Learning Models?
par: Digalakis Jr, Vassilis, et autres
Publié: (2025)
par: Digalakis Jr, Vassilis, et autres
Publié: (2025)
Efficiency optimization of large-scale language models based on deep learning in natural language processing tasks
par: Mei, Taiyuan, et autres
Publié: (2024)
par: Mei, Taiyuan, et autres
Publié: (2024)
SparseBalance: Load-Balanced Long Context Training with Dynamic Sparse Attention
par: Xu, Hongtao, et autres
Publié: (2026)
par: Xu, Hongtao, et autres
Publié: (2026)
Lexicographic optimization-based approaches to learning a representative model for multi-criteria sorting with non-monotonic criteria
par: Zhang, Zhen, et autres
Publié: (2024)
par: Zhang, Zhen, et autres
Publié: (2024)
Counterfactual experience augmented off-policy reinforcement learning
par: Lee, Sunbowen, et autres
Publié: (2025)
par: Lee, Sunbowen, et autres
Publié: (2025)
Delayed homomorphic reinforcement learning for environments with delayed feedback
par: Lee, Jongsoo, et autres
Publié: (2026)
par: Lee, Jongsoo, et autres
Publié: (2026)
CUBE: Contrastive Understanding by Balanced Experiments
par: Kim, Dongseok, et autres
Publié: (2025)
par: Kim, Dongseok, et autres
Publié: (2025)
Dual-Balancing for Multi-Task Learning
par: Lin, Baijiong, et autres
Publié: (2023)
par: Lin, Baijiong, et autres
Publié: (2023)
Exploration via linearly perturbed loss minimisation
par: Janz, David, et autres
Publié: (2023)
par: Janz, David, et autres
Publié: (2023)
Exclusively Penalized Q-learning for Offline Reinforcement Learning
par: Yeom, Junghyuk, et autres
Publié: (2024)
par: Yeom, Junghyuk, et autres
Publié: (2024)
Documents similaires
-
Almost Free: Self-concordance in Natural Exponential Families and an Application to Bandits
par: Liu, Shuai, et autres
Publié: (2024) -
Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence
par: György, András, et autres
Publié: (2025) -
Data-driven simulator of multi-animal behavior with unknown dynamics via offline and online reinforcement learning
par: Fujii, Keisuke, et autres
Publié: (2025) -
Understanding the performance gap between online and offline alignment algorithms
par: Tang, Yunhao, et autres
Publié: (2024) -
To Believe or Not to Believe Your LLM
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)