Commit to the Bit: Reactive Reinforcement Learning Done Right
Fuente:
arXiv
Salvato in:
| Autori principali: | Eberhard, Onno, Vernade, Claire, Muehlebach, Michael |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Partially Observable Reinforcement Learning with Memory Traces
di: Eberhard, Onno, et al.
Pubblicazione: (2025)
di: Eberhard, Onno, et al.
Pubblicazione: (2025)
A Pontryagin Perspective on Reinforcement Learning
di: Eberhard, Onno, et al.
Pubblicazione: (2024)
di: Eberhard, Onno, et al.
Pubblicazione: (2024)
Quantization-Free Autoregressive Action Transformer
di: Sheebaelhamd, Ziyad, et al.
Pubblicazione: (2025)
di: Sheebaelhamd, Ziyad, et al.
Pubblicazione: (2025)
Why Linear Recurrent Memory Works in Partially Observable Reinforcement Learning
di: Zhao, Yike, et al.
Pubblicazione: (2026)
di: Zhao, Yike, et al.
Pubblicazione: (2026)
Tight Sample Complexity Bounds for Entropic Best Policy Identification
di: Essakine, Amer, et al.
Pubblicazione: (2026)
di: Essakine, Amer, et al.
Pubblicazione: (2026)
Non-Stationary Lipschitz Bandits
di: Nguyen, Nicolas, et al.
Pubblicazione: (2025)
di: Nguyen, Nicolas, et al.
Pubblicazione: (2025)
Dr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generations
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
Put CASH on Bandits: A Max K-Armed Problem for Automated Machine Learning
di: Balef, Amir Rezaei, et al.
Pubblicazione: (2025)
di: Balef, Amir Rezaei, et al.
Pubblicazione: (2025)
Variational Bayes Portfolio Construction
di: Nguyen, Nicolas, et al.
Pubblicazione: (2024)
di: Nguyen, Nicolas, et al.
Pubblicazione: (2024)
The Sample Complexity of Online Reinforcement Learning: A Multi-model Perspective
di: Muehlebach, Michael, et al.
Pubblicazione: (2025)
di: Muehlebach, Michael, et al.
Pubblicazione: (2025)
Split the Differences, Pool the Rest: Provably Efficient Multi-Objective Imitation
di: Sheebaelhamd, Ziyad, et al.
Pubblicazione: (2026)
di: Sheebaelhamd, Ziyad, et al.
Pubblicazione: (2026)
Prior-Dependent Allocations for Bayesian Fixed-Budget Best-Arm Identification in Structured Bandits
di: Nguyen, Nicolas, et al.
Pubblicazione: (2024)
di: Nguyen, Nicolas, et al.
Pubblicazione: (2024)
Online Decision Deferral under Budget Constraints
di: Reid, Mirabel, et al.
Pubblicazione: (2024)
di: Reid, Mirabel, et al.
Pubblicazione: (2024)
Stochastic Gradient Descent for Gaussian Processes Done Right
di: Lin, Jihao Andreas, et al.
Pubblicazione: (2023)
di: Lin, Jihao Andreas, et al.
Pubblicazione: (2023)
Inverse Q-Learning Done Right: Offline Imitation Learning in $Q^π$-Realizable MDPs
di: Moulin, Antoine, et al.
Pubblicazione: (2025)
di: Moulin, Antoine, et al.
Pubblicazione: (2025)
Elastic Weight Consolidation Done Right for Continual Learning
di: Liu, Xuan, et al.
Pubblicazione: (2026)
di: Liu, Xuan, et al.
Pubblicazione: (2026)
MoRight: Motion Control Done Right
di: Liu, Shaowei, et al.
Pubblicazione: (2026)
di: Liu, Shaowei, et al.
Pubblicazione: (2026)
Test-Time Training Done Right
di: Zhang, Tianyuan, et al.
Pubblicazione: (2025)
di: Zhang, Tianyuan, et al.
Pubblicazione: (2025)
Clustered KL-barycenter design for policy evaluation
di: Weissmann, Simon, et al.
Pubblicazione: (2025)
di: Weissmann, Simon, et al.
Pubblicazione: (2025)
Contrastive Predictive Coding Done Right for Mutual Information Estimation
di: Ryu, J. Jon, et al.
Pubblicazione: (2025)
di: Ryu, J. Jon, et al.
Pubblicazione: (2025)
Controlling Participation in Federated Learning with Feedback
di: Cummins, Michael, et al.
Pubblicazione: (2024)
di: Cummins, Michael, et al.
Pubblicazione: (2024)
Efficient Risk-sensitive Planning via Entropic Risk Measures
di: Marthe, Alexandre, et al.
Pubblicazione: (2025)
di: Marthe, Alexandre, et al.
Pubblicazione: (2025)
AutoEval Done Right: Using Synthetic Data for Model Evaluation
di: Boyeau, Pierre, et al.
Pubblicazione: (2024)
di: Boyeau, Pierre, et al.
Pubblicazione: (2024)
Middle-mile logistics through the lens of goal-conditioned reinforcement learning
di: Eberhard, Onno, et al.
Pubblicazione: (2026)
di: Eberhard, Onno, et al.
Pubblicazione: (2026)
Distributed Event-Based Learning via ADMM
di: Er, Guner Dilsad, et al.
Pubblicazione: (2024)
di: Er, Guner Dilsad, et al.
Pubblicazione: (2024)
Randomized Antipodal Search Done Right for Data Pareto Improvement of LLM Unlearning
di: Liu, Ziwen, et al.
Pubblicazione: (2026)
di: Liu, Ziwen, et al.
Pubblicazione: (2026)
On Constraints in First-Order Optimization: A View from Non-Smooth Dynamical Systems
di: Muehlebach, Michael, et al.
Pubblicazione: (2021)
di: Muehlebach, Michael, et al.
Pubblicazione: (2021)
Accelerated First-Order Optimization under Nonlinear Constraints
di: Muehlebach, Michael, et al.
Pubblicazione: (2023)
di: Muehlebach, Michael, et al.
Pubblicazione: (2023)
Efficient Diffusion Models under Nonconvex Equality and Inequality constraints via Landing
di: Jeon, Kijung, et al.
Pubblicazione: (2026)
di: Jeon, Kijung, et al.
Pubblicazione: (2026)
Fast Non-Log-Concave Sampling under Nonconvex Equality and Inequality Constraints with Landing
di: Jeon, Kijung, et al.
Pubblicazione: (2025)
di: Jeon, Kijung, et al.
Pubblicazione: (2025)
Stochastic Online Optimization for Cyber-Physical and Robotic Systems
di: Ma, Hao, et al.
Pubblicazione: (2024)
di: Ma, Hao, et al.
Pubblicazione: (2024)
PENEX: AdaBoost-Inspired Neural Network Regularization
di: Kladny, Klaus-Rudolf, et al.
Pubblicazione: (2025)
di: Kladny, Klaus-Rudolf, et al.
Pubblicazione: (2025)
Primal Methods for Variational Inequality Problems with Functional Constraints
di: Zhang, Liang, et al.
Pubblicazione: (2024)
di: Zhang, Liang, et al.
Pubblicazione: (2024)
RLBenchNet: The Right Network for the Right Reinforcement Learning Task
di: Smirnov, Ivan, et al.
Pubblicazione: (2025)
di: Smirnov, Ivan, et al.
Pubblicazione: (2025)
VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation
di: Sun, Shikun, et al.
Pubblicazione: (2026)
di: Sun, Shikun, et al.
Pubblicazione: (2026)
A Systems-Theoretic View on the Convergence of Algorithms under Disturbances
di: Er, Guner Dilsad, et al.
Pubblicazione: (2025)
di: Er, Guner Dilsad, et al.
Pubblicazione: (2025)
Adversarial Training for Defense Against Label Poisoning Attacks
di: Bal, Melis Ilayda, et al.
Pubblicazione: (2025)
di: Bal, Melis Ilayda, et al.
Pubblicazione: (2025)
Conformal Generative Modeling with Improved Sample Efficiency through Sequential Greedy Filtering
di: Kladny, Klaus-Rudolf, et al.
Pubblicazione: (2024)
di: Kladny, Klaus-Rudolf, et al.
Pubblicazione: (2024)
ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining
di: Bal, Melis Ilayda, et al.
Pubblicazione: (2025)
di: Bal, Melis Ilayda, et al.
Pubblicazione: (2025)
Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts
di: Chen, Yingfa, et al.
Pubblicazione: (2026)
di: Chen, Yingfa, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Partially Observable Reinforcement Learning with Memory Traces
di: Eberhard, Onno, et al.
Pubblicazione: (2025) -
A Pontryagin Perspective on Reinforcement Learning
di: Eberhard, Onno, et al.
Pubblicazione: (2024) -
Quantization-Free Autoregressive Action Transformer
di: Sheebaelhamd, Ziyad, et al.
Pubblicazione: (2025) -
Why Linear Recurrent Memory Works in Partially Observable Reinforcement Learning
di: Zhao, Yike, et al.
Pubblicazione: (2026) -
Tight Sample Complexity Bounds for Entropic Best Policy Identification
di: Essakine, Amer, et al.
Pubblicazione: (2026)