Commit to the Bit: Reactive Reinforcement Learning Done Right
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Eberhard, Onno, Vernade, Claire, Muehlebach, Michael |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Partially Observable Reinforcement Learning with Memory Traces
par: Eberhard, Onno, et autres
Publié: (2025)
par: Eberhard, Onno, et autres
Publié: (2025)
A Pontryagin Perspective on Reinforcement Learning
par: Eberhard, Onno, et autres
Publié: (2024)
par: Eberhard, Onno, et autres
Publié: (2024)
Quantization-Free Autoregressive Action Transformer
par: Sheebaelhamd, Ziyad, et autres
Publié: (2025)
par: Sheebaelhamd, Ziyad, et autres
Publié: (2025)
Why Linear Recurrent Memory Works in Partially Observable Reinforcement Learning
par: Zhao, Yike, et autres
Publié: (2026)
par: Zhao, Yike, et autres
Publié: (2026)
Tight Sample Complexity Bounds for Entropic Best Policy Identification
par: Essakine, Amer, et autres
Publié: (2026)
par: Essakine, Amer, et autres
Publié: (2026)
Non-Stationary Lipschitz Bandits
par: Nguyen, Nicolas, et autres
Publié: (2025)
par: Nguyen, Nicolas, et autres
Publié: (2025)
Dr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generations
par: Liu, Wei, et autres
Publié: (2026)
par: Liu, Wei, et autres
Publié: (2026)
Put CASH on Bandits: A Max K-Armed Problem for Automated Machine Learning
par: Balef, Amir Rezaei, et autres
Publié: (2025)
par: Balef, Amir Rezaei, et autres
Publié: (2025)
Variational Bayes Portfolio Construction
par: Nguyen, Nicolas, et autres
Publié: (2024)
par: Nguyen, Nicolas, et autres
Publié: (2024)
The Sample Complexity of Online Reinforcement Learning: A Multi-model Perspective
par: Muehlebach, Michael, et autres
Publié: (2025)
par: Muehlebach, Michael, et autres
Publié: (2025)
Split the Differences, Pool the Rest: Provably Efficient Multi-Objective Imitation
par: Sheebaelhamd, Ziyad, et autres
Publié: (2026)
par: Sheebaelhamd, Ziyad, et autres
Publié: (2026)
Prior-Dependent Allocations for Bayesian Fixed-Budget Best-Arm Identification in Structured Bandits
par: Nguyen, Nicolas, et autres
Publié: (2024)
par: Nguyen, Nicolas, et autres
Publié: (2024)
Online Decision Deferral under Budget Constraints
par: Reid, Mirabel, et autres
Publié: (2024)
par: Reid, Mirabel, et autres
Publié: (2024)
Stochastic Gradient Descent for Gaussian Processes Done Right
par: Lin, Jihao Andreas, et autres
Publié: (2023)
par: Lin, Jihao Andreas, et autres
Publié: (2023)
Inverse Q-Learning Done Right: Offline Imitation Learning in $Q^π$-Realizable MDPs
par: Moulin, Antoine, et autres
Publié: (2025)
par: Moulin, Antoine, et autres
Publié: (2025)
Elastic Weight Consolidation Done Right for Continual Learning
par: Liu, Xuan, et autres
Publié: (2026)
par: Liu, Xuan, et autres
Publié: (2026)
MoRight: Motion Control Done Right
par: Liu, Shaowei, et autres
Publié: (2026)
par: Liu, Shaowei, et autres
Publié: (2026)
Test-Time Training Done Right
par: Zhang, Tianyuan, et autres
Publié: (2025)
par: Zhang, Tianyuan, et autres
Publié: (2025)
Clustered KL-barycenter design for policy evaluation
par: Weissmann, Simon, et autres
Publié: (2025)
par: Weissmann, Simon, et autres
Publié: (2025)
Contrastive Predictive Coding Done Right for Mutual Information Estimation
par: Ryu, J. Jon, et autres
Publié: (2025)
par: Ryu, J. Jon, et autres
Publié: (2025)
Controlling Participation in Federated Learning with Feedback
par: Cummins, Michael, et autres
Publié: (2024)
par: Cummins, Michael, et autres
Publié: (2024)
Efficient Risk-sensitive Planning via Entropic Risk Measures
par: Marthe, Alexandre, et autres
Publié: (2025)
par: Marthe, Alexandre, et autres
Publié: (2025)
AutoEval Done Right: Using Synthetic Data for Model Evaluation
par: Boyeau, Pierre, et autres
Publié: (2024)
par: Boyeau, Pierre, et autres
Publié: (2024)
Middle-mile logistics through the lens of goal-conditioned reinforcement learning
par: Eberhard, Onno, et autres
Publié: (2026)
par: Eberhard, Onno, et autres
Publié: (2026)
Distributed Event-Based Learning via ADMM
par: Er, Guner Dilsad, et autres
Publié: (2024)
par: Er, Guner Dilsad, et autres
Publié: (2024)
Randomized Antipodal Search Done Right for Data Pareto Improvement of LLM Unlearning
par: Liu, Ziwen, et autres
Publié: (2026)
par: Liu, Ziwen, et autres
Publié: (2026)
On Constraints in First-Order Optimization: A View from Non-Smooth Dynamical Systems
par: Muehlebach, Michael, et autres
Publié: (2021)
par: Muehlebach, Michael, et autres
Publié: (2021)
Accelerated First-Order Optimization under Nonlinear Constraints
par: Muehlebach, Michael, et autres
Publié: (2023)
par: Muehlebach, Michael, et autres
Publié: (2023)
Efficient Diffusion Models under Nonconvex Equality and Inequality constraints via Landing
par: Jeon, Kijung, et autres
Publié: (2026)
par: Jeon, Kijung, et autres
Publié: (2026)
Fast Non-Log-Concave Sampling under Nonconvex Equality and Inequality Constraints with Landing
par: Jeon, Kijung, et autres
Publié: (2025)
par: Jeon, Kijung, et autres
Publié: (2025)
Stochastic Online Optimization for Cyber-Physical and Robotic Systems
par: Ma, Hao, et autres
Publié: (2024)
par: Ma, Hao, et autres
Publié: (2024)
PENEX: AdaBoost-Inspired Neural Network Regularization
par: Kladny, Klaus-Rudolf, et autres
Publié: (2025)
par: Kladny, Klaus-Rudolf, et autres
Publié: (2025)
Primal Methods for Variational Inequality Problems with Functional Constraints
par: Zhang, Liang, et autres
Publié: (2024)
par: Zhang, Liang, et autres
Publié: (2024)
RLBenchNet: The Right Network for the Right Reinforcement Learning Task
par: Smirnov, Ivan, et autres
Publié: (2025)
par: Smirnov, Ivan, et autres
Publié: (2025)
VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation
par: Sun, Shikun, et autres
Publié: (2026)
par: Sun, Shikun, et autres
Publié: (2026)
A Systems-Theoretic View on the Convergence of Algorithms under Disturbances
par: Er, Guner Dilsad, et autres
Publié: (2025)
par: Er, Guner Dilsad, et autres
Publié: (2025)
Adversarial Training for Defense Against Label Poisoning Attacks
par: Bal, Melis Ilayda, et autres
Publié: (2025)
par: Bal, Melis Ilayda, et autres
Publié: (2025)
Conformal Generative Modeling with Improved Sample Efficiency through Sequential Greedy Filtering
par: Kladny, Klaus-Rudolf, et autres
Publié: (2024)
par: Kladny, Klaus-Rudolf, et autres
Publié: (2024)
ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining
par: Bal, Melis Ilayda, et autres
Publié: (2025)
par: Bal, Melis Ilayda, et autres
Publié: (2025)
Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts
par: Chen, Yingfa, et autres
Publié: (2026)
par: Chen, Yingfa, et autres
Publié: (2026)
Documents similaires
-
Partially Observable Reinforcement Learning with Memory Traces
par: Eberhard, Onno, et autres
Publié: (2025) -
A Pontryagin Perspective on Reinforcement Learning
par: Eberhard, Onno, et autres
Publié: (2024) -
Quantization-Free Autoregressive Action Transformer
par: Sheebaelhamd, Ziyad, et autres
Publié: (2025) -
Why Linear Recurrent Memory Works in Partially Observable Reinforcement Learning
par: Zhao, Yike, et autres
Publié: (2026) -
Tight Sample Complexity Bounds for Entropic Best Policy Identification
par: Essakine, Amer, et autres
Publié: (2026)