Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Nauman, Michal, Bortkiewicz, Michał, Miłoś, Piotr, Trzciński, Tomasz, Ostaszewski, Mateusz, Cygan, Marek |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Case for Validation Buffer in Pessimistic Actor-Critic
di: Nauman, Michal, et al.
Pubblicazione: (2024)
di: Nauman, Michal, et al.
Pubblicazione: (2024)
Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control
di: Nauman, Michal, et al.
Pubblicazione: (2024)
di: Nauman, Michal, et al.
Pubblicazione: (2024)
On the Theory of Risk-Aware Agents: Bridging Actor-Critic and Economics
di: Nauman, Michal, et al.
Pubblicazione: (2023)
di: Nauman, Michal, et al.
Pubblicazione: (2023)
Reward-Conditioned Reinforcement Learning
di: Nauman, Michal, et al.
Pubblicazione: (2026)
di: Nauman, Michal, et al.
Pubblicazione: (2026)
Fine-tuning Reinforcement Learning Models is Secretly a Forgetting Mitigation Problem
di: Wołczyk, Maciej, et al.
Pubblicazione: (2024)
di: Wołczyk, Maciej, et al.
Pubblicazione: (2024)
Balancing Expressivity and Robustness: Constrained Rational Activations for Reinforcement Learning
di: Surdej, Rafał, et al.
Pubblicazione: (2025)
di: Surdej, Rafał, et al.
Pubblicazione: (2025)
Is Temporal Difference Learning the Gold Standard for Stitching in RL?
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2025)
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2025)
1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities
di: Wang, Kevin, et al.
Pubblicazione: (2025)
di: Wang, Kevin, et al.
Pubblicazione: (2025)
Contrastive Representations for Temporal Reasoning
di: Ziarko, Alicja, et al.
Pubblicazione: (2025)
di: Ziarko, Alicja, et al.
Pubblicazione: (2025)
When Does Non-Uniform Replay Matter in Reinforcement Learning?
di: Korniak, Michal, et al.
Pubblicazione: (2026)
di: Korniak, Michal, et al.
Pubblicazione: (2026)
Learning Continually by Spectral Regularization
di: Lewandowski, Alex, et al.
Pubblicazione: (2024)
di: Lewandowski, Alex, et al.
Pubblicazione: (2024)
Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners
di: Nauman, Michal, et al.
Pubblicazione: (2025)
di: Nauman, Michal, et al.
Pubblicazione: (2025)
On the Role of Iterative Computation in Reinforcement Learning
di: Ghugare, Raj, et al.
Pubblicazione: (2026)
di: Ghugare, Raj, et al.
Pubblicazione: (2026)
What Matters in Hierarchical Search for Combinatorial Reasoning Problems?
di: Zawalski, Michał, et al.
Pubblicazione: (2024)
di: Zawalski, Michał, et al.
Pubblicazione: (2024)
Unpacking Softmax: How Temperature Drives Representation Collapse, Compression, and Generalization
di: Masarczyk, Wojciech, et al.
Pubblicazione: (2025)
di: Masarczyk, Wojciech, et al.
Pubblicazione: (2025)
MISS: Multiclass Interpretable Scoring Systems
di: Grzeszczyk, Michal K., et al.
Pubblicazione: (2024)
di: Grzeszczyk, Michal K., et al.
Pubblicazione: (2024)
Off-Policy Correction For Multi-Agent Reinforcement Learning
di: Zawalski, Michał, et al.
Pubblicazione: (2021)
di: Zawalski, Michał, et al.
Pubblicazione: (2021)
Moderate Actor-Critic Methods: Controlling Overestimation Bias via Expectile Loss
di: Hwang, Ukjo, et al.
Pubblicazione: (2025)
di: Hwang, Ukjo, et al.
Pubblicazione: (2025)
Actor-Critic Reinforcement Learning with Phased Actor
di: Wu, Ruofan, et al.
Pubblicazione: (2024)
di: Wu, Ruofan, et al.
Pubblicazione: (2024)
Stochastic Actor-Critic: Mitigating Overestimation via Temporal Aleatoric Uncertainty
di: Özalp, Uğurcan
Pubblicazione: (2026)
di: Özalp, Uğurcan
Pubblicazione: (2026)
What Does Flow Matching Bring To TD Learning?
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2026)
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2026)
Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient
di: Ludziejewski, Jan, et al.
Pubblicazione: (2025)
di: Ludziejewski, Jan, et al.
Pubblicazione: (2025)
Amortized Causal Discovery with Prior-Fitted Networks
di: Sypniewski, Mateusz, et al.
Pubblicazione: (2025)
di: Sypniewski, Mateusz, et al.
Pubblicazione: (2025)
floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2025)
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2025)
Subgoal Search For Complex Reasoning Tasks
di: Czechowski, Konrad, et al.
Pubblicazione: (2021)
di: Czechowski, Konrad, et al.
Pubblicazione: (2021)
MoE-Mamba: Efficient Selective State Space Models with Mixture of Experts
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
Accelerating Goal-Conditioned RL Algorithms and Research
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2024)
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2024)
A Bitter Lesson for Data Filtering
di: Mohri, Christopher, et al.
Pubblicazione: (2026)
di: Mohri, Christopher, et al.
Pubblicazione: (2026)
GEPAR3D: Geometry Prior-Assisted Learning for 3D Tooth Segmentation
di: Szczepański, Tomasz, et al.
Pubblicazione: (2025)
di: Szczepański, Tomasz, et al.
Pubblicazione: (2025)
Debate2Create: Robot Co-design via Multi-Agent LLM Debate
di: Qiu, Kevin, et al.
Pubblicazione: (2025)
di: Qiu, Kevin, et al.
Pubblicazione: (2025)
The Brain's Bitter Lesson: Scaling Speech Decoding With Self-Supervised Learning
di: Jayalath, Dulhan, et al.
Pubblicazione: (2024)
di: Jayalath, Dulhan, et al.
Pubblicazione: (2024)
Decoupled Relative Learning Rate Schedules
di: Ludziejewski, Jan, et al.
Pubblicazione: (2025)
di: Ludziejewski, Jan, et al.
Pubblicazione: (2025)
Feature importance analysis for patient management decisions
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Distance metric learning for conditional anomaly detection
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
PhysGym: Benchmarking LLMs in Interactive Physics Discovery with Controlled Priors
di: Chen, Yimeng, et al.
Pubblicazione: (2025)
di: Chen, Yimeng, et al.
Pubblicazione: (2025)
Learning predictive models for combinations of heterogeneous proteomic data sources
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Since Faithfulness Fails: The Performance Limits of Neural Causal Discovery
di: Olko, Mateusz, et al.
Pubblicazione: (2025)
di: Olko, Mateusz, et al.
Pubblicazione: (2025)
Flow Actor-Critic for Offline Reinforcement Learning
di: Chae, Jongseong, et al.
Pubblicazione: (2026)
di: Chae, Jongseong, et al.
Pubblicazione: (2026)
Solving cold start in news recommendations: a RippleNet-based system for large scale media outlet
di: Radziszewski, Karol, et al.
Pubblicazione: (2025)
di: Radziszewski, Karol, et al.
Pubblicazione: (2025)
ELROND: Exploring and decomposing intrinsic capabilities of diffusion models
di: Skierś, Paweł, et al.
Pubblicazione: (2026)
di: Skierś, Paweł, et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Case for Validation Buffer in Pessimistic Actor-Critic
di: Nauman, Michal, et al.
Pubblicazione: (2024) -
Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control
di: Nauman, Michal, et al.
Pubblicazione: (2024) -
On the Theory of Risk-Aware Agents: Bridging Actor-Critic and Economics
di: Nauman, Michal, et al.
Pubblicazione: (2023) -
Reward-Conditioned Reinforcement Learning
di: Nauman, Michal, et al.
Pubblicazione: (2026) -
Fine-tuning Reinforcement Learning Models is Secretly a Forgetting Mitigation Problem
di: Wołczyk, Maciej, et al.
Pubblicazione: (2024)