Fine-tuning Reinforcement Learning Models is Secretly a Forgetting Mitigation Problem
Fuente:
arXiv
Salvato in:
| Autori principali: | Wołczyk, Maciej, Cupiał, Bartłomiej, Ostaszewski, Mateusz, Bortkiewicz, Michał, Zając, Michał, Pascanu, Razvan, Kuciński, Łukasz, Miłoś, Piotr |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning
di: Nauman, Michal, et al.
Pubblicazione: (2024)
di: Nauman, Michal, et al.
Pubblicazione: (2024)
Balancing Expressivity and Robustness: Constrained Rational Activations for Reinforcement Learning
di: Surdej, Rafał, et al.
Pubblicazione: (2025)
di: Surdej, Rafał, et al.
Pubblicazione: (2025)
Is Temporal Difference Learning the Gold Standard for Stitching in RL?
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2025)
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2025)
Trust Your $\nabla$: Gradient-based Intervention Targeting for Causal Discovery
di: Olko, Mateusz, et al.
Pubblicazione: (2022)
di: Olko, Mateusz, et al.
Pubblicazione: (2022)
State Soup: In-Context Skill Learning, Retrieval and Mixing
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control
di: Nauman, Michal, et al.
Pubblicazione: (2024)
di: Nauman, Michal, et al.
Pubblicazione: (2024)
What Matters in Hierarchical Search for Combinatorial Reasoning Problems?
di: Zawalski, Michał, et al.
Pubblicazione: (2024)
di: Zawalski, Michał, et al.
Pubblicazione: (2024)
Contrastive Representations for Temporal Reasoning
di: Ziarko, Alicja, et al.
Pubblicazione: (2025)
di: Ziarko, Alicja, et al.
Pubblicazione: (2025)
Learning Continually by Spectral Regularization
di: Lewandowski, Alex, et al.
Pubblicazione: (2024)
di: Lewandowski, Alex, et al.
Pubblicazione: (2024)
tsGT: Stochastic Time Series Modeling With Transformer
di: Kuciński, Łukasz, et al.
Pubblicazione: (2024)
di: Kuciński, Łukasz, et al.
Pubblicazione: (2024)
A Case for Validation Buffer in Pessimistic Actor-Critic
di: Nauman, Michal, et al.
Pubblicazione: (2024)
di: Nauman, Michal, et al.
Pubblicazione: (2024)
Accelerating Goal-Conditioned RL Algorithms and Research
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2024)
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2024)
Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models
di: Góral, Gracjan, et al.
Pubblicazione: (2025)
di: Góral, Gracjan, et al.
Pubblicazione: (2025)
On the Role of Iterative Computation in Reinforcement Learning
di: Ghugare, Raj, et al.
Pubblicazione: (2026)
di: Ghugare, Raj, et al.
Pubblicazione: (2026)
Unpacking Softmax: How Temperature Drives Representation Collapse, Compression, and Generalization
di: Masarczyk, Wojciech, et al.
Pubblicazione: (2025)
di: Masarczyk, Wojciech, et al.
Pubblicazione: (2025)
Catalytic Role Of Noise And Necessity Of Inductive Biases In The Emergence Of Compositional Communication
di: Kuciński, Łukasz, et al.
Pubblicazione: (2021)
di: Kuciński, Łukasz, et al.
Pubblicazione: (2021)
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
di: Góral, Gracjan, et al.
Pubblicazione: (2024)
di: Góral, Gracjan, et al.
Pubblicazione: (2024)
Fast and Precise: Adjusting Planning Horizon with Adaptive Subgoal Search
di: Zawalski, Michał, et al.
Pubblicazione: (2022)
di: Zawalski, Michał, et al.
Pubblicazione: (2022)
GUIDE: Guidance-based Incremental Learning with Diffusion Models
di: Cywiński, Bartosz, et al.
Pubblicazione: (2024)
di: Cywiński, Bartosz, et al.
Pubblicazione: (2024)
Learning Multi-Agent Coordination via Sheaf-ADMM
di: Seely, Jeffrey, et al.
Pubblicazione: (2026)
di: Seely, Jeffrey, et al.
Pubblicazione: (2026)
Subgoal Search For Complex Reasoning Tasks
di: Czechowski, Konrad, et al.
Pubblicazione: (2021)
di: Czechowski, Konrad, et al.
Pubblicazione: (2021)
When Does Non-Uniform Replay Matter in Reinforcement Learning?
di: Korniak, Michal, et al.
Pubblicazione: (2026)
di: Korniak, Michal, et al.
Pubblicazione: (2026)
Revisiting Adam for Streaming Reinforcement Learning
di: Gogianu, Florin, et al.
Pubblicazione: (2026)
di: Gogianu, Florin, et al.
Pubblicazione: (2026)
LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities
di: Schmied, Thomas, et al.
Pubblicazione: (2025)
di: Schmied, Thomas, et al.
Pubblicazione: (2025)
Off-Policy Correction For Multi-Agent Reinforcement Learning
di: Zawalski, Michał, et al.
Pubblicazione: (2021)
di: Zawalski, Michał, et al.
Pubblicazione: (2021)
RapidDock: Unlocking Proteome-scale Molecular Docking
di: Powalski, Rafał, et al.
Pubblicazione: (2024)
di: Powalski, Rafał, et al.
Pubblicazione: (2024)
Discovering modular solutions that generalize compositionally
di: Schug, Simon, et al.
Pubblicazione: (2023)
di: Schug, Simon, et al.
Pubblicazione: (2023)
Lattice: Learning to Efficiently Compress the Memory
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)
An Efficient Rehearsal Scheme for Catastrophic Forgetting Mitigation during Multi-stage Fine-tuning
di: Bai, Andrew, et al.
Pubblicazione: (2024)
di: Bai, Andrew, et al.
Pubblicazione: (2024)
Amortized Causal Discovery with Prior-Fitted Networks
di: Sypniewski, Mateusz, et al.
Pubblicazione: (2025)
di: Sypniewski, Mateusz, et al.
Pubblicazione: (2025)
BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games
di: Paglieri, Davide, et al.
Pubblicazione: (2024)
di: Paglieri, Davide, et al.
Pubblicazione: (2024)
Deep Grokking: Would Deep Neural Networks Generalize Better?
di: Fan, Simin, et al.
Pubblicazione: (2024)
di: Fan, Simin, et al.
Pubblicazione: (2024)
What Can Grokking Teach Us About Learning Under Nonstationarity?
di: Lyle, Clare, et al.
Pubblicazione: (2025)
di: Lyle, Clare, et al.
Pubblicazione: (2025)
PhysGym: Benchmarking LLMs in Interactive Physics Discovery with Controlled Priors
di: Chen, Yimeng, et al.
Pubblicazione: (2025)
di: Chen, Yimeng, et al.
Pubblicazione: (2025)
1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities
di: Wang, Kevin, et al.
Pubblicazione: (2025)
di: Wang, Kevin, et al.
Pubblicazione: (2025)
FlySearch: Exploring how vision-language models explore
di: Pardyl, Adam, et al.
Pubblicazione: (2025)
di: Pardyl, Adam, et al.
Pubblicazione: (2025)
NoProp: Training Neural Networks without Full Back-propagation or Full Forward-propagation
di: Li, Qinyu, et al.
Pubblicazione: (2025)
di: Li, Qinyu, et al.
Pubblicazione: (2025)
Latent Space Representations of Neural Algorithmic Reasoners
di: Mirjanić, Vladimir V., et al.
Pubblicazione: (2023)
di: Mirjanić, Vladimir V., et al.
Pubblicazione: (2023)
Grow, Don't Overwrite: Fine-tuning Without Forgetting
di: Adila, Dyah, et al.
Pubblicazione: (2026)
di: Adila, Dyah, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning
di: Nauman, Michal, et al.
Pubblicazione: (2024) -
Balancing Expressivity and Robustness: Constrained Rational Activations for Reinforcement Learning
di: Surdej, Rafał, et al.
Pubblicazione: (2025) -
Is Temporal Difference Learning the Gold Standard for Stitching in RL?
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2025) -
Trust Your $\nabla$: Gradient-based Intervention Targeting for Causal Discovery
di: Olko, Mateusz, et al.
Pubblicazione: (2022) -
State Soup: In-Context Skill Learning, Retrieval and Mixing
di: Pióro, Maciej, et al.
Pubblicazione: (2024)