Don't flatten, tokenize! Unlocking the key to SoftMoE's efficacy in deep RL
Fuente:
arXiv
Guardado en:
| Autores principales: | Sokar, Ghada, Obando-Ceron, Johan, Courville, Aaron, Larochelle, Hugo, Castro, Pablo Samuel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
In value-based deep reinforcement learning, a pruned network is a good network
por: Obando-Ceron, Johan, et al.
Publicado: (2024)
por: Obando-Ceron, Johan, et al.
Publicado: (2024)
Mixtures of Experts Unlock Parameter Scaling for Deep RL
por: Obando-Ceron, Johan, et al.
Publicado: (2024)
por: Obando-Ceron, Johan, et al.
Publicado: (2024)
On the consistency of hyper-parameter selection in value-based deep reinforcement learning
por: Obando-Ceron, Johan, et al.
Publicado: (2024)
por: Obando-Ceron, Johan, et al.
Publicado: (2024)
Mind the GAP! The Challenges of Scale in Pixel-based Deep Reinforcement Learning
por: Sokar, Ghada, et al.
Publicado: (2025)
por: Sokar, Ghada, et al.
Publicado: (2025)
The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks
por: Mayor, Walter, et al.
Publicado: (2025)
por: Mayor, Walter, et al.
Publicado: (2025)
Measure gradients, not activations! Enhancing neuronal activity in deep reinforcement learning
por: Liu, Jiashun, et al.
Publicado: (2025)
por: Liu, Jiashun, et al.
Publicado: (2025)
The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning
por: Liu, Jiashun, et al.
Publicado: (2025)
por: Liu, Jiashun, et al.
Publicado: (2025)
Mitigating Plasticity Loss in Continual Reinforcement Learning by Reducing Churn
por: Tang, Hongyao, et al.
Publicado: (2025)
por: Tang, Hongyao, et al.
Publicado: (2025)
Stable Deep Reinforcement Learning via Isotropic Gaussian Representations
por: Pasand, Ali Saheb, et al.
Publicado: (2026)
por: Pasand, Ali Saheb, et al.
Publicado: (2026)
Simplicial Embeddings Improve Sample Efficiency in Actor-Critic Agents
por: Obando-Ceron, Johan, et al.
Publicado: (2025)
por: Obando-Ceron, Johan, et al.
Publicado: (2025)
Neuroplastic Expansion in Deep Reinforcement Learning
por: Liu, Jiashun, et al.
Publicado: (2024)
por: Liu, Jiashun, et al.
Publicado: (2024)
Mixture of Experts in a Mixture of RL settings
por: Willi, Timon, et al.
Publicado: (2024)
por: Willi, Timon, et al.
Publicado: (2024)
Adaptive Computation Pruning for the Forgetting Transformer
por: Lin, Zhixuan, et al.
Publicado: (2025)
por: Lin, Zhixuan, et al.
Publicado: (2025)
La-SoftMoE CLIP for Unified Physical-Digital Face Attack Detection
por: Zou, Hang, et al.
Publicado: (2024)
por: Zou, Hang, et al.
Publicado: (2024)
A Mechanistic Analysis of Looped Reasoning Language Models
por: Blayney, Hugh, et al.
Publicado: (2026)
por: Blayney, Hugh, et al.
Publicado: (2026)
Stable Gradients for Stable Learning at Scale in Deep Reinforcement Learning
por: Castanyer, Roger Creus, et al.
Publicado: (2025)
por: Castanyer, Roger Creus, et al.
Publicado: (2025)
A Comedy of Estimators: On KL Regularization in RL Training of LLMs
por: Shah, Vedant, et al.
Publicado: (2025)
por: Shah, Vedant, et al.
Publicado: (2025)
Towards Sustainable Investment Policies Informed by Opponent Shaping
por: Duque, Juan Agustin, et al.
Publicado: (2026)
por: Duque, Juan Agustin, et al.
Publicado: (2026)
Continual Learning in Vision-Language Models via Aligned Model Merging
por: Sokar, Ghada, et al.
Publicado: (2025)
por: Sokar, Ghada, et al.
Publicado: (2025)
Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
por: Liu, Jiashun, et al.
Publicado: (2025)
por: Liu, Jiashun, et al.
Publicado: (2025)
Angles Don't Lie: Unlocking Training-Efficient RL Through the Model's Own Signals
por: Wang, Qinsi, et al.
Publicado: (2025)
por: Wang, Qinsi, et al.
Publicado: (2025)
A density estimation perspective on learning from pairwise human preferences
por: Dumoulin, Vincent, et al.
Publicado: (2023)
por: Dumoulin, Vincent, et al.
Publicado: (2023)
Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs
por: Janjua, Muhammad Kamran, et al.
Publicado: (2026)
por: Janjua, Muhammad Kamran, et al.
Publicado: (2026)
Don't Trade Off Safety: Diffusion Regularization for Constrained Offline RL
por: Guo, Junyu, et al.
Publicado: (2025)
por: Guo, Junyu, et al.
Publicado: (2025)
Don't Forget the Nonlinearity: Unlocking Activation Functions in Efficient Fine-Tuning
por: Yin, Bo, et al.
Publicado: (2025)
por: Yin, Bo, et al.
Publicado: (2025)
Compositional Discrete Latent Code for High Fidelity, Productive Diffusion Models
por: Lavoie, Samuel, et al.
Publicado: (2025)
por: Lavoie, Samuel, et al.
Publicado: (2025)
Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning
por: Cao, Mingyu, et al.
Publicado: (2024)
por: Cao, Mingyu, et al.
Publicado: (2024)
Don't Waste Mistakes: Leveraging Negative RL-Groups via Confidence Reweighting
por: Feng, Yunzhen, et al.
Publicado: (2025)
por: Feng, Yunzhen, et al.
Publicado: (2025)
Don't be salesmen
Publicado: (1997)
Publicado: (1997)
GenRL: Multimodal-foundation world models for generalization in embodied agents
por: Mazzaglia, Pietro, et al.
Publicado: (2024)
por: Mazzaglia, Pietro, et al.
Publicado: (2024)
Don't be lazy: CompleteP enables compute-efficient deep transformers
por: Dey, Nolan, et al.
Publicado: (2025)
por: Dey, Nolan, et al.
Publicado: (2025)
ReducedLUT: Table Decomposition with "Don't Care" Conditions
por: Cassidy, Oliver, et al.
Publicado: (2024)
por: Cassidy, Oliver, et al.
Publicado: (2024)
Ejemplares similares
-
In value-based deep reinforcement learning, a pruned network is a good network
por: Obando-Ceron, Johan, et al.
Publicado: (2024) -
Mixtures of Experts Unlock Parameter Scaling for Deep RL
por: Obando-Ceron, Johan, et al.
Publicado: (2024) -
On the consistency of hyper-parameter selection in value-based deep reinforcement learning
por: Obando-Ceron, Johan, et al.
Publicado: (2024) -
Mind the GAP! The Challenges of Scale in Pixel-based Deep Reinforcement Learning
por: Sokar, Ghada, et al.
Publicado: (2025) -
The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks
por: Mayor, Walter, et al.
Publicado: (2025)