Random Latent Exploration for Deep Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Mahankali, Srinath, Hong, Zhang-Wei, Sekhari, Ayush, Rakhlin, Alexander, Agrawal, Pulkit |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data
por: Jia, Zeyu, et al.
Publicado: (2024)
por: Jia, Zeyu, et al.
Publicado: (2024)
GaussMark: A Practical Approach for Structural Watermarking of Language Models
por: Block, Adam, et al.
Publicado: (2025)
por: Block, Adam, et al.
Publicado: (2025)
The Role of Environment Access in Agnostic Reinforcement Learning
por: Krishnamurthy, Akshay, et al.
Publicado: (2025)
por: Krishnamurthy, Akshay, et al.
Publicado: (2025)
TGRL: An Algorithm for Teacher Guided Reinforcement Learning
por: Shenfeld, Idan, et al.
Publicado: (2023)
por: Shenfeld, Idan, et al.
Publicado: (2023)
Harnessing Density Ratios for Online Reinforcement Learning
por: Amortila, Philip, et al.
Publicado: (2024)
por: Amortila, Philip, et al.
Publicado: (2024)
System-Aware Unlearning Algorithms: Use Lesser, Forget Faster
por: Lu, Linda, et al.
Publicado: (2025)
por: Lu, Linda, et al.
Publicado: (2025)
RL's Razor: Why Online Reinforcement Learning Forgets Less
por: Shenfeld, Idan, et al.
Publicado: (2025)
por: Shenfeld, Idan, et al.
Publicado: (2025)
FAST-Q: Fast-track Exploration with Adversarially Balanced State Representations for Counterfactual Action Estimation in Offline Reinforcement Learning
por: Agrawal, Pulkit, et al.
Publicado: (2025)
por: Agrawal, Pulkit, et al.
Publicado: (2025)
The Space Complexity of Learning-Unlearning Algorithms
por: Cherapanamjeri, Yeshwanth, et al.
Publicado: (2025)
por: Cherapanamjeri, Yeshwanth, et al.
Publicado: (2025)
The Power of Resets in Online Reinforcement Learning
por: Mhammedi, Zakaria, et al.
Publicado: (2024)
por: Mhammedi, Zakaria, et al.
Publicado: (2024)
Langevin Dynamics: A Unified Perspective on Optimization via Lyapunov Potentials
por: Chen, August Y., et al.
Publicado: (2024)
por: Chen, August Y., et al.
Publicado: (2024)
Going Beyond Heuristics by Imposing Policy Improvement as a Constraint
por: Lee, Chi-Chang, et al.
Publicado: (2025)
por: Lee, Chi-Chang, et al.
Publicado: (2025)
UCD: Unlearning in LLMs via Contrastive Decoding
por: Suriyakumar, Vinith M., et al.
Publicado: (2025)
por: Suriyakumar, Vinith M., et al.
Publicado: (2025)
Hovering Flight of Soft-Actuated Insect-Scale Micro Aerial Vehicles using Deep Reinforcement Learning
por: Hsiao, Yi-Hsuan, et al.
Publicado: (2025)
por: Hsiao, Yi-Hsuan, et al.
Publicado: (2025)
Near-Optimal Learning and Planning in Separated Latent MDPs
por: Chen, Fan, et al.
Publicado: (2024)
por: Chen, Fan, et al.
Publicado: (2024)
Computationally Efficient RL under Linear Bellman Completeness for Deterministic Dynamics
por: Wu, Runzhe, et al.
Publicado: (2024)
por: Wu, Runzhe, et al.
Publicado: (2024)
Efficient Model-Free Exploration in Low-Rank MDPs
por: Mhammedi, Zakaria, et al.
Publicado: (2023)
por: Mhammedi, Zakaria, et al.
Publicado: (2023)
Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits
por: Chen, Fan, et al.
Publicado: (2025)
por: Chen, Fan, et al.
Publicado: (2025)
Oracle-Efficient Smoothed Online Learning for Piecewise Continuous Decision Making
por: Block, Adam, et al.
Publicado: (2023)
por: Block, Adam, et al.
Publicado: (2023)
Self-Distillation Enables Continual Learning
por: Shenfeld, Idan, et al.
Publicado: (2026)
por: Shenfeld, Idan, et al.
Publicado: (2026)
Decision Making in Changing Environments: Robustness, Query-Based Learning, and Differential Privacy
por: Chen, Fan, et al.
Publicado: (2025)
por: Chen, Fan, et al.
Publicado: (2025)
Collective Model Intelligence Requires Compatible Specialization
por: Pari, Jyothish, et al.
Publicado: (2024)
por: Pari, Jyothish, et al.
Publicado: (2024)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
por: Zhang, Chen Bo Calvin, et al.
Publicado: (2024)
por: Zhang, Chen Bo Calvin, et al.
Publicado: (2024)
Formal Theorem Proving by Rewarding LLMs to Decompose Proofs Hierarchically
por: Dong, Kefan, et al.
Publicado: (2024)
por: Dong, Kefan, et al.
Publicado: (2024)
Divide-and-Conquer CoT: RL for Reducing Latency via Parallel Reasoning
por: Mahankali, Arvind, et al.
Publicado: (2026)
por: Mahankali, Arvind, et al.
Publicado: (2026)
Grammarization-Based Grasping with Deep Multi-Autoencoder Latent Space Exploration by Reinforcement Learning Agent
por: Askianakis, Leonidas
Publicado: (2024)
por: Askianakis, Leonidas
Publicado: (2024)
JUICER: Data-Efficient Imitation Learning for Robotic Assembly
por: Ankile, Lars, et al.
Publicado: (2024)
por: Ankile, Lars, et al.
Publicado: (2024)
Efficient Diffusion Transformer Policies with Mixture of Expert Denoisers for Multitask Learning
por: Reuss, Moritz, et al.
Publicado: (2024)
por: Reuss, Moritz, et al.
Publicado: (2024)
ROER: Regularized Optimal Experience Replay
por: Li, Changling, et al.
Publicado: (2024)
por: Li, Changling, et al.
Publicado: (2024)
Randomized Exploration in Cooperative Multi-Agent Reinforcement Learning
por: Hsu, Hao-Lun, et al.
Publicado: (2024)
por: Hsu, Hao-Lun, et al.
Publicado: (2024)
When Less is Enough: Efficient Inference via Collaborative Reasoning
por: Chen, Yilei, et al.
Publicado: (2026)
por: Chen, Yilei, et al.
Publicado: (2026)
A Temporally Correlated Latent Exploration for Reinforcement Learning
por: Oh, SuMin, et al.
Publicado: (2024)
por: Oh, SuMin, et al.
Publicado: (2024)
What Happens During the Loss Plateau? Understanding Abrupt Learning in Transformers
por: Gopalani, Pulkit, et al.
Publicado: (2025)
por: Gopalani, Pulkit, et al.
Publicado: (2025)
The Gaussian Mixing Mechanism: Renyi Differential Privacy via Gaussian Sketches
por: Lev, Omri, et al.
Publicado: (2025)
por: Lev, Omri, et al.
Publicado: (2025)
On the Performance of Empirical Risk Minimization with Smoothed Data
por: Block, Adam, et al.
Publicado: (2024)
por: Block, Adam, et al.
Publicado: (2024)
Characterizing Online and Private Learnability under Distributional Constraints via Generalized Smoothness
por: Blanchard, Moïse, et al.
Publicado: (2026)
por: Blanchard, Moïse, et al.
Publicado: (2026)
End-to-End Efficient RL for Linear Bellman Complete MDPs with Deterministic Transitions
por: Mhammedi, Zakaria, et al.
Publicado: (2026)
por: Mhammedi, Zakaria, et al.
Publicado: (2026)
Satisficing Exploration for Deep Reinforcement Learning
por: Arumugam, Dilip, et al.
Publicado: (2024)
por: Arumugam, Dilip, et al.
Publicado: (2024)
Randomized Exploration for Reinforcement Learning with Multinomial Logistic Function Approximation
por: Cho, Wooseong, et al.
Publicado: (2024)
por: Cho, Wooseong, et al.
Publicado: (2024)
How Does Variance Shape the Regret in Contextual Bandits?
por: Jia, Zeyu, et al.
Publicado: (2024)
por: Jia, Zeyu, et al.
Publicado: (2024)
Ejemplares similares
-
Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data
por: Jia, Zeyu, et al.
Publicado: (2024) -
GaussMark: A Practical Approach for Structural Watermarking of Language Models
por: Block, Adam, et al.
Publicado: (2025) -
The Role of Environment Access in Agnostic Reinforcement Learning
por: Krishnamurthy, Akshay, et al.
Publicado: (2025) -
TGRL: An Algorithm for Teacher Guided Reinforcement Learning
por: Shenfeld, Idan, et al.
Publicado: (2023) -
Harnessing Density Ratios for Online Reinforcement Learning
por: Amortila, Philip, et al.
Publicado: (2024)