Saved in:
| Main Authors: | Wu, Qingyuan, Wang, Yuhui, Zhan, Simon Sinong, Wang, Yixuan, Lin, Chung-Wei, Lv, Chen, Zhu, Qi, Schmidhuber, Jürgen, Huang, Chao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2505.00546 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Boosting Reinforcement Learning with Strongly Delayed Feedback Through Auxiliary Short Delays
by: Wu, Qingyuan, et al.
Published: (2024)
by: Wu, Qingyuan, et al.
Published: (2024)
Variational Delayed Policy Optimization
by: Wu, Qingyuan, et al.
Published: (2024)
by: Wu, Qingyuan, et al.
Published: (2024)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
by: Zhan, Simon Sinong, et al.
Published: (2025)
by: Zhan, Simon Sinong, et al.
Published: (2025)
Inverse Delayed Reinforcement Learning
by: Zhan, Simon Sinong, et al.
Published: (2024)
by: Zhan, Simon Sinong, et al.
Published: (2024)
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
by: Zhan, Simon Sinong, et al.
Published: (2024)
by: Zhan, Simon Sinong, et al.
Published: (2024)
Case Study: Runtime Safety Verification of Neural Network Controlled System
by: Yang, Frank, et al.
Published: (2024)
by: Yang, Frank, et al.
Published: (2024)
A Unified Framework for Rethinking Policy Divergence Measures in GRPO
by: Wu, Qingyuan, et al.
Published: (2026)
by: Wu, Qingyuan, et al.
Published: (2026)
Highway Reinforcement Learning
by: Wang, Yuhui, et al.
Published: (2024)
by: Wang, Yuhui, et al.
Published: (2024)
Highway Value Iteration Networks
by: Wang, Yuhui, et al.
Published: (2024)
by: Wang, Yuhui, et al.
Published: (2024)
Scaling Value Iteration Networks to 5000 Layers for Extreme Long-Term Planning
by: Wang, Yuhui, et al.
Published: (2024)
by: Wang, Yuhui, et al.
Published: (2024)
Empowering Autonomous Driving with Large Language Models: A Safety Perspective
by: Wang, Yixuan, et al.
Published: (2023)
by: Wang, Yixuan, et al.
Published: (2023)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
by: Feng, Weitao, et al.
Published: (2025)
by: Feng, Weitao, et al.
Published: (2025)
Efficient Morphology-Control Co-Design via Stackelberg Proximal Policy Optimization
by: Dai, Yanning, et al.
Published: (2026)
by: Dai, Yanning, et al.
Published: (2026)
Learning Online Belief Prediction for Efficient POMDP Planning in Autonomous Driving
by: Huang, Zhiyu, et al.
Published: (2024)
by: Huang, Zhiyu, et al.
Published: (2024)
Sequence Compression Speeds Up Credit Assignment in Reinforcement Learning
by: Ramesh, Aditya A., et al.
Published: (2024)
by: Ramesh, Aditya A., et al.
Published: (2024)
STEMO: Early Spatio-temporal Forecasting with Multi-Objective Reinforcement Learning
by: Shao, Wei, et al.
Published: (2024)
by: Shao, Wei, et al.
Published: (2024)
Switching Controller Synthesis for Hybrid Systems Against STL Formulas
by: Su, Han, et al.
Published: (2024)
by: Su, Han, et al.
Published: (2024)
Noncooperative Game in Multi-controller System under Delayed and Asymmetric Information
by: Li, Xin, et al.
Published: (2026)
by: Li, Xin, et al.
Published: (2026)
Planning to Explore: Curiosity-Driven Planning for LLM Test Generation
by: Amayuelas, Alfonso, et al.
Published: (2026)
by: Amayuelas, Alfonso, et al.
Published: (2026)
Upside Down Reinforcement Learning with Policy Generators
by: Di Ventura, Jacopo, et al.
Published: (2025)
by: Di Ventura, Jacopo, et al.
Published: (2025)
Metalearning Continual Learning Algorithms
by: Irie, Kazuki, et al.
Published: (2023)
by: Irie, Kazuki, et al.
Published: (2023)
Annotated History of Modern AI and Deep Learning
by: Schmidhuber, Juergen
Published: (2022)
by: Schmidhuber, Juergen
Published: (2022)
CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL
by: Ni, Zhenyang, et al.
Published: (2026)
by: Ni, Zhenyang, et al.
Published: (2026)
Deep Learning: Our Miraculous Year 1990-1991
by: Schmidhuber, Juergen
Published: (2020)
by: Schmidhuber, Juergen
Published: (2020)
Exploring the Promise and Limits of Real-Time Recurrent Learning
by: Irie, Kazuki, et al.
Published: (2023)
by: Irie, Kazuki, et al.
Published: (2023)
Interestingness as an Inductive Heuristic for Future Compression Progress
by: Herrmann, Vincent, et al.
Published: (2026)
by: Herrmann, Vincent, et al.
Published: (2026)
Learning Useful Representations of Recurrent Neural Network Weight Matrices
by: Herrmann, Vincent, et al.
Published: (2024)
by: Herrmann, Vincent, et al.
Published: (2024)
Self-Organising Neural Discrete Representation Learning à la Kohonen
by: Irie, Kazuki, et al.
Published: (2023)
by: Irie, Kazuki, et al.
Published: (2023)
Fairness Overfitting in Machine Learning: An Information-Theoretic Perspective
by: Laakom, Firas, et al.
Published: (2025)
by: Laakom, Firas, et al.
Published: (2025)
Learning to Forget: Continual Learning with Adaptive Weight Decay
by: Ramesh, Aditya A., et al.
Published: (2026)
by: Ramesh, Aditya A., et al.
Published: (2026)
Kinematics-aware Trajectory Generation and Prediction with Latent Stochastic Differential Modeling
by: Jiao, Ruochen, et al.
Published: (2023)
by: Jiao, Ruochen, et al.
Published: (2023)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
by: Wang, Li, et al.
Published: (2026)
by: Wang, Li, et al.
Published: (2026)
Multi-Agent Pointer Transformer: Seq-to-Seq Reinforcement Learning for Multi-Vehicle Dynamic Pickup-Delivery Problems
by: Zou, Zengyu, et al.
Published: (2025)
by: Zou, Zengyu, et al.
Published: (2025)
Advancing Autonomous VLM Agents via Variational Subgoal-Conditioned Reinforcement Learning
by: Wu, Qingyuan, et al.
Published: (2025)
by: Wu, Qingyuan, et al.
Published: (2025)
Multi-Path Collaborative Reasoning via Reinforcement Learning
by: Lv, Jindi, et al.
Published: (2025)
by: Lv, Jindi, et al.
Published: (2025)
Handling Delay in Real-Time Reinforcement Learning
by: Anokhin, Ivan, et al.
Published: (2025)
by: Anokhin, Ivan, et al.
Published: (2025)
Shedding Light on VLN Robustness: A Black-box Framework for Indoor Lighting-based Adversarial Attack
by: Li, Chenyang, et al.
Published: (2025)
by: Li, Chenyang, et al.
Published: (2025)
On the Convergence and Stability of Upside-Down Reinforcement Learning, Goal-Conditioned Supervised Learning, and Online Decision Transformers
by: Štrupl, Miroslav, et al.
Published: (2025)
by: Štrupl, Miroslav, et al.
Published: (2025)
RLTP: Reinforcement Learning to Pace for Delayed Impression Modeling in Preloaded Ads
by: Wei, Penghui, et al.
Published: (2023)
by: Wei, Penghui, et al.
Published: (2023)
Phonetic and Lexical Discovery of a Canine Language using HuBERT
by: Li, Xingyuan, et al.
Published: (2024)
by: Li, Xingyuan, et al.
Published: (2024)
Similar Items
-
Boosting Reinforcement Learning with Strongly Delayed Feedback Through Auxiliary Short Delays
by: Wu, Qingyuan, et al.
Published: (2024) -
Variational Delayed Policy Optimization
by: Wu, Qingyuan, et al.
Published: (2024) -
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
by: Zhan, Simon Sinong, et al.
Published: (2025) -
Inverse Delayed Reinforcement Learning
by: Zhan, Simon Sinong, et al.
Published: (2024) -
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
by: Zhan, Simon Sinong, et al.
Published: (2024)