Towards Formalizing Reinforcement Learning Theory
Fuente:
arXiv
Salvato in:
| Autore principale: | Zhang, Shangtong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Provable Emergence of In-Context Reinforcement Learning
di: Wang, Jiuqi, et al.
Pubblicazione: (2025)
di: Wang, Jiuqi, et al.
Pubblicazione: (2025)
Doubly Optimal Policy Evaluation for Reinforcement Learning
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2024)
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2024)
Efficient Multi-Policy Evaluation for Reinforcement Learning
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2024)
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2024)
Efficient Policy Evaluation with Safety Constraint for Reinforcement Learning
di: Chen, Claire, et al.
Pubblicazione: (2024)
di: Chen, Claire, et al.
Pubblicazione: (2024)
Counterfactual Explanations for Continuous Action Reinforcement Learning
di: Dong, Shuyang, et al.
Pubblicazione: (2025)
di: Dong, Shuyang, et al.
Pubblicazione: (2025)
CRASH: Challenging Reinforcement-Learning Based Adversarial Scenarios For Safety Hardening
di: Kulkarni, Amar, et al.
Pubblicazione: (2024)
di: Kulkarni, Amar, et al.
Pubblicazione: (2024)
Extensions of Robbins-Siegmund Theorem with Applications in Reinforcement Learning
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
Transformers Can Learn Temporal Difference Methods for In-Context Reinforcement Learning
di: Wang, Jiuqi, et al.
Pubblicazione: (2024)
di: Wang, Jiuqi, et al.
Pubblicazione: (2024)
Convergence and Emergence of In-Context Reinforcement Learning with Chain of Thought
di: Xie, Zixuan, et al.
Pubblicazione: (2026)
di: Xie, Zixuan, et al.
Pubblicazione: (2026)
The ODE Method for Stochastic Approximation and Reinforcement Learning with Markovian Noise
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2024)
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2024)
Revisiting a Design Choice in Gradient Temporal Difference Learning
di: Qian, Xiaochi, et al.
Pubblicazione: (2023)
di: Qian, Xiaochi, et al.
Pubblicazione: (2023)
On the Divergence of Differential Temporal Difference Learning without Local Clocks
di: Antrobius, David, et al.
Pubblicazione: (2026)
di: Antrobius, David, et al.
Pubblicazione: (2026)
Group Fairness in Multi-Task Reinforcement Learning
di: Song, Kefan, et al.
Pubblicazione: (2025)
di: Song, Kefan, et al.
Pubblicazione: (2025)
Almost Sure Convergence Rates of Stochastic Approximation and Reinforcement Learning via a Poisson-Moreau Drift
di: Liu, Xinyu, et al.
Pubblicazione: (2026)
di: Liu, Xinyu, et al.
Pubblicazione: (2026)
Convergence of Two-Timescale Markovian Stochastic Approximations with Applications in Reinforcement Learning
di: Mahadevan, Vagul, et al.
Pubblicazione: (2026)
di: Mahadevan, Vagul, et al.
Pubblicazione: (2026)
MathlibPR: Pull Request Merge-Readiness Benchmark for Formal Mathematical Libraries
di: Xie, Zixuan, et al.
Pubblicazione: (2026)
di: Xie, Zixuan, et al.
Pubblicazione: (2026)
Almost Sure Convergence of Linear Temporal Difference Learning with Arbitrary Features
di: Wang, Jiuqi, et al.
Pubblicazione: (2024)
di: Wang, Jiuqi, et al.
Pubblicazione: (2024)
Almost Sure Convergence Rates and Concentration of Stochastic Approximation and Reinforcement Learning with Markovian Noise
di: Qian, Xiaochi, et al.
Pubblicazione: (2024)
di: Qian, Xiaochi, et al.
Pubblicazione: (2024)
A Survey of In-Context Reinforcement Learning
di: Moeini, Amir, et al.
Pubblicazione: (2025)
di: Moeini, Amir, et al.
Pubblicazione: (2025)
Safe In-Context Reinforcement Learning
di: Moeini, Amir, et al.
Pubblicazione: (2025)
di: Moeini, Amir, et al.
Pubblicazione: (2025)
Efficient Policy Evaluation with Offline Data Informed Behavior Policy Design
di: Liu, Shuze, et al.
Pubblicazione: (2023)
di: Liu, Shuze, et al.
Pubblicazione: (2023)
Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning
di: Xie, Zixuan, et al.
Pubblicazione: (2026)
di: Xie, Zixuan, et al.
Pubblicazione: (2026)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
di: Bozkurt, Alper Kamil, et al.
Pubblicazione: (2026)
di: Bozkurt, Alper Kamil, et al.
Pubblicazione: (2026)
Linear $Q$-Learning Does Not Diverge in $L^2$: Convergence Rates to a Bounded Set
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes
di: Blaser, Ethan, et al.
Pubblicazione: (2026)
di: Blaser, Ethan, et al.
Pubblicazione: (2026)
Global Optimality and Finite Sample Analysis of Softmax Off-Policy Actor Critic under State Distribution Mismatch
di: Zhang, Shangtong, et al.
Pubblicazione: (2021)
di: Zhang, Shangtong, et al.
Pubblicazione: (2021)
Asymptotic and Finite Sample Analysis of Nonexpansive Stochastic Approximations with Markovian Noise
di: Blaser, Ethan, et al.
Pubblicazione: (2024)
di: Blaser, Ethan, et al.
Pubblicazione: (2024)
Experience Replay Addresses Loss of Plasticity in Continual Learning
di: Wang, Jiuqi, et al.
Pubblicazione: (2025)
di: Wang, Jiuqi, et al.
Pubblicazione: (2025)
Finite Sample Analysis of Linear Temporal Difference Learning with Arbitrary Features
di: Xie, Zixuan, et al.
Pubblicazione: (2025)
di: Xie, Zixuan, et al.
Pubblicazione: (2025)
On The Expressivity of Objective-Specification Formalisms in Reinforcement Learning
di: Subramani, Rohan, et al.
Pubblicazione: (2023)
di: Subramani, Rohan, et al.
Pubblicazione: (2023)
MathlibLemma: Folklore Lemma Generation and Benchmark for Formal Mathematics
di: Liu, Xinyu, et al.
Pubblicazione: (2026)
di: Liu, Xinyu, et al.
Pubblicazione: (2026)
The Formalism-Implementation Gap in Reinforcement Learning Research
di: Castro, Pablo Samuel
Pubblicazione: (2025)
di: Castro, Pablo Samuel
Pubblicazione: (2025)
GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving
di: Wang, Ruida, et al.
Pubblicazione: (2025)
di: Wang, Ruida, et al.
Pubblicazione: (2025)
Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning
di: Zhang, Kehao, et al.
Pubblicazione: (2026)
di: Zhang, Kehao, et al.
Pubblicazione: (2026)
Prompt-Driven Domain Adaptation for End-to-End Autonomous Driving via In-Context RL
di: Khurram, Aleesha, et al.
Pubblicazione: (2025)
di: Khurram, Aleesha, et al.
Pubblicazione: (2025)
Predicting Plasticity in Deep Continual Learning: A Theoretical Perspective
di: Wang, Jiuqi, et al.
Pubblicazione: (2026)
di: Wang, Jiuqi, et al.
Pubblicazione: (2026)
Towards a Formal Creativity Theory: Preliminary results in Novelty and Transformativeness
di: Santo, Luís Espírito, et al.
Pubblicazione: (2024)
di: Santo, Luís Espírito, et al.
Pubblicazione: (2024)
Reward Is Enough: LLMs Are In-Context Reinforcement Learners
di: Song, Kefan, et al.
Pubblicazione: (2025)
di: Song, Kefan, et al.
Pubblicazione: (2025)
Automating Formal Verification with Reinforcement Learning and Recursive Inference
di: Tan, Max
Pubblicazione: (2026)
di: Tan, Max
Pubblicazione: (2026)
Towards Large Language Models that Benefit for All: Benchmarking Group Fairness in Reward Models
di: Song, Kefan, et al.
Pubblicazione: (2025)
di: Song, Kefan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Provable Emergence of In-Context Reinforcement Learning
di: Wang, Jiuqi, et al.
Pubblicazione: (2025) -
Doubly Optimal Policy Evaluation for Reinforcement Learning
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2024) -
Efficient Multi-Policy Evaluation for Reinforcement Learning
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2024) -
Efficient Policy Evaluation with Safety Constraint for Reinforcement Learning
di: Chen, Claire, et al.
Pubblicazione: (2024) -
Counterfactual Explanations for Continuous Action Reinforcement Learning
di: Dong, Shuyang, et al.
Pubblicazione: (2025)