Doubly Inhomogeneous Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Hu, Liyuan, Li, Mengbing, Shi, Chengchun, Wu, Zhenke, Fryzlewicz, Piotr |
|---|---|
| Format: | Preprint |
| Published: |
2022
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Testing Stationarity and Change Point Detection in Reinforcement Learning
by: Li, Mengbing, et al.
Published: (2022)
by: Li, Mengbing, et al.
Published: (2022)
Generalized Fitted Q-Iteration with Clustered Data
by: Hu, Liyuan, et al.
Published: (2025)
by: Hu, Liyuan, et al.
Published: (2025)
Doubly Robust Alignment for Large Language Models
by: Xu, Erhan, et al.
Published: (2025)
by: Xu, Erhan, et al.
Published: (2025)
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
by: Wang, Danyang, et al.
Published: (2024)
by: Wang, Danyang, et al.
Published: (2024)
Hierarchical Reinforcement Learning for Optimal Agent Grouping in Cooperative Systems
by: Hu, Liyuan
Published: (2025)
by: Hu, Liyuan
Published: (2025)
Off-policy Evaluation in Doubly Inhomogeneous Environments
by: Bian, Zeyu, et al.
Published: (2023)
by: Bian, Zeyu, et al.
Published: (2023)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
by: Ye, Kai, et al.
Published: (2025)
by: Ye, Kai, et al.
Published: (2025)
Semi-pessimistic Reinforcement Learning
by: Zhu, Jin, et al.
Published: (2025)
by: Zhu, Jin, et al.
Published: (2025)
Doubly Mild Generalization for Offline Reinforcement Learning
by: Mao, Yixiu, et al.
Published: (2024)
by: Mao, Yixiu, et al.
Published: (2024)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
by: Zhu, Jin, et al.
Published: (2023)
by: Zhu, Jin, et al.
Published: (2023)
Generating Synthetic Electronic Health Record Data: a Methodological Scoping Review with Benchmarking on Phenotype Data and Open-Source Software
by: Chen, Xingran, et al.
Published: (2024)
by: Chen, Xingran, et al.
Published: (2024)
Infrared Spectra Prediction for Diazo Groups Utilizing a Machine Learning Approach with Structural Attention Mechanism
by: Liu, Chengchun, et al.
Published: (2024)
by: Liu, Chengchun, et al.
Published: (2024)
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
by: Mao, Liyuan, et al.
Published: (2024)
by: Mao, Liyuan, et al.
Published: (2024)
Learn-to-Distance: Distance Learning for Detecting LLM-Generated Text
by: Zhou, Hongyi, et al.
Published: (2026)
by: Zhou, Hongyi, et al.
Published: (2026)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
by: Zhou, Hongyi, et al.
Published: (2025)
by: Zhou, Hongyi, et al.
Published: (2025)
Statistical Inference in Reinforcement Learning: A Selective Survey
by: Shi, Chengchun
Published: (2025)
by: Shi, Chengchun
Published: (2025)
Counterfactually Safe Reinforcement Learning
by: Li, Jingyi, et al.
Published: (2026)
by: Li, Jingyi, et al.
Published: (2026)
Counterfactually Fair Reinforcement Learning via Sequential Data Preprocessing
by: Wang, Jitao, et al.
Published: (2025)
by: Wang, Jitao, et al.
Published: (2025)
RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs
by: Hu, Ruike, et al.
Published: (2025)
by: Hu, Ruike, et al.
Published: (2025)
Mixture-of-Experts Meets In-Context Reinforcement Learning
by: Wu, Wenhao, et al.
Published: (2025)
by: Wu, Wenhao, et al.
Published: (2025)
When Does Non-Uniform Replay Matter in Reinforcement Learning?
by: Korniak, Michal, et al.
Published: (2026)
by: Korniak, Michal, et al.
Published: (2026)
Pearl: A Production-ready Reinforcement Learning Agent
by: Zhu, Zheqing, et al.
Published: (2023)
by: Zhu, Zheqing, et al.
Published: (2023)
Quantifying Multimodal Capabilities: Formal Generalization Guarantees in Pairwise Metric Learning
by: Zhou, Richeng, et al.
Published: (2026)
by: Zhou, Richeng, et al.
Published: (2026)
Causal Deepsets for Off-policy Evaluation under Spatial or Spatio-temporal Interferences
by: Dai, Runpeng, et al.
Published: (2024)
by: Dai, Runpeng, et al.
Published: (2024)
Doubly Robust Monte Carlo Tree Search
by: Liu, Manqing, et al.
Published: (2025)
by: Liu, Manqing, et al.
Published: (2025)
Speculative Sampling with Reinforcement Learning
by: Wang, Chenan, et al.
Published: (2026)
by: Wang, Chenan, et al.
Published: (2026)
Imitation Bootstrapped Reinforcement Learning
by: Hu, Hengyuan, et al.
Published: (2023)
by: Hu, Hengyuan, et al.
Published: (2023)
Conceptual Belief-Informed Reinforcement Learning
by: Gu, Xingrui, et al.
Published: (2024)
by: Gu, Xingrui, et al.
Published: (2024)
Experiential Reinforcement Learning
by: Shi, Taiwei, et al.
Published: (2026)
by: Shi, Taiwei, et al.
Published: (2026)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
by: Gao, Xiancheng, et al.
Published: (2025)
by: Gao, Xiancheng, et al.
Published: (2025)
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
by: Wu, Xiefeng, et al.
Published: (2025)
by: Wu, Xiefeng, et al.
Published: (2025)
Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size
by: Hayou, Soufiane, et al.
Published: (2025)
by: Hayou, Soufiane, et al.
Published: (2025)
Dataset Distillation for Offline Reinforcement Learning
by: Light, Jonathan, et al.
Published: (2024)
by: Light, Jonathan, et al.
Published: (2024)
Meta-Learning Reinforcement Learning for Crypto-Return Prediction
by: Wang, Junqiao, et al.
Published: (2025)
by: Wang, Junqiao, et al.
Published: (2025)
The Homogeneity Trap: Spectral Collapse in Doubly-Stochastic Deep Networks
by: Liu, Yizhi
Published: (2026)
by: Liu, Yizhi
Published: (2026)
Doubly Stochastic Adaptive Neighbors Clustering via the Marcus Mapping
by: Yuan, Jinghui, et al.
Published: (2024)
by: Yuan, Jinghui, et al.
Published: (2024)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
by: Hu, Jifeng, et al.
Published: (2025)
by: Hu, Jifeng, et al.
Published: (2025)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
by: Zhan, Simon Sinong, et al.
Published: (2025)
by: Zhan, Simon Sinong, et al.
Published: (2025)
Reinforcement Learning via Value Gradient Flow
by: Xu, Haoran, et al.
Published: (2026)
by: Xu, Haoran, et al.
Published: (2026)
Right Time to Learn:Promoting Generalization via Bio-inspired Spacing Effect in Knowledge Distillation
by: Sun, Guanglong, et al.
Published: (2025)
by: Sun, Guanglong, et al.
Published: (2025)
Similar Items
-
Testing Stationarity and Change Point Detection in Reinforcement Learning
by: Li, Mengbing, et al.
Published: (2022) -
Generalized Fitted Q-Iteration with Clustered Data
by: Hu, Liyuan, et al.
Published: (2025) -
Doubly Robust Alignment for Large Language Models
by: Xu, Erhan, et al.
Published: (2025) -
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
by: Wang, Danyang, et al.
Published: (2024) -
Hierarchical Reinforcement Learning for Optimal Agent Grouping in Cooperative Systems
by: Hu, Liyuan
Published: (2025)