Uncertainty-Aware Reward-Free Exploration with General Function Approximation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Junkai, Zhang, Weitong, Zhou, Dongruo, Gu, Quanquan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs
par: Zhang, Junkai, et autres
Publié: (2023)
par: Zhang, Junkai, et autres
Publié: (2023)
CoPS: Empowering LLM Agents with Provable Cross-Task Experience Sharing
par: Yang, Chen, et autres
Publié: (2024)
par: Yang, Chen, et autres
Publié: (2024)
Sample and Computationally Efficient Continuous-Time Reinforcement Learning with General Function Approximation
par: Zhao, Runze, et autres
Publié: (2025)
par: Zhao, Runze, et autres
Publié: (2025)
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
par: Deng, Yihe, et autres
Publié: (2023)
par: Deng, Yihe, et autres
Publié: (2023)
Causal Graph ODE: Continuous Treatment Effect Modeling in Multi-agent Dynamical Systems
par: Huang, Zijie, et autres
Publié: (2024)
par: Huang, Zijie, et autres
Publié: (2024)
Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL
par: Zhang, Weitong, et autres
Publié: (2021)
par: Zhang, Weitong, et autres
Publié: (2021)
On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference
par: Yu, Yue, et autres
Publié: (2025)
par: Yu, Yue, et autres
Publié: (2025)
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
par: Zhao, Linxi, et autres
Publié: (2024)
par: Zhao, Linxi, et autres
Publié: (2024)
Fast Sampling via Discrete Non-Markov Diffusion Models with Predetermined Transition Time
par: Chen, Zixiang, et autres
Publié: (2023)
par: Chen, Zixiang, et autres
Publié: (2023)
Provable Zero-Shot Generalization in Offline Reinforcement Learning
par: Wang, Zhiyong, et autres
Publié: (2025)
par: Wang, Zhiyong, et autres
Publié: (2025)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
par: He, Jiafan, et autres
Publié: (2025)
par: He, Jiafan, et autres
Publié: (2025)
Near-Optimal Second-Order Guarantees for Model-Based Adversarial Imitation Learning
par: Li, Shangzhe, et autres
Publié: (2025)
par: Li, Shangzhe, et autres
Publié: (2025)
Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration
par: Zhao, Heyang, et autres
Publié: (2025)
par: Zhao, Heyang, et autres
Publié: (2025)
Exploration Through Introspection: A Self-Aware Reward Model
par: Petrowski, Michael, et autres
Publié: (2026)
par: Petrowski, Michael, et autres
Publié: (2026)
Return-to-Go Is More Than a Number: Q-Guided Alignment for Return-Conditioned Supervised Learning
par: Yang, Yuxiao, et autres
Publié: (2026)
par: Yang, Yuxiao, et autres
Publié: (2026)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
par: Zhang, Yifan, et autres
Publié: (2024)
par: Zhang, Yifan, et autres
Publié: (2024)
Energy-Weighted Flow Matching for Offline Reinforcement Learning
par: Zhang, Shiyuan, et autres
Publié: (2025)
par: Zhang, Shiyuan, et autres
Publié: (2025)
RewardUQ: A Unified Framework for Uncertainty-Aware Reward Models
par: Yang, Daniel, et autres
Publié: (2026)
par: Yang, Daniel, et autres
Publié: (2026)
Exploration by Random Reward Perturbation
par: Ma, Haozhe, et autres
Publié: (2025)
par: Ma, Haozhe, et autres
Publié: (2025)
Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic Shortest Path
par: Di, Qiwei, et autres
Publié: (2024)
par: Di, Qiwei, et autres
Publié: (2024)
OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning
par: Yang, Yuxiao, et autres
Publié: (2026)
par: Yang, Yuxiao, et autres
Publié: (2026)
Towards Differentially Private Reinforcement Learning with General Function Approximation
par: He, Yi, et autres
Publié: (2026)
par: He, Yi, et autres
Publié: (2026)
Higher-order Linear Attention
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
Embodiment-Aware Generalist Specialist Distillation for Unified Humanoid Whole-Body Control
par: Peng, Quanquan, et autres
Publié: (2026)
par: Peng, Quanquan, et autres
Publié: (2026)
Variance-Dependent Regret Bounds for Non-stationary Linear Bandits
par: Wang, Zhiyong, et autres
Publié: (2024)
par: Wang, Zhiyong, et autres
Publié: (2024)
Kernel-Based Function Approximation for Average Reward Reinforcement Learning: An Optimist No-Regret Algorithm
par: Vakili, Sattar, et autres
Publié: (2024)
par: Vakili, Sattar, et autres
Publié: (2024)
Understanding Transferable Representation Learning and Zero-shot Transfer in CLIP
par: Chen, Zixiang, et autres
Publié: (2023)
par: Chen, Zixiang, et autres
Publié: (2023)
BaNEL: Exploration Posteriors for Generative Modeling Using Only Negative Rewards
par: Lee, Sangyun, et autres
Publié: (2025)
par: Lee, Sangyun, et autres
Publié: (2025)
Return Augmented Decision Transformer for Off-Dynamics Reinforcement Learning
par: Wang, Ruhan, et autres
Publié: (2024)
par: Wang, Ruhan, et autres
Publié: (2024)
How to Provably Improve Return Conditioned Supervised Learning?
par: Liu, Zhishuai, et autres
Publié: (2025)
par: Liu, Zhishuai, et autres
Publié: (2025)
Accelerated Preference Optimization for Large Language Model Alignment
par: He, Jiafan, et autres
Publié: (2024)
par: He, Jiafan, et autres
Publié: (2024)
UCPO: Uncertainty-Aware Policy Optimization
par: Zeng, Xianzhou, et autres
Publié: (2026)
par: Zeng, Xianzhou, et autres
Publié: (2026)
Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation
par: Zhang, Xiaoying, et autres
Publié: (2024)
par: Zhang, Xiaoying, et autres
Publié: (2024)
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
par: Chen, Kesheng, et autres
Publié: (2025)
par: Chen, Kesheng, et autres
Publié: (2025)
Provably Efficient Exploration in Reward Machines with Low Regret
par: Bourel, Hippolyte, et autres
Publié: (2024)
par: Bourel, Hippolyte, et autres
Publié: (2024)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
par: Russo, Alessio, et autres
Publié: (2025)
par: Russo, Alessio, et autres
Publié: (2025)
Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking
par: Singha, Disha
Publié: (2026)
par: Singha, Disha
Publié: (2026)
Distribution-Free Uncertainty-Aware Virtual Sensing via Conformalized Neural Operators
par: Kobayashi, Kazuma, et autres
Publié: (2025)
par: Kobayashi, Kazuma, et autres
Publié: (2025)
Fairness Aware Reward Optimization
par: Choi, Ching Lam, et autres
Publié: (2026)
par: Choi, Ching Lam, et autres
Publié: (2026)
RewardAnything: Generalizable Principle-Following Reward Models
par: Yu, Zhuohao, et autres
Publié: (2025)
par: Yu, Zhuohao, et autres
Publié: (2025)
Documents similaires
-
Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs
par: Zhang, Junkai, et autres
Publié: (2023) -
CoPS: Empowering LLM Agents with Provable Cross-Task Experience Sharing
par: Yang, Chen, et autres
Publié: (2024) -
Sample and Computationally Efficient Continuous-Time Reinforcement Learning with General Function Approximation
par: Zhao, Runze, et autres
Publié: (2025) -
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
par: Deng, Yihe, et autres
Publié: (2023) -
Causal Graph ODE: Continuous Treatment Effect Modeling in Multi-agent Dynamical Systems
par: Huang, Zijie, et autres
Publié: (2024)