State-free Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Mingyu, Pacchiano, Aldo, Zhang, Xuezhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scale-free Adversarial Reinforcement Learning
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
di: Afshar, Aida, et al.
Pubblicazione: (2024)
di: Afshar, Aida, et al.
Pubblicazione: (2024)
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
di: Afshar, Aida, et al.
Pubblicazione: (2025)
di: Afshar, Aida, et al.
Pubblicazione: (2025)
Second Order Bounds for Contextual Bandits with Function Approximation
di: Pacchiano, Aldo
Pubblicazione: (2024)
di: Pacchiano, Aldo
Pubblicazione: (2024)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
Efficient Reinforcement Learning in Probabilistic Reward Machines
di: Lin, Xiaofeng, et al.
Pubblicazione: (2024)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2024)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
In-Context Learning for Pure Exploration
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
Avoiding $\mathbf{exp(R_{max})}$ scaling in RLHF through Preference-based Exploration
di: Chen, Mingyu, et al.
Pubblicazione: (2025)
di: Chen, Mingyu, et al.
Pubblicazione: (2025)
A Theoretical Framework for Partially Observed Reward-States in RLHF
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
di: Kausik, Chinmaya, et al.
Pubblicazione: (2024)
Multiple-policy Evaluation via Density Estimation
di: Chen, Yilei, et al.
Pubblicazione: (2024)
di: Chen, Yilei, et al.
Pubblicazione: (2024)
Data-Driven Online Model Selection With Regret Guarantees
di: Pacchiano, Aldo, et al.
Pubblicazione: (2023)
di: Pacchiano, Aldo, et al.
Pubblicazione: (2023)
In-Context Learning for Pure Exploration in Continuous Spaces
di: Russo, Alessio, et al.
Pubblicazione: (2026)
di: Russo, Alessio, et al.
Pubblicazione: (2026)
Provable Interactive Learning with Hindsight Instruction Feedback
di: Misra, Dipendra, et al.
Pubblicazione: (2024)
di: Misra, Dipendra, et al.
Pubblicazione: (2024)
Experiment Planning with Function Approximation
di: Pacchiano, Aldo, et al.
Pubblicazione: (2024)
di: Pacchiano, Aldo, et al.
Pubblicazione: (2024)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification
di: Baharav, Tavor Z., et al.
Pubblicazione: (2025)
di: Baharav, Tavor Z., et al.
Pubblicazione: (2025)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
di: Brantley, Kianté, et al.
Pubblicazione: (2025)
di: Brantley, Kianté, et al.
Pubblicazione: (2025)
When Less is Enough: Efficient Inference via Collaborative Reasoning
di: Chen, Yilei, et al.
Pubblicazione: (2026)
di: Chen, Yilei, et al.
Pubblicazione: (2026)
Active Preference Optimization for Sample Efficient RLHF
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
Debunk the Myth of SFT Generalization
di: Lin, Xiaofeng, et al.
Pubblicazione: (2025)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2025)
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
di: Wu, Xiefeng, et al.
Pubblicazione: (2025)
di: Wu, Xiefeng, et al.
Pubblicazione: (2025)
Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning
di: Park, Jongchan, et al.
Pubblicazione: (2025)
di: Park, Jongchan, et al.
Pubblicazione: (2025)
Reinforcement Learning with Euclidean Data Augmentation for State-Based Continuous Control
di: Luo, Jinzhu, et al.
Pubblicazione: (2024)
di: Luo, Jinzhu, et al.
Pubblicazione: (2024)
Episodic Reinforcement Learning with Expanded State-reward Space
di: Liang, Dayang, et al.
Pubblicazione: (2024)
di: Liang, Dayang, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression
di: Mao, Yixiu, et al.
Pubblicazione: (2024)
di: Mao, Yixiu, et al.
Pubblicazione: (2024)
ProSh: Probabilistic Shielding for Model-free Reinforcement Learning
di: Court, Edwin Hamel-De le, et al.
Pubblicazione: (2025)
di: Court, Edwin Hamel-De le, et al.
Pubblicazione: (2025)
Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data
di: Jia, Zeyu, et al.
Pubblicazione: (2024)
di: Jia, Zeyu, et al.
Pubblicazione: (2024)
State-Constrained Offline Reinforcement Learning
di: Hepburn, Charles A., et al.
Pubblicazione: (2024)
di: Hepburn, Charles A., et al.
Pubblicazione: (2024)
Symbolic State Partitioning for Reinforcement Learning
di: Ghaffari, Mohsen, et al.
Pubblicazione: (2024)
di: Ghaffari, Mohsen, et al.
Pubblicazione: (2024)
Reinforcement Learning with Exogenous States and Rewards
di: Trimponias, George, et al.
Pubblicazione: (2023)
di: Trimponias, George, et al.
Pubblicazione: (2023)
Augmented Lagrangian Multiplier Network for State-wise Safety in Reinforcement Learning
di: Zhang, Jiaming, et al.
Pubblicazione: (2026)
di: Zhang, Jiaming, et al.
Pubblicazione: (2026)
Learning Markov State Abstractions for Deep Reinforcement Learning
di: Allen, Cameron, et al.
Pubblicazione: (2021)
di: Allen, Cameron, et al.
Pubblicazione: (2021)
Neighboring State-based Exploration for Reinforcement Learning
di: Li, Yu-Teng, et al.
Pubblicazione: (2022)
di: Li, Yu-Teng, et al.
Pubblicazione: (2022)
Leveraging Large Language Models for Effective Label-free Node Classification in Text-Attributed Graphs
di: Zhang, Taiyan, et al.
Pubblicazione: (2024)
di: Zhang, Taiyan, et al.
Pubblicazione: (2024)
A Survey of State Representation Learning for Deep Reinforcement Learning
di: Echchahed, Ayoub, et al.
Pubblicazione: (2025)
di: Echchahed, Ayoub, et al.
Pubblicazione: (2025)
AdaGamma: State-Dependent Discounting for Temporal Adaptation in Reinforcement Learning
di: Wang, Yaomin, et al.
Pubblicazione: (2026)
di: Wang, Yaomin, et al.
Pubblicazione: (2026)
Reflex: Reinforcement Learning with Reflection Symmetry Exploitation in State-Based Continuous Control
di: Zhen, Shuai, et al.
Pubblicazione: (2026)
di: Zhen, Shuai, et al.
Pubblicazione: (2026)
Adviser-Actor-Critic: Eliminating Steady-State Error in Reinforcement Learning Control
di: Chen, Donghe, et al.
Pubblicazione: (2025)
di: Chen, Donghe, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Scale-free Adversarial Reinforcement Learning
di: Chen, Mingyu, et al.
Pubblicazione: (2024) -
Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
di: Afshar, Aida, et al.
Pubblicazione: (2024) -
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
di: Afshar, Aida, et al.
Pubblicazione: (2025) -
Second Order Bounds for Contextual Bandits with Function Approximation
di: Pacchiano, Aldo
Pubblicazione: (2024) -
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)