Semi-pessimistic Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Jin, Zhou, Xin, Yao, Jiaang, Aminian, Gholamali, Rivasplata, Omar, Little, Simon, Li, Lexin, Shi, Chengchun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Semi-supervised Batch Learning From Logged Data
di: Aminian, Gholamali, et al.
Pubblicazione: (2022)
di: Aminian, Gholamali, et al.
Pubblicazione: (2022)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
di: Ye, Kai, et al.
Pubblicazione: (2025)
di: Ye, Kai, et al.
Pubblicazione: (2025)
PAC-Bayesian Reinforcement Learning Trains Generalizable Policies
di: Zitouni, Abdelkrim, et al.
Pubblicazione: (2025)
di: Zitouni, Abdelkrim, et al.
Pubblicazione: (2025)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
di: Zhu, Jin, et al.
Pubblicazione: (2023)
di: Zhu, Jin, et al.
Pubblicazione: (2023)
Doubly Inhomogeneous Reinforcement Learning
di: Hu, Liyuan, et al.
Pubblicazione: (2022)
di: Hu, Liyuan, et al.
Pubblicazione: (2022)
ReDiF: Reinforced Distillation for Few Step Diffusion
di: Tighkhorshid, Amirhossein, et al.
Pubblicazione: (2025)
di: Tighkhorshid, Amirhossein, et al.
Pubblicazione: (2025)
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
di: Wang, Danyang, et al.
Pubblicazione: (2024)
di: Wang, Danyang, et al.
Pubblicazione: (2024)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
Learn-to-Distance: Distance Learning for Detecting LLM-Generated Text
di: Zhou, Hongyi, et al.
Pubblicazione: (2026)
di: Zhou, Hongyi, et al.
Pubblicazione: (2026)
Dive into Waves: Morlet Spectral Transformer for Cross-Subject Emotion Decoding from EEG
di: Qing, Jiaxin, et al.
Pubblicazione: (2026)
di: Qing, Jiaxin, et al.
Pubblicazione: (2026)
Conformal Diffusion Models for Individual Treatment Effect Estimation and Inference
di: Cai, Hengrui, et al.
Pubblicazione: (2024)
di: Cai, Hengrui, et al.
Pubblicazione: (2024)
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
di: Behnamnia, Armin, et al.
Pubblicazione: (2025)
di: Behnamnia, Armin, et al.
Pubblicazione: (2025)
Doubly Robust Alignment for Large Language Models
di: Xu, Erhan, et al.
Pubblicazione: (2025)
di: Xu, Erhan, et al.
Pubblicazione: (2025)
Semi-supervised Anomaly Detection via Adaptive Reinforcement Learning-Enabled Method with Causal Inference for Sensor Signals
di: Chen, Xiangwei, et al.
Pubblicazione: (2024)
di: Chen, Xiangwei, et al.
Pubblicazione: (2024)
Reinforcement Learning-Guided Semi-Supervised Learning
di: Heidari, Marzi, et al.
Pubblicazione: (2024)
di: Heidari, Marzi, et al.
Pubblicazione: (2024)
Infrared Spectra Prediction for Diazo Groups Utilizing a Machine Learning Approach with Structural Attention Mechanism
di: Liu, Chengchun, et al.
Pubblicazione: (2024)
di: Liu, Chengchun, et al.
Pubblicazione: (2024)
Causal Deepsets for Off-policy Evaluation under Spatial or Spatio-temporal Interferences
di: Dai, Runpeng, et al.
Pubblicazione: (2024)
di: Dai, Runpeng, et al.
Pubblicazione: (2024)
Adaptive Data Exploitation in Deep Reinforcement Learning
di: Yuan, Mingqi, et al.
Pubblicazione: (2025)
di: Yuan, Mingqi, et al.
Pubblicazione: (2025)
An LLM Feature-based Framework for Dialogue Constructiveness Assessment
di: Zhou, Lexin, et al.
Pubblicazione: (2024)
di: Zhou, Lexin, et al.
Pubblicazione: (2024)
Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach
di: Li, Wenyun, et al.
Pubblicazione: (2025)
di: Li, Wenyun, et al.
Pubblicazione: (2025)
SemiReward: A General Reward Model for Semi-supervised Learning
di: Li, Siyuan, et al.
Pubblicazione: (2023)
di: Li, Siyuan, et al.
Pubblicazione: (2023)
SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning
di: Wang, Jichao, et al.
Pubblicazione: (2026)
di: Wang, Jichao, et al.
Pubblicazione: (2026)
ULTHO: Ultra-Lightweight yet Efficient Hyperparameter Optimization in Deep Reinforcement Learning
di: Yuan, Mingqi, et al.
Pubblicazione: (2025)
di: Yuan, Mingqi, et al.
Pubblicazione: (2025)
Understanding Transfer Learning via Mean-field Analysis
di: Aminian, Gholamali, et al.
Pubblicazione: (2024)
di: Aminian, Gholamali, et al.
Pubblicazione: (2024)
Semi-Supervised Federated Learning via Dual Contrastive Learning and Soft Labeling for Intelligent Fault Diagnosis
di: Dai, Yajiao, et al.
Pubblicazione: (2025)
di: Dai, Yajiao, et al.
Pubblicazione: (2025)
TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning
di: Yang, Shenzhi, et al.
Pubblicazione: (2025)
di: Yang, Shenzhi, et al.
Pubblicazione: (2025)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
di: Gao, Xiancheng, et al.
Pubblicazione: (2025)
di: Gao, Xiancheng, et al.
Pubblicazione: (2025)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
di: Zhan, Simon Sinong, et al.
Pubblicazione: (2025)
di: Zhan, Simon Sinong, et al.
Pubblicazione: (2025)
Robust Semi-supervised Learning via $f$-Divergence and $α$-Rényi Divergence
di: Aminian, Gholamali, et al.
Pubblicazione: (2024)
di: Aminian, Gholamali, et al.
Pubblicazione: (2024)
Statistical Inference in Reinforcement Learning: A Selective Survey
di: Shi, Chengchun
Pubblicazione: (2025)
di: Shi, Chengchun
Pubblicazione: (2025)
RLLTE: Long-Term Evolution Project of Reinforcement Learning
di: Yuan, Mingqi, et al.
Pubblicazione: (2023)
di: Yuan, Mingqi, et al.
Pubblicazione: (2023)
Expert Divergence Learning for MoE-based Language Models
di: Li, Jiaang, et al.
Pubblicazione: (2026)
di: Li, Jiaang, et al.
Pubblicazione: (2026)
Securing Healthcare with Deep Learning: A CNN-Based Model for medical IoT Threat Detection
di: Mohamadi, Alireza, et al.
Pubblicazione: (2024)
di: Mohamadi, Alireza, et al.
Pubblicazione: (2024)
AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
UI-S1: Advancing GUI Automation via Semi-online Reinforcement Learning
di: Lu, Zhengxi, et al.
Pubblicazione: (2025)
di: Lu, Zhengxi, et al.
Pubblicazione: (2025)
MAIDCRL: Semi-centralized Multi-Agent Influence Dense-CNN Reinforcement Learning
di: Nipu, Ayesha Siddika, et al.
Pubblicazione: (2024)
di: Nipu, Ayesha Siddika, et al.
Pubblicazione: (2024)
Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning
di: Zhu, Ting, et al.
Pubblicazione: (2024)
di: Zhu, Ting, et al.
Pubblicazione: (2024)
Multi-Objective Learning for Diffusion Models: A Statistical Theory under Semi-Supervised Learning
di: Cheng, Ziheng, et al.
Pubblicazione: (2026)
di: Cheng, Ziheng, et al.
Pubblicazione: (2026)
ELDER: Enhancing Lifelong Model Editing with Mixture-of-LoRA
di: Li, Jiaang, et al.
Pubblicazione: (2024)
di: Li, Jiaang, et al.
Pubblicazione: (2024)
FAuNO: Semi-Asynchronous Federated Reinforcement Learning Framework for Task Offloading in Edge Systems
di: Metelo, Frederico, et al.
Pubblicazione: (2025)
di: Metelo, Frederico, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Semi-supervised Batch Learning From Logged Data
di: Aminian, Gholamali, et al.
Pubblicazione: (2022) -
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
di: Ye, Kai, et al.
Pubblicazione: (2025) -
PAC-Bayesian Reinforcement Learning Trains Generalizable Policies
di: Zitouni, Abdelkrim, et al.
Pubblicazione: (2025) -
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
di: Zhu, Jin, et al.
Pubblicazione: (2023) -
Doubly Inhomogeneous Reinforcement Learning
di: Hu, Liyuan, et al.
Pubblicazione: (2022)