Distributionally Robust Model-based Reinforcement Learning with Large State Spaces
Fuente:
arXiv
Salvato in:
| Autori principali: | Ramesh, Shyam Sundhar, Sessa, Pier Giuseppe, Hu, Yifan, Krause, Andreas, Bogunovic, Ilija |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Robust Multi-Objective Controlled Decoding of Large Language Models
di: Son, Seongho, et al.
Pubblicazione: (2025)
di: Son, Seongho, et al.
Pubblicazione: (2025)
Group Robust Preference Optimization in Reward-free RLHF
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024)
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024)
LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?
di: Ziomek, Juliusz, et al.
Pubblicazione: (2026)
di: Ziomek, Juliusz, et al.
Pubblicazione: (2026)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2026)
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2026)
Adversarially Robust Decision Transformer
di: Tang, Xiaohang, et al.
Pubblicazione: (2024)
di: Tang, Xiaohang, et al.
Pubblicazione: (2024)
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
di: Ji, Xiaotong, et al.
Pubblicazione: (2025)
di: Ji, Xiaotong, et al.
Pubblicazione: (2025)
Optimistic Games for Combinatorial Bayesian Optimization with Application to Protein Design
di: Bal, Melis Ilayda, et al.
Pubblicazione: (2024)
di: Bal, Melis Ilayda, et al.
Pubblicazione: (2024)
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
di: Tang, Xiaohang, et al.
Pubblicazione: (2026)
di: Tang, Xiaohang, et al.
Pubblicazione: (2026)
wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
RSPO: Regularized Self-Play Alignment of Large Language Models
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
PROWL: Prioritized Regret-Driven Optimization for World Model Learning
di: Güzel, Ahmet H., et al.
Pubblicazione: (2026)
di: Güzel, Ahmet H., et al.
Pubblicazione: (2026)
This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
Contextual Bilevel Reinforcement Learning for Incentive Alignment
di: Thoma, Vinzenz, et al.
Pubblicazione: (2024)
di: Thoma, Vinzenz, et al.
Pubblicazione: (2024)
Learning Safety Constraints for Large Language Models
di: Chen, Xin, et al.
Pubblicazione: (2025)
di: Chen, Xin, et al.
Pubblicazione: (2025)
Synthetic Data is Sufficient for Zero-Shot Visual Generalization from Offline Data
di: Güzel, Ahmet H., et al.
Pubblicazione: (2025)
di: Güzel, Ahmet H., et al.
Pubblicazione: (2025)
Imagine Beyond! Distributionally Robust Auto-Encoding for State Space Coverage in Online Reinforcement Learning
di: Castanet, Nicolas, et al.
Pubblicazione: (2025)
di: Castanet, Nicolas, et al.
Pubblicazione: (2025)
Uncertainty-Aware Robotic World Model Makes Offline Model-Based Reinforcement Learning Work on Real Robots
di: Li, Chenhao, et al.
Pubblicazione: (2025)
di: Li, Chenhao, et al.
Pubblicazione: (2025)
Offline Reinforcement Learning in Large State Spaces: Algorithms and Guarantees
di: Jiang, Nan, et al.
Pubblicazione: (2025)
di: Jiang, Nan, et al.
Pubblicazione: (2025)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
di: Bao, Yicheng, et al.
Pubblicazione: (2026)
di: Bao, Yicheng, et al.
Pubblicazione: (2026)
Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
di: Hübotter, Jonas, et al.
Pubblicazione: (2025)
di: Hübotter, Jonas, et al.
Pubblicazione: (2025)
Model-based Reinforcement Learning for Parameterized Action Spaces
di: Zhang, Renhao, et al.
Pubblicazione: (2024)
di: Zhang, Renhao, et al.
Pubblicazione: (2024)
An Advantage-based Optimization Method for Reinforcement Learning in Large Action Space
di: Lin, Hai, et al.
Pubblicazione: (2024)
di: Lin, Hai, et al.
Pubblicazione: (2024)
Robotic World Model: A Neural Network Simulator for Robust Policy Optimization in Robotics
di: Li, Chenhao, et al.
Pubblicazione: (2025)
di: Li, Chenhao, et al.
Pubblicazione: (2025)
Single-Trajectory Distributionally Robust Reinforcement Learning
di: Liang, Zhipeng, et al.
Pubblicazione: (2023)
di: Liang, Zhipeng, et al.
Pubblicazione: (2023)
Bridging Large Language Models and Graph Structure Learning Models for Robust Representation Learning
di: Su, Guangxin, et al.
Pubblicazione: (2024)
di: Su, Guangxin, et al.
Pubblicazione: (2024)
DISCOVER: Automated Curricula for Sparse-Reward Reinforcement Learning
di: Diaz-Bone, Leander, et al.
Pubblicazione: (2025)
di: Diaz-Bone, Leander, et al.
Pubblicazione: (2025)
RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs
di: Zhou, Runlong, et al.
Pubblicazione: (2025)
di: Zhou, Runlong, et al.
Pubblicazione: (2025)
Decision Mamba: Reinforcement Learning via Sequence Modeling with Selective State Spaces
di: Ota, Toshihiro
Pubblicazione: (2024)
di: Ota, Toshihiro
Pubblicazione: (2024)
On the Geometry of Reinforcement Learning in Continuous State and Action Spaces
di: Tiwari, Saket, et al.
Pubblicazione: (2022)
di: Tiwari, Saket, et al.
Pubblicazione: (2022)
Episodic Reinforcement Learning with Expanded State-reward Space
di: Liang, Dayang, et al.
Pubblicazione: (2024)
di: Liang, Dayang, et al.
Pubblicazione: (2024)
Evolutionary Discovery of Reinforcement Learning Algorithms via Large Language Models
di: Sygkounas, Alkis, et al.
Pubblicazione: (2026)
di: Sygkounas, Alkis, et al.
Pubblicazione: (2026)
Imagined Autocurricula
di: Güzel, Ahmet H., et al.
Pubblicazione: (2025)
di: Güzel, Ahmet H., et al.
Pubblicazione: (2025)
Robustness Evaluation for Video Models with Reinforcement Learning
di: Babu, Ashwin Ramesh, et al.
Pubblicazione: (2025)
di: Babu, Ashwin Ramesh, et al.
Pubblicazione: (2025)
Geometry of Neural Reinforcement Learning in Continuous State and Action Spaces
di: Tiwari, Saket, et al.
Pubblicazione: (2025)
di: Tiwari, Saket, et al.
Pubblicazione: (2025)
Exploring Adversarial Robustness of Deep State Space Models
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Robust Deep Reinforcement Learning with Adaptive Adversarial Perturbations in Action Space
di: Liu, Qianmei, et al.
Pubblicazione: (2024)
di: Liu, Qianmei, et al.
Pubblicazione: (2024)
Sampling-Based Safe Reinforcement Learning
di: Vignola, Luca, et al.
Pubblicazione: (2026)
di: Vignola, Luca, et al.
Pubblicazione: (2026)
Robust Bayesian Optimisation with Unbounded Corruptions
di: Ezzerg, Abdelhamid, et al.
Pubblicazione: (2025)
di: Ezzerg, Abdelhamid, et al.
Pubblicazione: (2025)
Sample Efficient Preference Alignment in LLMs via Active Exploration
di: Mehta, Viraj, et al.
Pubblicazione: (2023)
di: Mehta, Viraj, et al.
Pubblicazione: (2023)
Tree Search in DAG Space with Model-based Reinforcement Learning for Causal Discovery
di: Darvariu, Victor-Alexandru, et al.
Pubblicazione: (2023)
di: Darvariu, Victor-Alexandru, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Robust Multi-Objective Controlled Decoding of Large Language Models
di: Son, Seongho, et al.
Pubblicazione: (2025) -
Group Robust Preference Optimization in Reward-free RLHF
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024) -
LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?
di: Ziomek, Juliusz, et al.
Pubblicazione: (2026) -
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2026) -
Adversarially Robust Decision Transformer
di: Tang, Xiaohang, et al.
Pubblicazione: (2024)