How to Solve Contextual Goal-Oriented Problems with Offline Datasets?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fan, Ying, Li, Jingling, Swaminathan, Adith, Modi, Aditya, Cheng, Ching-An |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Provably Learning from Language Feedback
par: Xu, Wanqiao, et autres
Publié: (2025)
par: Xu, Wanqiao, et autres
Publié: (2025)
Trace is the Next AutoDiff: Generative Optimization with Rich Feedback, Execution Traces, and LLMs
par: Cheng, Ching-An, et autres
Publié: (2024)
par: Cheng, Ching-An, et autres
Publié: (2024)
The Context Gathering Decision Process: A POMDP Framework for Agentic Search
par: Kausik, Chinmaya, et autres
Publié: (2026)
par: Kausik, Chinmaya, et autres
Publié: (2026)
Goal-Oriented Skill Abstraction for Offline Multi-Task Reinforcement Learning
par: He, Jinmin, et autres
Publié: (2025)
par: He, Jinmin, et autres
Publié: (2025)
A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs
par: Chang, Trenton, et autres
Publié: (2025)
par: Chang, Trenton, et autres
Publié: (2025)
When Are RL Hyperparameters Benign? A Study in Offline Goal-Conditioned RL
par: Töpperwien, Jan Malte, et autres
Publié: (2026)
par: Töpperwien, Jan Malte, et autres
Publié: (2026)
On Overcoming Miscalibrated Conversational Priors in LLM-based Chatbots
par: Herlihy, Christine, et autres
Publié: (2024)
par: Herlihy, Christine, et autres
Publié: (2024)
Lost in Transmission: When and Why LLMs Fail to Reason Globally
par: Schnabel, Tobias, et autres
Publié: (2025)
par: Schnabel, Tobias, et autres
Publié: (2025)
Reasoning about Reasoning: BAPO Bounds on Chain-of-Thought Token Complexity in LLMs
par: Tomlinson, Kiran, et autres
Publié: (2026)
par: Tomlinson, Kiran, et autres
Publié: (2026)
Improving Offline RL by Blending Heuristics
par: Geng, Sinong, et autres
Publié: (2023)
par: Geng, Sinong, et autres
Publié: (2023)
Group-Sensitive Offline Contextual Bandits
par: Guo, Yihong, et autres
Publié: (2025)
par: Guo, Yihong, et autres
Publié: (2025)
Combining Open-box Simulation and Importance Sampling for Tuning Large-Scale Recommenders
par: Paneri, Kaushal, et autres
Publié: (2024)
par: Paneri, Kaushal, et autres
Publié: (2024)
Reachability Weighted Offline Goal-conditioned Resampling
par: Yang, Wenyan, et autres
Publié: (2025)
par: Yang, Wenyan, et autres
Publié: (2025)
A Novel Approach to Solving Goal-Achieving Problems for Board Games
par: Shih, Chung-Chin, et autres
Publié: (2021)
par: Shih, Chung-Chin, et autres
Publié: (2021)
Contextual Online Pricing with (Biased) Offline Data
par: Zhang, Yixuan, et autres
Publié: (2025)
par: Zhang, Yixuan, et autres
Publié: (2025)
Offline Contextual Bandits in the Presence of New Actions
par: Kishimoto, Ren, et autres
Publié: (2026)
par: Kishimoto, Ren, et autres
Publié: (2026)
Offline Contextual Bandit with Counterfactual Sample Identification
par: Gilotte, Alexandre, et autres
Publié: (2025)
par: Gilotte, Alexandre, et autres
Publié: (2025)
Learning to Solve Complex Problems via Dataset Decomposition
par: Zhao, Wanru, et autres
Publié: (2026)
par: Zhao, Wanru, et autres
Publié: (2026)
Offline Reinforcement Learning with Imbalanced Datasets
par: Jiang, Li, et autres
Publié: (2023)
par: Jiang, Li, et autres
Publié: (2023)
Offline Goal-conditioned Reinforcement Learning with Quasimetric Representations
par: Myers, Vivek, et autres
Publié: (2025)
par: Myers, Vivek, et autres
Publié: (2025)
MGDA: Model-based Goal Data Augmentation for Offline Goal-conditioned Weighted Supervised Learning
par: Lei, Xing, et autres
Publié: (2024)
par: Lei, Xing, et autres
Publié: (2024)
OGBench: Benchmarking Offline Goal-Conditioned RL
par: Park, Seohong, et autres
Publié: (2024)
par: Park, Seohong, et autres
Publié: (2024)
Abstraction for Offline Goal-Conditioned Reinforcement Learning
par: Wibault, Clarisse, et autres
Publié: (2026)
par: Wibault, Clarisse, et autres
Publié: (2026)
Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL
par: Choi, Jinwoo, et autres
Publié: (2026)
par: Choi, Jinwoo, et autres
Publié: (2026)
Test-time Offline Reinforcement Learning on Goal-related Experience
par: Bagatella, Marco, et autres
Publié: (2025)
par: Bagatella, Marco, et autres
Publié: (2025)
Offline Goal-Conditioned Reinforcement Learning with Projective Quasimetric Planning
par: Kobanda, Anthony, et autres
Publié: (2025)
par: Kobanda, Anthony, et autres
Publié: (2025)
Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning
par: Kang, Hyungkyu, et autres
Publié: (2026)
par: Kang, Hyungkyu, et autres
Publié: (2026)
Selective Uncertainty Propagation in Offline RL
par: Krishnamurthy, Sanath Kumar, et autres
Publié: (2023)
par: Krishnamurthy, Sanath Kumar, et autres
Publié: (2023)
Integrated Offline and Online Learning to Solve a Large Class of Scheduling Problems
par: Liu, Anbang, et autres
Publié: (2025)
par: Liu, Anbang, et autres
Publié: (2025)
Direction-Aware Offline-to-Online Learning in Linear Contextual Bandits
par: Han, Zean, et autres
Publié: (2026)
par: Han, Zean, et autres
Publié: (2026)
Contextual Latent World Models for Offline Meta Reinforcement Learning
par: Nakheai, Mohammadreza, et autres
Publié: (2026)
par: Nakheai, Mohammadreza, et autres
Publié: (2026)
Streetwise Agents: Empowering Offline RL Policies to Outsmart Exogenous Stochastic Disturbances in RTC
par: Soni, Aditya, et autres
Publié: (2024)
par: Soni, Aditya, et autres
Publié: (2024)
Understanding the Challenges in Iterative Generative Optimization with LLMs
par: Nie, Allen, et autres
Publié: (2026)
par: Nie, Allen, et autres
Publié: (2026)
Solving Continual Offline Reinforcement Learning with Decision Transformer
par: Huang, Kaixin, et autres
Publié: (2024)
par: Huang, Kaixin, et autres
Publié: (2024)
Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning
par: Kim, Junseok, et autres
Publié: (2026)
par: Kim, Junseok, et autres
Publié: (2026)
Goal-conditioned Offline Reinforcement Learning through State Space Partitioning
par: Wang, Mianchu, et autres
Publié: (2023)
par: Wang, Mianchu, et autres
Publié: (2023)
Physics-informed Value Learner for Offline Goal-Conditioned Reinforcement Learning
par: Giammarino, Vittorio, et autres
Publié: (2025)
par: Giammarino, Vittorio, et autres
Publié: (2025)
Leveraging Offline Data in Linear Latent Contextual Bandits
par: Kausik, Chinmaya, et autres
Publié: (2024)
par: Kausik, Chinmaya, et autres
Publié: (2024)
Adaptive Estimation and Optimal Control in Offline Contextual MDPs without Stationarity
par: Bhattacharyya, Riddhiman, et autres
Publié: (2026)
par: Bhattacharyya, Riddhiman, et autres
Publié: (2026)
Goal-Conditioned Data Augmentation for Offline Reinforcement Learning
par: Huang, Xingshuai, et autres
Publié: (2024)
par: Huang, Xingshuai, et autres
Publié: (2024)
Documents similaires
-
Provably Learning from Language Feedback
par: Xu, Wanqiao, et autres
Publié: (2025) -
Trace is the Next AutoDiff: Generative Optimization with Rich Feedback, Execution Traces, and LLMs
par: Cheng, Ching-An, et autres
Publié: (2024) -
The Context Gathering Decision Process: A POMDP Framework for Agentic Search
par: Kausik, Chinmaya, et autres
Publié: (2026) -
Goal-Oriented Skill Abstraction for Offline Multi-Task Reinforcement Learning
par: He, Jinmin, et autres
Publié: (2025) -
A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs
par: Chang, Trenton, et autres
Publié: (2025)