Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
Fuente:
arXiv
Guardado en:
| Autores principales: | Hong, Joey, Dragan, Anca, Levine, Sergey |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
por: Hong, Joey, et al.
Publicado: (2024)
por: Hong, Joey, et al.
Publicado: (2024)
Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations
por: Hong, Joey, et al.
Publicado: (2024)
por: Hong, Joey, et al.
Publicado: (2024)
OGBench: Benchmarking Offline Goal-Conditioned RL
por: Park, Seohong, et al.
Publicado: (2024)
por: Park, Seohong, et al.
Publicado: (2024)
HIQL: Offline Goal-Conditioned RL with Latent States as Actions
por: Park, Seohong, et al.
Publicado: (2023)
por: Park, Seohong, et al.
Publicado: (2023)
Learning to Assist Humans without Inferring Rewards
por: Myers, Vivek, et al.
Publicado: (2024)
por: Myers, Vivek, et al.
Publicado: (2024)
The Synergy of LLMs & RL Unlocks Offline Learning of Generalizable Language-Conditioned Policies with Low-fidelity Data
por: Pouplin, Thomas, et al.
Publicado: (2024)
por: Pouplin, Thomas, et al.
Publicado: (2024)
Zero-Overhead Introspection for Adaptive Test-Time Compute
por: Manvi, Rohin, et al.
Publicado: (2025)
por: Manvi, Rohin, et al.
Publicado: (2025)
Improved Generalized Planning with LLMs through Strategy Refinement and Reflection
por: Stein, Katharina, et al.
Publicado: (2025)
por: Stein, Katharina, et al.
Publicado: (2025)
Context Steering: Controllable Personalization at Inference Time
por: He, Jerry Zhi-Yang, et al.
Publicado: (2024)
por: He, Jerry Zhi-Yang, et al.
Publicado: (2024)
Self-Guided Plan Extraction for Instruction-Following Tasks with Goal-Conditional Reinforcement Learning
por: Volovikova, Zoya, et al.
Publicado: (2026)
por: Volovikova, Zoya, et al.
Publicado: (2026)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
por: Zhou, Yifei, et al.
Publicado: (2024)
por: Zhou, Yifei, et al.
Publicado: (2024)
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
por: Abdulhai, Marwa, et al.
Publicado: (2025)
por: Abdulhai, Marwa, et al.
Publicado: (2025)
Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
por: Xie, Tian, et al.
Publicado: (2025)
por: Xie, Tian, et al.
Publicado: (2025)
Plan-and-Write: Structure-Guided Length Control for LLMs without Model Retraining
por: Akinfaderin, Adewale, et al.
Publicado: (2025)
por: Akinfaderin, Adewale, et al.
Publicado: (2025)
Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data
por: Zheng, Chongyi, et al.
Publicado: (2023)
por: Zheng, Chongyi, et al.
Publicado: (2023)
Quantifying and Mitigating Premature Closure in Frontier LLMs
por: Handler, Rebecca, et al.
Publicado: (2026)
por: Handler, Rebecca, et al.
Publicado: (2026)
SDA: Steering-Driven Distribution Alignment for Open LLMs without Fine-Tuning
por: Xia, Wei, et al.
Publicado: (2025)
por: Xia, Wei, et al.
Publicado: (2025)
Query-Dependent Prompt Evaluation and Optimization with Offline Inverse RL
por: Sun, Hao, et al.
Publicado: (2023)
por: Sun, Hao, et al.
Publicado: (2023)
RL from Teacher-Model Refinement: Gradual Imitation Learning for Machine Translation
por: Lee, Dongyub Jude, et al.
Publicado: (2025)
por: Lee, Dongyub Jude, et al.
Publicado: (2025)
Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning
por: Shi, Yaorui, et al.
Publicado: (2025)
por: Shi, Yaorui, et al.
Publicado: (2025)
Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs
por: Schlatter, Jeremy, et al.
Publicado: (2025)
por: Schlatter, Jeremy, et al.
Publicado: (2025)
Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL
por: Zheng, Kunhao, et al.
Publicado: (2026)
por: Zheng, Kunhao, et al.
Publicado: (2026)
Stitching Sub-Trajectories with Conditional Diffusion Model for Goal-Conditioned Offline RL
por: Kim, Sungyoon, et al.
Publicado: (2024)
por: Kim, Sungyoon, et al.
Publicado: (2024)
Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration
por: He, Bowei, et al.
Publicado: (2026)
por: He, Bowei, et al.
Publicado: (2026)
Grammar and Gameplay-aligned RL for Game Description Generation with LLMs
por: Tanaka, Tsunehiko, et al.
Publicado: (2025)
por: Tanaka, Tsunehiko, et al.
Publicado: (2025)
Personalized Learning Path Planning with Goal-Driven Learner State Modeling
por: Lim, Joy Jia Yin, et al.
Publicado: (2025)
por: Lim, Joy Jia Yin, et al.
Publicado: (2025)
Plan-Grounded Large Language Models for Dual Goal Conversational Settings
por: Glória-Silva, Diogo, et al.
Publicado: (2024)
por: Glória-Silva, Diogo, et al.
Publicado: (2024)
Unlocking Recursive Thinking of LLMs: Alignment via Refinement
por: Zhang, Haoke, et al.
Publicado: (2025)
por: Zhang, Haoke, et al.
Publicado: (2025)
Offline RL for Adaptive Policy Retrieval in Prior Authorization
por: Sharifullin, Ruslan, et al.
Publicado: (2026)
por: Sharifullin, Ruslan, et al.
Publicado: (2026)
Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL
por: Choi, Jinwoo, et al.
Publicado: (2026)
por: Choi, Jinwoo, et al.
Publicado: (2026)
Scalable Offline Model-Based RL with Action Chunks
por: Park, Kwanyoung, et al.
Publicado: (2025)
por: Park, Kwanyoung, et al.
Publicado: (2025)
Is Value Learning Really the Main Bottleneck in Offline RL?
por: Park, Seohong, et al.
Publicado: (2024)
por: Park, Seohong, et al.
Publicado: (2024)
Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
por: Wang, Qibin, et al.
Publicado: (2025)
por: Wang, Qibin, et al.
Publicado: (2025)
Planning Transformer: Long-Horizon Offline Reinforcement Learning with Planning Tokens
por: Clinton, Joseph, et al.
Publicado: (2024)
por: Clinton, Joseph, et al.
Publicado: (2024)
Tailored Conversations beyond LLMs: A RL-Based Dialogue Manager
por: Galland, Lucie, et al.
Publicado: (2025)
por: Galland, Lucie, et al.
Publicado: (2025)
Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key
por: Wang, Tianle, et al.
Publicado: (2026)
por: Wang, Tianle, et al.
Publicado: (2026)
Learning to Model the World with Language
por: Lin, Jessy, et al.
Publicado: (2023)
por: Lin, Jessy, et al.
Publicado: (2023)
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
por: Du, Yuwen, et al.
Publicado: (2026)
por: Du, Yuwen, et al.
Publicado: (2026)
Contextual ASR Error Handling with LLMs Augmentation for Goal-Oriented Conversational AI
por: Asano, Yuya, et al.
Publicado: (2025)
por: Asano, Yuya, et al.
Publicado: (2025)
Goal-Directed Search Outperforms Goal-Agnostic Memory Compression in Long-Context Memory Tasks
por: Zheng, Yicong, et al.
Publicado: (2025)
por: Zheng, Yicong, et al.
Publicado: (2025)
Ejemplares similares
-
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
por: Hong, Joey, et al.
Publicado: (2024) -
Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations
por: Hong, Joey, et al.
Publicado: (2024) -
OGBench: Benchmarking Offline Goal-Conditioned RL
por: Park, Seohong, et al.
Publicado: (2024) -
HIQL: Offline Goal-Conditioned RL with Latent States as Actions
por: Park, Seohong, et al.
Publicado: (2023) -
Learning to Assist Humans without Inferring Rewards
por: Myers, Vivek, et al.
Publicado: (2024)