Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
Fuente:
arXiv
Saved in:
| Main Authors: | Duan, Xintong, He, Yutong, Tajwar, Fahim, Salakhutdinov, Ruslan, Kolter, J. Zico, Schneider, Jeff |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Training a Generally Curious Agent
by: Tajwar, Fahim, et al.
Published: (2025)
by: Tajwar, Fahim, et al.
Published: (2025)
State Combinatorial Generalization In Decision Making With Conditional Diffusion Models
by: Duan, Xintong, et al.
Published: (2025)
by: Duan, Xintong, et al.
Published: (2025)
Blind Inverse Problem Solving Made Easy by Text-to-Image Latent Diffusion
by: Dontas, Michail, et al.
Published: (2024)
by: Dontas, Michail, et al.
Published: (2024)
Can Large Reasoning Models Self-Train?
by: Shafayat, Sheikh, et al.
Published: (2025)
by: Shafayat, Sheikh, et al.
Published: (2025)
Retrospective In-Context Learning for Temporal Credit Assignment with Large Language Models
by: Chen, Wen-Tse, et al.
Published: (2026)
by: Chen, Wen-Tse, et al.
Published: (2026)
Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data
by: Zheng, Chongyi, et al.
Published: (2023)
by: Zheng, Chongyi, et al.
Published: (2023)
One-Step Diffusion Distillation through Score Implicit Matching
by: Luo, Weijian, et al.
Published: (2024)
by: Luo, Weijian, et al.
Published: (2024)
Automated Black-box Prompt Engineering for Personalized Text-to-Image Generation
by: He, Yutong, et al.
Published: (2024)
by: He, Yutong, et al.
Published: (2024)
Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models
by: Ai, Xinyue, et al.
Published: (2025)
by: Ai, Xinyue, et al.
Published: (2025)
Neural MP: A Generalist Neural Motion Planner
by: Dalal, Murtaza, et al.
Published: (2024)
by: Dalal, Murtaza, et al.
Published: (2024)
Mimetic Initialization of MLPs
by: Trockman, Asher, et al.
Published: (2026)
by: Trockman, Asher, et al.
Published: (2026)
SutureFormer: Learning Surgical Trajectories via Goal-conditioned Offline RL in Pixel Space
by: Liu, Huanrong, et al.
Published: (2026)
by: Liu, Huanrong, et al.
Published: (2026)
Stitching Sub-Trajectories with Conditional Diffusion Model for Goal-Conditioned Offline RL
by: Kim, Sungyoon, et al.
Published: (2024)
by: Kim, Sungyoon, et al.
Published: (2024)
Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs
by: Zhu, Siyu, et al.
Published: (2025)
by: Zhu, Siyu, et al.
Published: (2025)
PC-Diffuser: Path-Consistent Capsule CBF Safety Filtering for Diffusion-Based Trajectory Planner
by: Ku, Eugene, et al.
Published: (2026)
by: Ku, Eugene, et al.
Published: (2026)
Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks
by: Dalal, Murtaza, et al.
Published: (2024)
by: Dalal, Murtaza, et al.
Published: (2024)
Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models
by: Bick, Aviv, et al.
Published: (2024)
by: Bick, Aviv, et al.
Published: (2024)
Effective Data Augmentation With Diffusion Models
by: Trabucco, Brandon, et al.
Published: (2023)
by: Trabucco, Brandon, et al.
Published: (2023)
Reasoning as an Adaptive Defense for Safety
by: Kim, Taeyoun, et al.
Published: (2025)
by: Kim, Taeyoun, et al.
Published: (2025)
Offline RL for Adaptive Policy Retrieval in Prior Authorization
by: Sharifullin, Ruslan, et al.
Published: (2026)
by: Sharifullin, Ruslan, et al.
Published: (2026)
Contrastive Difference Predictive Coding
by: Zheng, Chongyi, et al.
Published: (2023)
by: Zheng, Chongyi, et al.
Published: (2023)
Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
by: Prasad, Aaditya, et al.
Published: (2024)
by: Prasad, Aaditya, et al.
Published: (2024)
State-Covering Trajectory Stitching for Diffusion Planners
by: Lee, Kyowoon, et al.
Published: (2025)
by: Lee, Kyowoon, et al.
Published: (2025)
Conservative Prediction via Data-Driven Confidence Minimization
by: Choi, Caroline, et al.
Published: (2023)
by: Choi, Caroline, et al.
Published: (2023)
Collaborative-Distilled Diffusion Models (CDDM) for Accelerated and Lightweight Trajectory Prediction
by: Wang, Bingzhang, et al.
Published: (2025)
by: Wang, Bingzhang, et al.
Published: (2025)
Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward
by: Hussain, Mustafa Anis, et al.
Published: (2026)
by: Hussain, Mustafa Anis, et al.
Published: (2026)
STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order
by: Gu, Chengyang, et al.
Published: (2026)
by: Gu, Chengyang, et al.
Published: (2026)
Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
by: Zhao, Anhao, et al.
Published: (2026)
by: Zhao, Anhao, et al.
Published: (2026)
Intra-Trajectory Consistency for Reward Modeling
by: Zhou, Chaoyang, et al.
Published: (2025)
by: Zhou, Chaoyang, et al.
Published: (2025)
Consistency Trajectory Models: Learning Probability Flow ODE Trajectory of Diffusion
by: Kim, Dongjun, et al.
Published: (2023)
by: Kim, Dongjun, et al.
Published: (2023)
InSTA: Towards Internet-Scale Training For Agents
by: Trabucco, Brandon, et al.
Published: (2025)
by: Trabucco, Brandon, et al.
Published: (2025)
Weight Ensembling Improves Reasoning in Language Models
by: Dang, Xingyu, et al.
Published: (2025)
by: Dang, Xingyu, et al.
Published: (2025)
LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble
by: Lee, Yujeong, et al.
Published: (2024)
by: Lee, Yujeong, et al.
Published: (2024)
A Simple and Effective Pruning Approach for Large Language Models
by: Sun, Mingjie, et al.
Published: (2023)
by: Sun, Mingjie, et al.
Published: (2023)
Looking beyond the next token
by: Thankaraj, Abitha, et al.
Published: (2025)
by: Thankaraj, Abitha, et al.
Published: (2025)
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment
by: Lim, Yooseok, et al.
Published: (2024)
by: Lim, Yooseok, et al.
Published: (2024)
Resisting Stochastic Risks in Diffusion Planners with the Trajectory Aggregation Tree
by: Feng, Lang, et al.
Published: (2024)
by: Feng, Lang, et al.
Published: (2024)
Reward Guided Latent Consistency Distillation
by: Li, Jiachen, et al.
Published: (2024)
by: Li, Jiachen, et al.
Published: (2024)
Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners
by: Paliotta, Daniele, et al.
Published: (2025)
by: Paliotta, Daniele, et al.
Published: (2025)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
by: Qu, Yuxiao, et al.
Published: (2026)
by: Qu, Yuxiao, et al.
Published: (2026)
Similar Items
-
Training a Generally Curious Agent
by: Tajwar, Fahim, et al.
Published: (2025) -
State Combinatorial Generalization In Decision Making With Conditional Diffusion Models
by: Duan, Xintong, et al.
Published: (2025) -
Blind Inverse Problem Solving Made Easy by Text-to-Image Latent Diffusion
by: Dontas, Michail, et al.
Published: (2024) -
Can Large Reasoning Models Self-Train?
by: Shafayat, Sheikh, et al.
Published: (2025) -
Retrospective In-Context Learning for Temporal Credit Assignment with Large Language Models
by: Chen, Wen-Tse, et al.
Published: (2026)