Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Guangyu, Lian, Kewei, Ru, Haoxuan, Zhang, Borong, Lin, Haowei, Mu, Zhancun, Fu, Haobo, Fu, Qiang, Cai, Shaofei, Wang, Zihao, Liang, Yitao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment
di: Cai, Shaofei, et al.
Pubblicazione: (2025)
di: Cai, Shaofei, et al.
Pubblicazione: (2025)
ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context Prompting
di: Cai, Shaofei, et al.
Pubblicazione: (2024)
di: Cai, Shaofei, et al.
Pubblicazione: (2024)
LoopNav: Benchmarking Spatial Consistency in World Models
di: Lian, Kewei, et al.
Pubblicazione: (2025)
di: Lian, Kewei, et al.
Pubblicazione: (2025)
Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents
di: Cai, Shaofei, et al.
Pubblicazione: (2025)
di: Cai, Shaofei, et al.
Pubblicazione: (2025)
OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents
di: Wang, Zihao, et al.
Pubblicazione: (2024)
di: Wang, Zihao, et al.
Pubblicazione: (2024)
DeFlow: Decoupling Manifold Modeling and Value Maximization for Offline Policy Extraction
di: Mu, Zhancun
Pubblicazione: (2026)
di: Mu, Zhancun
Pubblicazione: (2026)
MineStudio: A Streamlined Package for Minecraft AI Agent Development
di: Cai, Shaofei, et al.
Pubblicazione: (2024)
di: Cai, Shaofei, et al.
Pubblicazione: (2024)
GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents
di: Cai, Shaofei, et al.
Pubblicazione: (2024)
di: Cai, Shaofei, et al.
Pubblicazione: (2024)
OpenHA: A Series of Open-Source Hierarchical Agentic Models in Minecraft
di: Wang, Zihao, et al.
Pubblicazione: (2025)
di: Wang, Zihao, et al.
Pubblicazione: (2025)
Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning
di: Mu, Zhancun, et al.
Pubblicazione: (2026)
di: Mu, Zhancun, et al.
Pubblicazione: (2026)
Open-World Skill Discovery from Unsegmented Demonstrations
di: Deng, Jingwen, et al.
Pubblicazione: (2025)
di: Deng, Jingwen, et al.
Pubblicazione: (2025)
UniCode: Augmenting Evaluation for Code Reasoning
di: Zheng, Xinyue, et al.
Pubblicazione: (2025)
di: Zheng, Xinyue, et al.
Pubblicazione: (2025)
Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents
di: Wang, Zihao, et al.
Pubblicazione: (2023)
di: Wang, Zihao, et al.
Pubblicazione: (2023)
Goal-Oriented Skill Abstraction for Offline Multi-Task Reinforcement Learning
di: He, Jinmin, et al.
Pubblicazione: (2025)
di: He, Jinmin, et al.
Pubblicazione: (2025)
Preference-Based Planning in Stochastic Environments: From Partially-Ordered Temporal Goals to Most Preferred Policies
di: Rahmani, Hazhar, et al.
Pubblicazione: (2024)
di: Rahmani, Hazhar, et al.
Pubblicazione: (2024)
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
di: Li, Muyao, et al.
Pubblicazione: (2025)
di: Li, Muyao, et al.
Pubblicazione: (2025)
A Contextual Combinatorial Bandit Approach to Negotiation
di: Li, Yexin, et al.
Pubblicazione: (2024)
di: Li, Yexin, et al.
Pubblicazione: (2024)
Reaching Consensus in Cooperative Multi-Agent Reinforcement Learning with Goal Imagination
di: Wang, Liangzhou, et al.
Pubblicazione: (2024)
di: Wang, Liangzhou, et al.
Pubblicazione: (2024)
Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance
di: He, Jinmin, et al.
Pubblicazione: (2025)
di: He, Jinmin, et al.
Pubblicazione: (2025)
MCU: An Evaluation Framework for Open-Ended Game Agents
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in Long-Horizon Generation
di: Wang, Zihao, et al.
Pubblicazione: (2024)
di: Wang, Zihao, et al.
Pubblicazione: (2024)
Synaspot: A Lightweight, Streaming Multi-modal Framework for Keyword Spotting with Audio-Text Synergy
di: Li, Kewei, et al.
Pubblicazione: (2025)
di: Li, Kewei, et al.
Pubblicazione: (2025)
Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning
di: He, Kaichen, et al.
Pubblicazione: (2025)
di: He, Kaichen, et al.
Pubblicazione: (2025)
TFG-Flow: Training-free Guidance in Multimodal Generative Flow
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
Efficient Post-Training Refinement of Latent Reasoning in Large Language Models
di: Wang, Xinyuan, et al.
Pubblicazione: (2025)
di: Wang, Xinyuan, et al.
Pubblicazione: (2025)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
di: Deng, Jingcheng, et al.
Pubblicazione: (2026)
di: Deng, Jingcheng, et al.
Pubblicazione: (2026)
PEO: Improving Bi-Factorial Preference Alignment with Post-Training Policy Extrapolation
di: Liu, Yuxuan
Pubblicazione: (2025)
di: Liu, Yuxuan
Pubblicazione: (2025)
Latent Policy Steering through One-Step Flow Policies
di: Im, Hokyun, et al.
Pubblicazione: (2026)
di: Im, Hokyun, et al.
Pubblicazione: (2026)
Deep (Predictive) Discounted Counterfactual Regret Minimization
di: Xu, Hang, et al.
Pubblicazione: (2025)
di: Xu, Hang, et al.
Pubblicazione: (2025)
Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization
di: Liang, Zhanhao, et al.
Pubblicazione: (2024)
di: Liang, Zhanhao, et al.
Pubblicazione: (2024)
MergeIT: From Selection to Merging for Efficient Instruction Tuning
di: Cai, Hongyi, et al.
Pubblicazione: (2025)
di: Cai, Hongyi, et al.
Pubblicazione: (2025)
Frozen-DETR: Enhancing DETR with Image Understanding from Frozen Foundation Models
di: Fu, Shenghao, et al.
Pubblicazione: (2024)
di: Fu, Shenghao, et al.
Pubblicazione: (2024)
The Limits of Preference Data for Post-Training
di: Zhao, Eric, et al.
Pubblicazione: (2025)
di: Zhao, Eric, et al.
Pubblicazione: (2025)
Frozen Neutron Stars
di: Tan, Chen, et al.
Pubblicazione: (2025)
di: Tan, Chen, et al.
Pubblicazione: (2025)
TFG: Unified Training-Free Guidance for Diffusion Models
di: Ye, Haotian, et al.
Pubblicazione: (2024)
di: Ye, Haotian, et al.
Pubblicazione: (2024)
SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization
di: Wang, Zhengcheng, et al.
Pubblicazione: (2025)
di: Wang, Zhengcheng, et al.
Pubblicazione: (2025)
Not All Tasks Are Equally Difficult: Multi-Task Deep Reinforcement Learning with Dynamic Depth Routing
di: He, Jinmin, et al.
Pubblicazione: (2023)
di: He, Jinmin, et al.
Pubblicazione: (2023)
Enhance Reasoning for Large Language Models in the Game Werewolf
di: Wu, Shuang, et al.
Pubblicazione: (2024)
di: Wu, Shuang, et al.
Pubblicazione: (2024)
Minimizing Weighted Counterfactual Regret with Optimistic Online Mirror Descent
di: Xu, Hang, et al.
Pubblicazione: (2024)
di: Xu, Hang, et al.
Pubblicazione: (2024)
Maximum Entropy Heterogeneous-Agent Reinforcement Learning
di: Liu, Jiarong, et al.
Pubblicazione: (2023)
di: Liu, Jiarong, et al.
Pubblicazione: (2023)
Documenti analoghi
-
ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment
di: Cai, Shaofei, et al.
Pubblicazione: (2025) -
ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context Prompting
di: Cai, Shaofei, et al.
Pubblicazione: (2024) -
LoopNav: Benchmarking Spatial Consistency in World Models
di: Lian, Kewei, et al.
Pubblicazione: (2025) -
Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents
di: Cai, Shaofei, et al.
Pubblicazione: (2025) -
OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents
di: Wang, Zihao, et al.
Pubblicazione: (2024)