QPO: Query-dependent Prompt Optimization via Multi-Loop Offline Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kong, Yilun, Mao, Hangyu, Zhao, Qi, Zhang, Bin, Ruan, Jingqing, Shen, Li, Chang, Yongzhe, Wang, Xueqian, Zhao, Rui, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
par: Kong, Yilun, et autres
Publié: (2025)
par: Kong, Yilun, et autres
Publié: (2025)
DEER: A Delay-Resilient Framework for Reinforcement Learning with Variable Delays
par: Xia, Bo, et autres
Publié: (2024)
par: Xia, Bo, et autres
Publié: (2024)
X-Light: Cross-City Traffic Signal Control Using Transformer on Transformer as Meta Multi-Agent Reinforcement Learner
par: Jiang, Haoyuan, et autres
Publié: (2024)
par: Jiang, Haoyuan, et autres
Publié: (2024)
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
par: Luo, Yifu, et autres
Publié: (2025)
par: Luo, Yifu, et autres
Publié: (2025)
Solving Continual Offline Reinforcement Learning with Decision Transformer
par: Huang, Kaixin, et autres
Publié: (2024)
par: Huang, Kaixin, et autres
Publié: (2024)
CoSLight: Co-optimizing Collaborator Selection and Decision-making to Enhance Traffic Signal Control
par: Ruan, Jingqing, et autres
Publié: (2024)
par: Ruan, Jingqing, et autres
Publié: (2024)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
par: Hu, Jifeng, et autres
Publié: (2025)
par: Hu, Jifeng, et autres
Publié: (2025)
UACER: An Uncertainty-Adaptive Critic Ensemble Framework for Robust Adversarial Reinforcement Learning
par: Wu, Jiaxi, et autres
Publié: (2025)
par: Wu, Jiaxi, et autres
Publié: (2025)
HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
par: Hu, Shengchao, et autres
Publié: (2024)
par: Hu, Shengchao, et autres
Publié: (2024)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
par: Fan, Ziqing, et autres
Publié: (2024)
par: Fan, Ziqing, et autres
Publié: (2024)
Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization
par: Sun, Haoyuan, et autres
Publié: (2024)
par: Sun, Haoyuan, et autres
Publié: (2024)
TPTU: Large Language Model-based AI Agents for Task Planning and Tool Usage
par: Ruan, Jingqing, et autres
Publié: (2023)
par: Ruan, Jingqing, et autres
Publié: (2023)
Explainable Reinforcement Learning via a Causal World Model
par: Yu, Zhongwei, et autres
Publié: (2023)
par: Yu, Zhongwei, et autres
Publié: (2023)
Q-value Regularized Transformer for Offline Reinforcement Learning
par: Hu, Shengchao, et autres
Publié: (2024)
par: Hu, Shengchao, et autres
Publié: (2024)
Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation
par: Wang, Haoyu, et autres
Publié: (2024)
par: Wang, Haoyu, et autres
Publié: (2024)
GuideLight: "Industrial Solution" Guidance for More Practical Traffic Signal Control Agents
par: Jiang, Haoyuan, et autres
Publié: (2024)
par: Jiang, Haoyuan, et autres
Publié: (2024)
Query-Dependent Prompt Evaluation and Optimization with Offline Inverse RL
par: Sun, Hao, et autres
Publié: (2023)
par: Sun, Hao, et autres
Publié: (2023)
Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal
par: Hu, Jifeng, et autres
Publié: (2024)
par: Hu, Jifeng, et autres
Publié: (2024)
Morphology and Behavior Co-Optimization of Modular Satellites for Attitude Control
par: Wang, Yuxing, et autres
Publié: (2024)
par: Wang, Yuxing, et autres
Publié: (2024)
Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach
par: Zhang, Bin, et autres
Publié: (2023)
par: Zhang, Bin, et autres
Publié: (2023)
PTDE: Personalized Training with Distilled Execution for Multi-Agent Reinforcement Learning
par: Chen, Yiqun, et autres
Publié: (2022)
par: Chen, Yiqun, et autres
Publié: (2022)
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
par: He, Longxiang, et autres
Publié: (2023)
par: He, Longxiang, et autres
Publié: (2023)
Offline Behavior Distillation
par: Lei, Shiye, et autres
Publié: (2024)
par: Lei, Shiye, et autres
Publié: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
par: Zhao, Ziqi, et autres
Publié: (2024)
par: Zhao, Ziqi, et autres
Publié: (2024)
Offline Behavioral Data Selection
par: Lei, Shiye, et autres
Publié: (2025)
par: Lei, Shiye, et autres
Publié: (2025)
A Comprehensive Survey of Data Augmentation in Visual Reinforcement Learning
par: Ma, Guozheng, et autres
Publié: (2022)
par: Ma, Guozheng, et autres
Publié: (2022)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
par: Sun, Haoyuan, et autres
Publié: (2025)
par: Sun, Haoyuan, et autres
Publié: (2025)
State Diversity Matters in Offline Behavior Distillation
par: Lei, Shiye, et autres
Publié: (2025)
par: Lei, Shiye, et autres
Publié: (2025)
Learned Offline Query Planning via Bayesian Optimization
par: Tao, Jeffrey, et autres
Publié: (2025)
par: Tao, Jeffrey, et autres
Publié: (2025)
Offline Guarded Safe Reinforcement Learning for Medical Treatment Optimization Strategies
par: Yan, Runze, et autres
Publié: (2025)
par: Yan, Runze, et autres
Publié: (2025)
Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization
par: Hu, Shengchao, et autres
Publié: (2024)
par: Hu, Shengchao, et autres
Publié: (2024)
AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models
par: Liu, Qi, et autres
Publié: (2025)
par: Liu, Qi, et autres
Publié: (2025)
Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy
par: Cao, Chenyang, et autres
Publié: (2024)
par: Cao, Chenyang, et autres
Publié: (2024)
PET-SQL: A Prompt-Enhanced Two-Round Refinement of Text-to-SQL with Cross-consistency
par: Li, Zhishuai, et autres
Publié: (2024)
par: Li, Zhishuai, et autres
Publié: (2024)
Safety Reasoning with Guidelines
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages
par: Ma, Guozheng, et autres
Publié: (2023)
par: Ma, Guozheng, et autres
Publié: (2023)
Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning
par: Bai, Chenjia, et autres
Publié: (2024)
par: Bai, Chenjia, et autres
Publié: (2024)
Doubly Mild Generalization for Offline Reinforcement Learning
par: Mao, Yixiu, et autres
Publié: (2024)
par: Mao, Yixiu, et autres
Publié: (2024)
Image Captions are Natural Prompts for Text-to-Image Models
par: Lei, Shiye, et autres
Publié: (2023)
par: Lei, Shiye, et autres
Publié: (2023)
Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
par: Luo, Yifu, et autres
Publié: (2025)
par: Luo, Yifu, et autres
Publié: (2025)
Documents similaires
-
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
par: Kong, Yilun, et autres
Publié: (2025) -
DEER: A Delay-Resilient Framework for Reinforcement Learning with Variable Delays
par: Xia, Bo, et autres
Publié: (2024) -
X-Light: Cross-City Traffic Signal Control Using Transformer on Transformer as Meta Multi-Agent Reinforcement Learner
par: Jiang, Haoyuan, et autres
Publié: (2024) -
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
par: Luo, Yifu, et autres
Publié: (2025) -
Solving Continual Offline Reinforcement Learning with Decision Transformer
par: Huang, Kaixin, et autres
Publié: (2024)