QPO: Query-dependent Prompt Optimization via Multi-Loop Offline Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Kong, Yilun, Mao, Hangyu, Zhao, Qi, Zhang, Bin, Ruan, Jingqing, Shen, Li, Chang, Yongzhe, Wang, Xueqian, Zhao, Rui, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
von: Kong, Yilun, et al.
Veröffentlicht: (2025)
von: Kong, Yilun, et al.
Veröffentlicht: (2025)
DEER: A Delay-Resilient Framework for Reinforcement Learning with Variable Delays
von: Xia, Bo, et al.
Veröffentlicht: (2024)
von: Xia, Bo, et al.
Veröffentlicht: (2024)
X-Light: Cross-City Traffic Signal Control Using Transformer on Transformer as Meta Multi-Agent Reinforcement Learner
von: Jiang, Haoyuan, et al.
Veröffentlicht: (2024)
von: Jiang, Haoyuan, et al.
Veröffentlicht: (2024)
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
von: Luo, Yifu, et al.
Veröffentlicht: (2025)
von: Luo, Yifu, et al.
Veröffentlicht: (2025)
Solving Continual Offline Reinforcement Learning with Decision Transformer
von: Huang, Kaixin, et al.
Veröffentlicht: (2024)
von: Huang, Kaixin, et al.
Veröffentlicht: (2024)
CoSLight: Co-optimizing Collaborator Selection and Decision-making to Enhance Traffic Signal Control
von: Ruan, Jingqing, et al.
Veröffentlicht: (2024)
von: Ruan, Jingqing, et al.
Veröffentlicht: (2024)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
von: Hu, Jifeng, et al.
Veröffentlicht: (2025)
von: Hu, Jifeng, et al.
Veröffentlicht: (2025)
UACER: An Uncertainty-Adaptive Critic Ensemble Framework for Robust Adversarial Reinforcement Learning
von: Wu, Jiaxi, et al.
Veröffentlicht: (2025)
von: Wu, Jiaxi, et al.
Veröffentlicht: (2025)
HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
von: Hu, Shengchao, et al.
Veröffentlicht: (2024)
von: Hu, Shengchao, et al.
Veröffentlicht: (2024)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
von: Fan, Ziqing, et al.
Veröffentlicht: (2024)
von: Fan, Ziqing, et al.
Veröffentlicht: (2024)
Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization
von: Sun, Haoyuan, et al.
Veröffentlicht: (2024)
von: Sun, Haoyuan, et al.
Veröffentlicht: (2024)
TPTU: Large Language Model-based AI Agents for Task Planning and Tool Usage
von: Ruan, Jingqing, et al.
Veröffentlicht: (2023)
von: Ruan, Jingqing, et al.
Veröffentlicht: (2023)
Explainable Reinforcement Learning via a Causal World Model
von: Yu, Zhongwei, et al.
Veröffentlicht: (2023)
von: Yu, Zhongwei, et al.
Veröffentlicht: (2023)
Q-value Regularized Transformer for Offline Reinforcement Learning
von: Hu, Shengchao, et al.
Veröffentlicht: (2024)
von: Hu, Shengchao, et al.
Veröffentlicht: (2024)
Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation
von: Wang, Haoyu, et al.
Veröffentlicht: (2024)
von: Wang, Haoyu, et al.
Veröffentlicht: (2024)
GuideLight: "Industrial Solution" Guidance for More Practical Traffic Signal Control Agents
von: Jiang, Haoyuan, et al.
Veröffentlicht: (2024)
von: Jiang, Haoyuan, et al.
Veröffentlicht: (2024)
Query-Dependent Prompt Evaluation and Optimization with Offline Inverse RL
von: Sun, Hao, et al.
Veröffentlicht: (2023)
von: Sun, Hao, et al.
Veröffentlicht: (2023)
Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal
von: Hu, Jifeng, et al.
Veröffentlicht: (2024)
von: Hu, Jifeng, et al.
Veröffentlicht: (2024)
Morphology and Behavior Co-Optimization of Modular Satellites for Attitude Control
von: Wang, Yuxing, et al.
Veröffentlicht: (2024)
von: Wang, Yuxing, et al.
Veröffentlicht: (2024)
Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach
von: Zhang, Bin, et al.
Veröffentlicht: (2023)
von: Zhang, Bin, et al.
Veröffentlicht: (2023)
PTDE: Personalized Training with Distilled Execution for Multi-Agent Reinforcement Learning
von: Chen, Yiqun, et al.
Veröffentlicht: (2022)
von: Chen, Yiqun, et al.
Veröffentlicht: (2022)
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
von: He, Longxiang, et al.
Veröffentlicht: (2023)
von: He, Longxiang, et al.
Veröffentlicht: (2023)
Offline Behavior Distillation
von: Lei, Shiye, et al.
Veröffentlicht: (2024)
von: Lei, Shiye, et al.
Veröffentlicht: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
Offline Behavioral Data Selection
von: Lei, Shiye, et al.
Veröffentlicht: (2025)
von: Lei, Shiye, et al.
Veröffentlicht: (2025)
A Comprehensive Survey of Data Augmentation in Visual Reinforcement Learning
von: Ma, Guozheng, et al.
Veröffentlicht: (2022)
von: Ma, Guozheng, et al.
Veröffentlicht: (2022)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
State Diversity Matters in Offline Behavior Distillation
von: Lei, Shiye, et al.
Veröffentlicht: (2025)
von: Lei, Shiye, et al.
Veröffentlicht: (2025)
Learned Offline Query Planning via Bayesian Optimization
von: Tao, Jeffrey, et al.
Veröffentlicht: (2025)
von: Tao, Jeffrey, et al.
Veröffentlicht: (2025)
Offline Guarded Safe Reinforcement Learning for Medical Treatment Optimization Strategies
von: Yan, Runze, et al.
Veröffentlicht: (2025)
von: Yan, Runze, et al.
Veröffentlicht: (2025)
Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization
von: Hu, Shengchao, et al.
Veröffentlicht: (2024)
von: Hu, Shengchao, et al.
Veröffentlicht: (2024)
AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models
von: Liu, Qi, et al.
Veröffentlicht: (2025)
von: Liu, Qi, et al.
Veröffentlicht: (2025)
Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy
von: Cao, Chenyang, et al.
Veröffentlicht: (2024)
von: Cao, Chenyang, et al.
Veröffentlicht: (2024)
PET-SQL: A Prompt-Enhanced Two-Round Refinement of Text-to-SQL with Cross-consistency
von: Li, Zhishuai, et al.
Veröffentlicht: (2024)
von: Li, Zhishuai, et al.
Veröffentlicht: (2024)
Safety Reasoning with Guidelines
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages
von: Ma, Guozheng, et al.
Veröffentlicht: (2023)
von: Ma, Guozheng, et al.
Veröffentlicht: (2023)
Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning
von: Bai, Chenjia, et al.
Veröffentlicht: (2024)
von: Bai, Chenjia, et al.
Veröffentlicht: (2024)
Doubly Mild Generalization for Offline Reinforcement Learning
von: Mao, Yixiu, et al.
Veröffentlicht: (2024)
von: Mao, Yixiu, et al.
Veröffentlicht: (2024)
Image Captions are Natural Prompts for Text-to-Image Models
von: Lei, Shiye, et al.
Veröffentlicht: (2023)
von: Lei, Shiye, et al.
Veröffentlicht: (2023)
Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
von: Luo, Yifu, et al.
Veröffentlicht: (2025)
von: Luo, Yifu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
von: Kong, Yilun, et al.
Veröffentlicht: (2025) -
DEER: A Delay-Resilient Framework for Reinforcement Learning with Variable Delays
von: Xia, Bo, et al.
Veröffentlicht: (2024) -
X-Light: Cross-City Traffic Signal Control Using Transformer on Transformer as Meta Multi-Agent Reinforcement Learner
von: Jiang, Haoyuan, et al.
Veröffentlicht: (2024) -
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
von: Luo, Yifu, et al.
Veröffentlicht: (2025) -
Solving Continual Offline Reinforcement Learning with Decision Transformer
von: Huang, Kaixin, et al.
Veröffentlicht: (2024)