QPO: Query-dependent Prompt Optimization via Multi-Loop Offline Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Kong, Yilun, Mao, Hangyu, Zhao, Qi, Zhang, Bin, Ruan, Jingqing, Shen, Li, Chang, Yongzhe, Wang, Xueqian, Zhao, Rui, Tao, Dacheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
di: Kong, Yilun, et al.
Pubblicazione: (2025)
di: Kong, Yilun, et al.
Pubblicazione: (2025)
DEER: A Delay-Resilient Framework for Reinforcement Learning with Variable Delays
di: Xia, Bo, et al.
Pubblicazione: (2024)
di: Xia, Bo, et al.
Pubblicazione: (2024)
X-Light: Cross-City Traffic Signal Control Using Transformer on Transformer as Meta Multi-Agent Reinforcement Learner
di: Jiang, Haoyuan, et al.
Pubblicazione: (2024)
di: Jiang, Haoyuan, et al.
Pubblicazione: (2024)
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
di: Luo, Yifu, et al.
Pubblicazione: (2025)
di: Luo, Yifu, et al.
Pubblicazione: (2025)
Solving Continual Offline Reinforcement Learning with Decision Transformer
di: Huang, Kaixin, et al.
Pubblicazione: (2024)
di: Huang, Kaixin, et al.
Pubblicazione: (2024)
CoSLight: Co-optimizing Collaborator Selection and Decision-making to Enhance Traffic Signal Control
di: Ruan, Jingqing, et al.
Pubblicazione: (2024)
di: Ruan, Jingqing, et al.
Pubblicazione: (2024)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
UACER: An Uncertainty-Adaptive Critic Ensemble Framework for Robust Adversarial Reinforcement Learning
di: Wu, Jiaxi, et al.
Pubblicazione: (2025)
di: Wu, Jiaxi, et al.
Pubblicazione: (2025)
HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
di: Fan, Ziqing, et al.
Pubblicazione: (2024)
di: Fan, Ziqing, et al.
Pubblicazione: (2024)
Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization
di: Sun, Haoyuan, et al.
Pubblicazione: (2024)
di: Sun, Haoyuan, et al.
Pubblicazione: (2024)
TPTU: Large Language Model-based AI Agents for Task Planning and Tool Usage
di: Ruan, Jingqing, et al.
Pubblicazione: (2023)
di: Ruan, Jingqing, et al.
Pubblicazione: (2023)
Explainable Reinforcement Learning via a Causal World Model
di: Yu, Zhongwei, et al.
Pubblicazione: (2023)
di: Yu, Zhongwei, et al.
Pubblicazione: (2023)
Q-value Regularized Transformer for Offline Reinforcement Learning
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
GuideLight: "Industrial Solution" Guidance for More Practical Traffic Signal Control Agents
di: Jiang, Haoyuan, et al.
Pubblicazione: (2024)
di: Jiang, Haoyuan, et al.
Pubblicazione: (2024)
Query-Dependent Prompt Evaluation and Optimization with Offline Inverse RL
di: Sun, Hao, et al.
Pubblicazione: (2023)
di: Sun, Hao, et al.
Pubblicazione: (2023)
Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal
di: Hu, Jifeng, et al.
Pubblicazione: (2024)
di: Hu, Jifeng, et al.
Pubblicazione: (2024)
Morphology and Behavior Co-Optimization of Modular Satellites for Attitude Control
di: Wang, Yuxing, et al.
Pubblicazione: (2024)
di: Wang, Yuxing, et al.
Pubblicazione: (2024)
Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach
di: Zhang, Bin, et al.
Pubblicazione: (2023)
di: Zhang, Bin, et al.
Pubblicazione: (2023)
PTDE: Personalized Training with Distilled Execution for Multi-Agent Reinforcement Learning
di: Chen, Yiqun, et al.
Pubblicazione: (2022)
di: Chen, Yiqun, et al.
Pubblicazione: (2022)
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
di: He, Longxiang, et al.
Pubblicazione: (2023)
di: He, Longxiang, et al.
Pubblicazione: (2023)
Offline Behavior Distillation
di: Lei, Shiye, et al.
Pubblicazione: (2024)
di: Lei, Shiye, et al.
Pubblicazione: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
Offline Behavioral Data Selection
di: Lei, Shiye, et al.
Pubblicazione: (2025)
di: Lei, Shiye, et al.
Pubblicazione: (2025)
A Comprehensive Survey of Data Augmentation in Visual Reinforcement Learning
di: Ma, Guozheng, et al.
Pubblicazione: (2022)
di: Ma, Guozheng, et al.
Pubblicazione: (2022)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
State Diversity Matters in Offline Behavior Distillation
di: Lei, Shiye, et al.
Pubblicazione: (2025)
di: Lei, Shiye, et al.
Pubblicazione: (2025)
Learned Offline Query Planning via Bayesian Optimization
di: Tao, Jeffrey, et al.
Pubblicazione: (2025)
di: Tao, Jeffrey, et al.
Pubblicazione: (2025)
Offline Guarded Safe Reinforcement Learning for Medical Treatment Optimization Strategies
di: Yan, Runze, et al.
Pubblicazione: (2025)
di: Yan, Runze, et al.
Pubblicazione: (2025)
Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models
di: Liu, Qi, et al.
Pubblicazione: (2025)
di: Liu, Qi, et al.
Pubblicazione: (2025)
Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy
di: Cao, Chenyang, et al.
Pubblicazione: (2024)
di: Cao, Chenyang, et al.
Pubblicazione: (2024)
PET-SQL: A Prompt-Enhanced Two-Round Refinement of Text-to-SQL with Cross-consistency
di: Li, Zhishuai, et al.
Pubblicazione: (2024)
di: Li, Zhishuai, et al.
Pubblicazione: (2024)
Safety Reasoning with Guidelines
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages
di: Ma, Guozheng, et al.
Pubblicazione: (2023)
di: Ma, Guozheng, et al.
Pubblicazione: (2023)
Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning
di: Bai, Chenjia, et al.
Pubblicazione: (2024)
di: Bai, Chenjia, et al.
Pubblicazione: (2024)
Doubly Mild Generalization for Offline Reinforcement Learning
di: Mao, Yixiu, et al.
Pubblicazione: (2024)
di: Mao, Yixiu, et al.
Pubblicazione: (2024)
Image Captions are Natural Prompts for Text-to-Image Models
di: Lei, Shiye, et al.
Pubblicazione: (2023)
di: Lei, Shiye, et al.
Pubblicazione: (2023)
Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
di: Luo, Yifu, et al.
Pubblicazione: (2025)
di: Luo, Yifu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
di: Kong, Yilun, et al.
Pubblicazione: (2025) -
DEER: A Delay-Resilient Framework for Reinforcement Learning with Variable Delays
di: Xia, Bo, et al.
Pubblicazione: (2024) -
X-Light: Cross-City Traffic Signal Control Using Transformer on Transformer as Meta Multi-Agent Reinforcement Learner
di: Jiang, Haoyuan, et al.
Pubblicazione: (2024) -
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
di: Luo, Yifu, et al.
Pubblicazione: (2025) -
Solving Continual Offline Reinforcement Learning with Decision Transformer
di: Huang, Kaixin, et al.
Pubblicazione: (2024)