Prompt Tuning Decision Transformers with Structured and Scalable Bandits
Fuente:
arXiv
Guardado en:
| Autores principales: | Rietz, Finn, Smirnov, Oleg, Karimi, Sara, Cao, Lele |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL
por: Rietz, Finn, et al.
Publicado: (2025)
por: Rietz, Finn, et al.
Publicado: (2025)
Are We Really Measuring Progress? Transferring Insights from Evaluating Recommender Systems to Temporal Link Prediction
por: Cornell, Filip, et al.
Publicado: (2025)
por: Cornell, Filip, et al.
Publicado: (2025)
On the Power of Heuristics in Temporal Graphs
por: Cornell, Filip, et al.
Publicado: (2025)
por: Cornell, Filip, et al.
Publicado: (2025)
Pool Me Wisely: On the Effect of Pooling in Transformer-Based Models
por: Ennadir, Sofiane, et al.
Publicado: (2025)
por: Ennadir, Sofiane, et al.
Publicado: (2025)
Towards Unified Approaches in Self-Supervised Event Stream Modeling: Progress and Prospects
por: Zólyomi, Levente, et al.
Publicado: (2025)
por: Zólyomi, Levente, et al.
Publicado: (2025)
Be Wary of Your Time Series Preprocessing
por: Ennadir, Sofiane, et al.
Publicado: (2026)
por: Ennadir, Sofiane, et al.
Publicado: (2026)
Enhancing Graph Classification Robustness with Singular Pooling
por: Ennadir, Sofiane, et al.
Publicado: (2025)
por: Ennadir, Sofiane, et al.
Publicado: (2025)
Towards Interpretable Reinforcement Learning with Constrained Normalizing Flow Policies
por: Rietz, Finn, et al.
Publicado: (2024)
por: Rietz, Finn, et al.
Publicado: (2024)
APC-RL: Exceeding Data-Driven Behavior Priors with Adaptive Policy Composition
por: Rietz, Finn, et al.
Publicado: (2026)
por: Rietz, Finn, et al.
Publicado: (2026)
Behavior Structformer: Learning Players Representations with Structured Tokenization
por: Smirnov, Oleg, et al.
Publicado: (2024)
por: Smirnov, Oleg, et al.
Publicado: (2024)
Pretraining Decision Transformers with Reward Prediction for In-Context Multi-task Structured Bandit Learning
por: Mukherjee, Subhojyoti, et al.
Publicado: (2024)
por: Mukherjee, Subhojyoti, et al.
Publicado: (2024)
tensorflow-riemopt: A Library for Optimization on Riemannian Manifolds
por: Smirnov, Oleg
Publicado: (2021)
por: Smirnov, Oleg
Publicado: (2021)
Understanding Players as if They Are Talking to the Game in a Customized Language: A Pilot Study
por: Wang, Tianze, et al.
Publicado: (2024)
por: Wang, Tianze, et al.
Publicado: (2024)
Memory Limitations of Prompt Tuning in Transformers
por: Meyer, Maxime, et al.
Publicado: (2025)
por: Meyer, Maxime, et al.
Publicado: (2025)
Sample-based Dynamic Hierarchical Transformer with Layer and Head Flexibility via Contextual Bandit
por: Meng, Fanfei, et al.
Publicado: (2023)
por: Meng, Fanfei, et al.
Publicado: (2023)
Prompt Optimization with Logged Bandit Data
por: Kiyohara, Haruka, et al.
Publicado: (2025)
por: Kiyohara, Haruka, et al.
Publicado: (2025)
Todyformer: Towards Holistic Dynamic Graph Transformers with Structure-Aware Tokenization
por: Biparva, Mahdi, et al.
Publicado: (2024)
por: Biparva, Mahdi, et al.
Publicado: (2024)
In-Context Curiosity: Distilling Exploration for Decision-Pretrained Transformers on Bandit Tasks
por: Yang, Huitao, et al.
Publicado: (2025)
por: Yang, Huitao, et al.
Publicado: (2025)
HR-Bandit: Human-AI Collaborated Linear Recourse Bandit
por: Cao, Junyu, et al.
Publicado: (2024)
por: Cao, Junyu, et al.
Publicado: (2024)
Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction
por: Smirnov, Alexander
Publicado: (2026)
por: Smirnov, Alexander
Publicado: (2026)
Differentially Private Subspace Fine-Tuning for Large Language Models
por: Zheng, Lele, et al.
Publicado: (2026)
por: Zheng, Lele, et al.
Publicado: (2026)
Frequency Matters: When Time Series Foundation Models Fail Under Spectral Shift
por: Wang, Tianze, et al.
Publicado: (2025)
por: Wang, Tianze, et al.
Publicado: (2025)
On Transportability for Structural Causal Bandits
por: Park, Min Woo, et al.
Publicado: (2025)
por: Park, Min Woo, et al.
Publicado: (2025)
Prompt Estimation from Prototypes for Federated Prompt Tuning of Vision Transformers
por: Yashwanth, M, et al.
Publicado: (2025)
por: Yashwanth, M, et al.
Publicado: (2025)
PSP: Pre-Training and Structure Prompt Tuning for Graph Neural Networks
por: Ge, Qingqing, et al.
Publicado: (2023)
por: Ge, Qingqing, et al.
Publicado: (2023)
Learning Markov Decision Processes under Fully Bandit Feedback
por: Zhuo, Zhengjia, et al.
Publicado: (2026)
por: Zhuo, Zhengjia, et al.
Publicado: (2026)
Multi-Armed Bandits-Based Optimization of Decision Trees
por: Shanto, Hasibul Karim, et al.
Publicado: (2025)
por: Shanto, Hasibul Karim, et al.
Publicado: (2025)
ADAPT to Robustify Prompt Tuning Vision Transformers
por: Eskandar, Masih, et al.
Publicado: (2024)
por: Eskandar, Masih, et al.
Publicado: (2024)
Hierarchical Prompt Decision Transformer: Improving Few-Shot Policy Generalization with Global and Adaptive Guidance
por: Wang, Zhe, et al.
Publicado: (2024)
por: Wang, Zhe, et al.
Publicado: (2024)
Scalable and Interpretable Contextual Bandits: A Literature Review and Retail Offer Prototype
por: Tankovic, Nikola, et al.
Publicado: (2025)
por: Tankovic, Nikola, et al.
Publicado: (2025)
Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies
por: Li, Kevin, et al.
Publicado: (2025)
por: Li, Kevin, et al.
Publicado: (2025)
Stochastic Low-rank Tensor Bandits for Multi-dimensional Online Decision Making
por: Zhou, Jie, et al.
Publicado: (2020)
por: Zhou, Jie, et al.
Publicado: (2020)
Bandit and Delayed Feedback in Online Structured Prediction
por: Shibukawa, Yuki, et al.
Publicado: (2025)
por: Shibukawa, Yuki, et al.
Publicado: (2025)
Fundamental Limits of Prompt Tuning Transformers: Universality, Capacity and Efficiency
por: Hu, Jerry Yao-Chieh, et al.
Publicado: (2024)
por: Hu, Jerry Yao-Chieh, et al.
Publicado: (2024)
Buzz, Choose, Forget: A Meta-Bandit Framework for Bee-Like Decision Making
por: Claeys, Emmanuelle, et al.
Publicado: (2025)
por: Claeys, Emmanuelle, et al.
Publicado: (2025)
Corruption-Robust Algorithms with Uncertainty Weighting for Nonlinear Contextual Bandits and Markov Decision Processes
por: Ye, Chenlu, et al.
Publicado: (2022)
por: Ye, Chenlu, et al.
Publicado: (2022)
Cost-Efficient Online Decision Making: A Combinatorial Multi-Armed Bandit Approach
por: Rahbar, Arman, et al.
Publicado: (2023)
por: Rahbar, Arman, et al.
Publicado: (2023)
S$^2$Transformer: Scalable Structured Transformers for Global Station Weather Forecasting
por: Chen, Hongyi, et al.
Publicado: (2025)
por: Chen, Hongyi, et al.
Publicado: (2025)
Tilt Matching for Scalable Sampling and Fine-Tuning
por: Potaptchik, Peter, et al.
Publicado: (2025)
por: Potaptchik, Peter, et al.
Publicado: (2025)
Budget-Constrained Causal Bandits: Bridging Uplift Modeling and Sequential Decision-Making
por: Pillai, Abhirami
Publicado: (2026)
por: Pillai, Abhirami
Publicado: (2026)
Ejemplares similares
-
Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL
por: Rietz, Finn, et al.
Publicado: (2025) -
Are We Really Measuring Progress? Transferring Insights from Evaluating Recommender Systems to Temporal Link Prediction
por: Cornell, Filip, et al.
Publicado: (2025) -
On the Power of Heuristics in Temporal Graphs
por: Cornell, Filip, et al.
Publicado: (2025) -
Pool Me Wisely: On the Effect of Pooling in Transformer-Based Models
por: Ennadir, Sofiane, et al.
Publicado: (2025) -
Towards Unified Approaches in Self-Supervised Event Stream Modeling: Progress and Prospects
por: Zólyomi, Levente, et al.
Publicado: (2025)