Learning to Staff: Offline Reinforcement Learning and Fine-Tuned LLMs for Warehouse Staffing Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Kujanpää, Kalle, Zhu, Yuying, Klinkner, Kristina, Malmasi, Shervin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
von: Liu, Ning, et al.
Veröffentlicht: (2026)
von: Liu, Ning, et al.
Veröffentlicht: (2026)
iQRL -- Implicitly Quantized Representations for Sample-efficient Reinforcement Learning
von: Scannell, Aidan, et al.
Veröffentlicht: (2024)
von: Scannell, Aidan, et al.
Veröffentlicht: (2024)
Efficient Knowledge Injection in LLMs via Self-Distillation
von: Kujanpää, Kalle, et al.
Veröffentlicht: (2024)
von: Kujanpää, Kalle, et al.
Veröffentlicht: (2024)
Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data
von: Zhou, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Zhou, Zhiyuan, et al.
Veröffentlicht: (2024)
Enhancing Low-Resource LLMs Classification with PEFT and Synthetic Data
von: Patwa, Parth, et al.
Veröffentlicht: (2024)
von: Patwa, Parth, et al.
Veröffentlicht: (2024)
Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMs
von: Wang, Jingyao, et al.
Veröffentlicht: (2025)
von: Wang, Jingyao, et al.
Veröffentlicht: (2025)
Offline Trajectory Optimization for Offline Reinforcement Learning
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs
von: Zhang, Kairun, et al.
Veröffentlicht: (2025)
von: Zhang, Kairun, et al.
Veröffentlicht: (2025)
Offline Reinforcement Learning with Behavioral Supervisor Tuning
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2024)
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2024)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
von: Bozkurt, Alper Kamil, et al.
Veröffentlicht: (2026)
von: Bozkurt, Alper Kamil, et al.
Veröffentlicht: (2026)
CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
von: Huang, Dongchi, et al.
Veröffentlicht: (2025)
von: Huang, Dongchi, et al.
Veröffentlicht: (2025)
Is Mamba Compatible with Trajectory Optimization in Offline Reinforcement Learning?
von: Dai, Yang, et al.
Veröffentlicht: (2024)
von: Dai, Yang, et al.
Veröffentlicht: (2024)
Residuals-based Offline Reinforcement Learning
von: Zhu, Qing, et al.
Veröffentlicht: (2026)
von: Zhu, Qing, et al.
Veröffentlicht: (2026)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
von: Feng, Weitao, et al.
Veröffentlicht: (2025)
von: Feng, Weitao, et al.
Veröffentlicht: (2025)
Percentile Criterion Optimization in Offline Reinforcement Learning
von: Lobo, Elita A., et al.
Veröffentlicht: (2024)
von: Lobo, Elita A., et al.
Veröffentlicht: (2024)
Online Optimization for Offline Safe Reinforcement Learning
von: Chemingui, Yassine, et al.
Veröffentlicht: (2025)
von: Chemingui, Yassine, et al.
Veröffentlicht: (2025)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
von: Mukherjee, Subhojyoti, et al.
Veröffentlicht: (2025)
von: Mukherjee, Subhojyoti, et al.
Veröffentlicht: (2025)
Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs
von: Zhang, Honglin, et al.
Veröffentlicht: (2025)
von: Zhang, Honglin, et al.
Veröffentlicht: (2025)
Deep Reinforcement Learning for Dynamic Order Picking in Warehouse Operations
von: Mahmoudinazlou, Sasan, et al.
Veröffentlicht: (2024)
von: Mahmoudinazlou, Sasan, et al.
Veröffentlicht: (2024)
Stochastic Thermodynamics of Learning Parametric Probabilistic Models
von: Parsi, Shervin Sadat
Veröffentlicht: (2023)
von: Parsi, Shervin Sadat
Veröffentlicht: (2023)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
von: Zhan, Simon Sinong, et al.
Veröffentlicht: (2025)
von: Zhan, Simon Sinong, et al.
Veröffentlicht: (2025)
Offline Reinforcement Learning via Inverse Optimization
von: Dimanidis, Ioannis, et al.
Veröffentlicht: (2025)
von: Dimanidis, Ioannis, et al.
Veröffentlicht: (2025)
Offline Multitask Representation Learning for Reinforcement Learning
von: Ishfaq, Haque, et al.
Veröffentlicht: (2024)
von: Ishfaq, Haque, et al.
Veröffentlicht: (2024)
ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization
von: Chen, Yifei, et al.
Veröffentlicht: (2026)
von: Chen, Yifei, et al.
Veröffentlicht: (2026)
Equivariant Offline Reinforcement Learning
von: Tangri, Arsh, et al.
Veröffentlicht: (2024)
von: Tangri, Arsh, et al.
Veröffentlicht: (2024)
Federated Offline Reinforcement Learning
von: Zhou, Doudou, et al.
Veröffentlicht: (2022)
von: Zhou, Doudou, et al.
Veröffentlicht: (2022)
Constrained Policy Optimization with Explicit Behavior Density for Offline Reinforcement Learning
von: Zhang, Jing, et al.
Veröffentlicht: (2023)
von: Zhang, Jing, et al.
Veröffentlicht: (2023)
Epistemic Robust Offline Reinforcement Learning
von: Chenreddy, Abhilash Reddy, et al.
Veröffentlicht: (2026)
von: Chenreddy, Abhilash Reddy, et al.
Veröffentlicht: (2026)
Optimization Solution Functions as Deterministic Policies for Offline Reinforcement Learning
von: Khattar, Vanshaj, et al.
Veröffentlicht: (2024)
von: Khattar, Vanshaj, et al.
Veröffentlicht: (2024)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
von: Hu, Jifeng, et al.
Veröffentlicht: (2025)
von: Hu, Jifeng, et al.
Veröffentlicht: (2025)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner
von: Ma, Hao, et al.
Veröffentlicht: (2026)
von: Ma, Hao, et al.
Veröffentlicht: (2026)
Adaptive Coarse-to-Fine Subgoal Refinement for Long-Horizon Offline Goal-Conditioned Reinforcement Learning
von: Ke, Kaiqiang, et al.
Veröffentlicht: (2026)
von: Ke, Kaiqiang, et al.
Veröffentlicht: (2026)
Offline Hierarchical Reinforcement Learning via Inverse Optimization
von: Schmidt, Carolin, et al.
Veröffentlicht: (2024)
von: Schmidt, Carolin, et al.
Veröffentlicht: (2024)
Supervised Fine-Tuning as Inverse Reinforcement Learning
von: Sun, Hao
Veröffentlicht: (2024)
von: Sun, Hao
Veröffentlicht: (2024)
Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning
von: Mu, Yongyu, et al.
Veröffentlicht: (2026)
von: Mu, Yongyu, et al.
Veröffentlicht: (2026)
Your Offline Policy is Not Trustworthy: Bilevel Reinforcement Learning for Sequential Portfolio Optimization
von: Yuan, Haochen, et al.
Veröffentlicht: (2025)
von: Yuan, Haochen, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
von: Liu, Ning, et al.
Veröffentlicht: (2026) -
iQRL -- Implicitly Quantized Representations for Sample-efficient Reinforcement Learning
von: Scannell, Aidan, et al.
Veröffentlicht: (2024) -
Efficient Knowledge Injection in LLMs via Self-Distillation
von: Kujanpää, Kalle, et al.
Veröffentlicht: (2024) -
Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data
von: Zhou, Zhiyuan, et al.
Veröffentlicht: (2024) -
Enhancing Low-Resource LLMs Classification with PEFT and Synthetic Data
von: Patwa, Parth, et al.
Veröffentlicht: (2024)