LACONIC: Length-Aware Constrained Reinforcement Learning for LLM
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Chang, Zhao, Yiran, Liu, Lawrence, Ye, Yaoqi, Szepesvári, Csaba, Yang, Lin F. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Confident Natural Policy Gradient for Local Planning in $q_π$-realizable Constrained MDPs
di: Tian, Tian, et al.
Pubblicazione: (2024)
di: Tian, Tian, et al.
Pubblicazione: (2024)
Rectifying Regression in Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
Learning to Reason Efficiently with Discounted Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
Sharper Guarantees for Misspecified Kernelized Bandit Optimization
di: Maran, Davide, et al.
Pubblicazione: (2026)
di: Maran, Davide, et al.
Pubblicazione: (2026)
Trajectory Data Suffices for Statistically Efficient Learning in Offline RL with Linear $q^π$-Realizability and Concentrability
di: Tkachuk, Volodymyr, et al.
Pubblicazione: (2024)
di: Tkachuk, Volodymyr, et al.
Pubblicazione: (2024)
Exploration via linearly perturbed loss minimisation
di: Janz, David, et al.
Pubblicazione: (2023)
di: Janz, David, et al.
Pubblicazione: (2023)
Sharp analysis of linear ensemble sampling
di: Akhavan, Arya, et al.
Pubblicazione: (2026)
di: Akhavan, Arya, et al.
Pubblicazione: (2026)
Learning What to Recommend: Minimax Optimal Simple Regret in Logistic Bandits
di: Liu, Shuai, et al.
Pubblicazione: (2026)
di: Liu, Shuai, et al.
Pubblicazione: (2026)
Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence
di: György, András, et al.
Pubblicazione: (2025)
di: György, András, et al.
Pubblicazione: (2025)
Balancing optimism and pessimism in offline-to-online learning
di: Sentenac, Flore, et al.
Pubblicazione: (2025)
di: Sentenac, Flore, et al.
Pubblicazione: (2025)
Ensemble sampling for linear bandits: small ensembles suffice
di: Janz, David, et al.
Pubblicazione: (2023)
di: Janz, David, et al.
Pubblicazione: (2023)
To Believe or Not to Believe Your LLM
di: Yadkori, Yasin Abbasi, et al.
Pubblicazione: (2024)
di: Yadkori, Yasin Abbasi, et al.
Pubblicazione: (2024)
Switching the Loss Reduces the Cost in Batch (Offline) Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2024)
di: Ayoub, Alex, et al.
Pubblicazione: (2024)
Almost Free: Self-concordance in Natural Exponential Families and an Application to Bandits
di: Liu, Shuai, et al.
Pubblicazione: (2024)
di: Liu, Shuai, et al.
Pubblicazione: (2024)
Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs
di: Zhong, Han, et al.
Pubblicazione: (2021)
di: Zhong, Han, et al.
Pubblicazione: (2021)
Confidence Aware Inverse Constrained Reinforcement Learning
di: Subramanian, Sriram Ganapathi, et al.
Pubblicazione: (2024)
di: Subramanian, Sriram Ganapathi, et al.
Pubblicazione: (2024)
Eluder dimension: localise it!
di: Bakhtiari, Alireza, et al.
Pubblicazione: (2026)
di: Bakhtiari, Alireza, et al.
Pubblicazione: (2026)
Rethinking the Foundations for Continual Reinforcement Learning
di: Elelimy, Esraa, et al.
Pubblicazione: (2025)
di: Elelimy, Esraa, et al.
Pubblicazione: (2025)
Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026)
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026)
Regret Minimization via Saddle Point Optimization
di: Kirschner, Johannes, et al.
Pubblicazione: (2024)
di: Kirschner, Johannes, et al.
Pubblicazione: (2024)
Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning
di: Wang, Yiran, et al.
Pubblicazione: (2024)
di: Wang, Yiran, et al.
Pubblicazione: (2024)
Near-Optimal Sample Complexity for Online Constrained MDPs
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
Ordering-based Conditions for Global Convergence of Policy Gradient Methods
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
Stochastic Gradient Succeeds for Bandits
di: Mei, Jincheng, et al.
Pubblicazione: (2024)
di: Mei, Jincheng, et al.
Pubblicazione: (2024)
Small steps no more: Global convergence of stochastic gradient bandits for arbitrary learning rates
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
A Single-Loop Deep Actor-Critic Algorithm for Constrained Reinforcement Learning with Provable Convergence
di: Wang, Kexuan, et al.
Pubblicazione: (2023)
di: Wang, Kexuan, et al.
Pubblicazione: (2023)
Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning
di: Ma, Weiyu, et al.
Pubblicazione: (2026)
di: Ma, Weiyu, et al.
Pubblicazione: (2026)
Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling
di: Guo, Yiran, et al.
Pubblicazione: (2026)
di: Guo, Yiran, et al.
Pubblicazione: (2026)
Vulnerability Analysis of Safe Reinforcement Learning via Inverse Constrained Reinforcement Learning
di: Fan, Jialiang, et al.
Pubblicazione: (2026)
di: Fan, Jialiang, et al.
Pubblicazione: (2026)
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
di: Chen, Huamin, et al.
Pubblicazione: (2026)
di: Chen, Huamin, et al.
Pubblicazione: (2026)
An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning
di: Lin, Qian, et al.
Pubblicazione: (2024)
di: Lin, Qian, et al.
Pubblicazione: (2024)
ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
di: Liu, Jia, et al.
Pubblicazione: (2025)
di: Liu, Jia, et al.
Pubblicazione: (2025)
Frontier LLMs Still Struggle with Simple Reasoning Tasks
di: Malek, Alan, et al.
Pubblicazione: (2025)
di: Malek, Alan, et al.
Pubblicazione: (2025)
Stochastic Gradient Descent for Gaussian Processes Done Right
di: Lin, Jihao Andreas, et al.
Pubblicazione: (2023)
di: Lin, Jihao Andreas, et al.
Pubblicazione: (2023)
Rethinking the Global Convergence of Softmax Policy Gradient with Linear Function Approximation
di: Lin, Max Qiushi, et al.
Pubblicazione: (2025)
di: Lin, Max Qiushi, et al.
Pubblicazione: (2025)
LLaPipe: LLM-Guided Reinforcement Learning for Automated Data Preparation Pipeline Construction
di: Chang, Jing, et al.
Pubblicazione: (2025)
di: Chang, Jing, et al.
Pubblicazione: (2025)
Temporal Difference Learning with Constrained Initial Representations
di: Lyu, Jiafei, et al.
Pubblicazione: (2026)
di: Lyu, Jiafei, et al.
Pubblicazione: (2026)
ARMOR: High-Performance Semi-Structured Pruning via Adaptive Matrix Factorization
di: Liu, Lawrence, et al.
Pubblicazione: (2025)
di: Liu, Lawrence, et al.
Pubblicazione: (2025)
Uniform Last-Iterate Guarantee for Bandits and Reinforcement Learning
di: Liu, Junyan, et al.
Pubblicazione: (2024)
di: Liu, Junyan, et al.
Pubblicazione: (2024)
LLM-Upgraded Graph Reinforcement Learning for Carbon-Aware Job Scheduling in Smart Manufacturing
di: Yang, Zhiying, et al.
Pubblicazione: (2025)
di: Yang, Zhiying, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Confident Natural Policy Gradient for Local Planning in $q_π$-realizable Constrained MDPs
di: Tian, Tian, et al.
Pubblicazione: (2024) -
Rectifying Regression in Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025) -
Learning to Reason Efficiently with Discounted Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025) -
Sharper Guarantees for Misspecified Kernelized Bandit Optimization
di: Maran, Davide, et al.
Pubblicazione: (2026) -
Trajectory Data Suffices for Statistically Efficient Learning in Offline RL with Linear $q^π$-Realizability and Concentrability
di: Tkachuk, Volodymyr, et al.
Pubblicazione: (2024)