A Technical Survey of Reinforcement Learning Techniques for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Srivastava, Saksham Sahai, Aggarwal, Vaneet |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents
di: Srivastava, Saksham Sahai
Pubblicazione: (2026)
di: Srivastava, Saksham Sahai
Pubblicazione: (2026)
MathDivide: Improved mathematical reasoning by large language models
di: Srivastava, Saksham Sahai, et al.
Pubblicazione: (2024)
di: Srivastava, Saksham Sahai, et al.
Pubblicazione: (2024)
MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval
di: Srivastava, Saksham Sahai, et al.
Pubblicazione: (2025)
di: Srivastava, Saksham Sahai, et al.
Pubblicazione: (2025)
Sample Complexity Analysis for Constrained Bilevel Reinforcement Learning
di: Saxena, Naman, et al.
Pubblicazione: (2026)
di: Saxena, Naman, et al.
Pubblicazione: (2026)
Sample-Efficient Constrained Reinforcement Learning with General Parameterization
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
Accelerating Quantum Reinforcement Learning with a Quantum Natural Policy Gradient Based Approach
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
di: Aggarwal, Vaneet, et al.
Pubblicazione: (2024)
di: Aggarwal, Vaneet, et al.
Pubblicazione: (2024)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Joint Optimization of Multi-Objective Reinforcement Learning with Policy Gradient Based Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2021)
di: Bai, Qinbo, et al.
Pubblicazione: (2021)
Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning
di: Moradipari, Ahmadreza, et al.
Pubblicazione: (2023)
di: Moradipari, Ahmadreza, et al.
Pubblicazione: (2023)
Achieving Zero Constraint Violation for Constrained Reinforcement Learning via Conservative Natural Policy Gradient Primal-Dual Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2022)
di: Bai, Qinbo, et al.
Pubblicazione: (2022)
Discrete State Diffusion Models: A Sample Complexity Perspective
di: Srikanth, Aadithya, et al.
Pubblicazione: (2025)
di: Srikanth, Aadithya, et al.
Pubblicazione: (2025)
Consensus Is All You Need: Gossip-Based Reasoning Among Large Language Models
di: Arora, Saksham
Pubblicazione: (2025)
di: Arora, Saksham
Pubblicazione: (2025)
On The Sample Complexity Bounds In Bilevel Reinforcement Learning
di: Gaur, Mudit, et al.
Pubblicazione: (2025)
di: Gaur, Mudit, et al.
Pubblicazione: (2025)
$γ$-weakly $θ$-up-concavity: A Unified Framework for Non-Convex Optimization Beyond DR-Submodular and OSS Functions
di: Pedramfar, Mohammad, et al.
Pubblicazione: (2026)
di: Pedramfar, Mohammad, et al.
Pubblicazione: (2026)
Deep Generative Models for Offline Policy Learning: Tutorial, Survey, and Perspectives on Future Directions
di: Chen, Jiayu, et al.
Pubblicazione: (2024)
di: Chen, Jiayu, et al.
Pubblicazione: (2024)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
Improved Sample Complexity Analysis of Natural Policy Gradient Algorithm with General Parameterization for Infinite Horizon Discounted Reward Markov Decision Processes
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2023)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2023)
Stochastic Submodular Bandits with Delayed Composite Anonymous Bandit Feedback
di: Pedramfar, Mohammad, et al.
Pubblicazione: (2023)
di: Pedramfar, Mohammad, et al.
Pubblicazione: (2023)
Stochastic Q-learning for Large Discrete Action Spaces
di: Fourati, Fares, et al.
Pubblicazione: (2024)
di: Fourati, Fares, et al.
Pubblicazione: (2024)
A Bi-directional Quantum Search Algorithm
di: Konar, Debanjan, et al.
Pubblicazione: (2024)
di: Konar, Debanjan, et al.
Pubblicazione: (2024)
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2024)
di: Bai, Qinbo, et al.
Pubblicazione: (2024)
Variational Offline Multi-agent Skill Discovery
di: Chen, Jiayu, et al.
Pubblicazione: (2024)
di: Chen, Jiayu, et al.
Pubblicazione: (2024)
Network Diffuser for Placing-Scheduling Service Function Chains with Inverse Demonstration
di: Zhang, Zuyuan, et al.
Pubblicazione: (2025)
di: Zhang, Zuyuan, et al.
Pubblicazione: (2025)
Don't Freeze, Don't Crash: Extending the Safe Operating Range of Neural Navigation in Dense Crowds
di: Zhang, Jiefu, et al.
Pubblicazione: (2026)
di: Zhang, Jiefu, et al.
Pubblicazione: (2026)
Watermarking Techniques for Large Language Models: A Survey
di: Liang, Yuqing, et al.
Pubblicazione: (2024)
di: Liang, Yuqing, et al.
Pubblicazione: (2024)
BAGEL: Projection-Free Algorithm for Adversarially Constrained Online Convex Optimization
di: Lu, Yiyang, et al.
Pubblicazione: (2025)
di: Lu, Yiyang, et al.
Pubblicazione: (2025)
Augmenting generative models with biomedical knowledge graphs improves targeted drug discovery
di: Malusare, Aditya, et al.
Pubblicazione: (2025)
di: Malusare, Aditya, et al.
Pubblicazione: (2025)
Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes
di: Ganguly, Bhargav, et al.
Pubblicazione: (2023)
di: Ganguly, Bhargav, et al.
Pubblicazione: (2023)
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
di: Bai, Qinbo, et al.
Pubblicazione: (2023)
di: Bai, Qinbo, et al.
Pubblicazione: (2023)
PRIVATEEDIT: A Privacy-Preserving Pipeline for Face-Centric Generative Image Editing
di: Tamboli, Dipesh, et al.
Pubblicazione: (2026)
di: Tamboli, Dipesh, et al.
Pubblicazione: (2026)
A Unified Approach for Maximizing Continuous DR-submodular Functions
di: Pedramfar, Mohammad, et al.
Pubblicazione: (2023)
di: Pedramfar, Mohammad, et al.
Pubblicazione: (2023)
Reinforced Sequential Decision-Making for Sepsis Treatment: The POSNEGDM Framework with Mortality Classifier and Transformer
di: Tamboli, Dipesh, et al.
Pubblicazione: (2024)
di: Tamboli, Dipesh, et al.
Pubblicazione: (2024)
Stronger Approximation Guarantees for Non-Monotone γ-Weakly DR-Submodular Maximization
di: Jadav, Hareshkumar, et al.
Pubblicazione: (2026)
di: Jadav, Hareshkumar, et al.
Pubblicazione: (2026)
ECPv2: Fast, Efficient, and Scalable Global Optimization of Lipschitz Functions
di: Fourati, Fares, et al.
Pubblicazione: (2025)
di: Fourati, Fares, et al.
Pubblicazione: (2025)
Order-Optimal Sample Complexity of Rectified Flows
di: Sahoo, Hari Krishna, et al.
Pubblicazione: (2026)
di: Sahoo, Hari Krishna, et al.
Pubblicazione: (2026)
A Comprehensive Survey of Machine Unlearning Techniques for Large Language Models
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
A Comprehensive Survey of Accelerated Generation Techniques in Large Language Models
di: Khoshnoodi, Mahsa, et al.
Pubblicazione: (2024)
di: Khoshnoodi, Mahsa, et al.
Pubblicazione: (2024)
A Scalable Quantum Non-local Neural Network for Image Classification
di: Gupta, Sparsh, et al.
Pubblicazione: (2024)
di: Gupta, Sparsh, et al.
Pubblicazione: (2024)
SLAM: Structural Linguistic Activation Marking for Language Models
di: Harel-Canada, Fabrice, et al.
Pubblicazione: (2026)
di: Harel-Canada, Fabrice, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents
di: Srivastava, Saksham Sahai
Pubblicazione: (2026) -
MathDivide: Improved mathematical reasoning by large language models
di: Srivastava, Saksham Sahai, et al.
Pubblicazione: (2024) -
MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval
di: Srivastava, Saksham Sahai, et al.
Pubblicazione: (2025) -
Sample Complexity Analysis for Constrained Bilevel Reinforcement Learning
di: Saxena, Naman, et al.
Pubblicazione: (2026) -
Sample-Efficient Constrained Reinforcement Learning with General Parameterization
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)