Off-Policy Value-Based Reinforcement Learning for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Peng-Yuan, Li, Ziniu, Xu, Tian, Yang, Bohan, Liu, Tian-Shuo, Wang, ChenYang, Chen, Xiong-Hui, Li, Yi-Chen, Yang, Tianyun, Chen, Congliang, Yu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
di: Li, Ziniu, et al.
Pubblicazione: (2025)
di: Li, Ziniu, et al.
Pubblicazione: (2025)
Policy Optimization in RLHF: The Impact of Out-of-preference Data
di: Li, Ziniu, et al.
Pubblicazione: (2023)
di: Li, Ziniu, et al.
Pubblicazione: (2023)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
di: Li, Ziniu, et al.
Pubblicazione: (2024)
di: Li, Ziniu, et al.
Pubblicazione: (2024)
Bridging Formal Language with Chain-of-Thought Reasoning to Geometry Problem Solving
di: Yang, Tianyun, et al.
Pubblicazione: (2025)
di: Yang, Tianyun, et al.
Pubblicazione: (2025)
A Survey on Large Language Models for Mathematical Reasoning
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
Non-Adversarial Imitation Learning Provably Free of Compounding Errors: The Role of Bellman Constraints
di: Xu, Tian, et al.
Pubblicazione: (2026)
di: Xu, Tian, et al.
Pubblicazione: (2026)
Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives
di: Liu, Yajiao, et al.
Pubblicazione: (2025)
di: Liu, Yajiao, et al.
Pubblicazione: (2025)
Why Transformers Need Adam: A Hessian Perspective
di: Zhang, Yushun, et al.
Pubblicazione: (2024)
di: Zhang, Yushun, et al.
Pubblicazione: (2024)
BWArea Model: Learning World Model, Inverse Dynamics, and Policy for Controllable Language Generation
di: Jia, Chengxing, et al.
Pubblicazione: (2024)
di: Jia, Chengxing, et al.
Pubblicazione: (2024)
Controlling Large Language Model with Latent Actions
di: Jia, Chengxing, et al.
Pubblicazione: (2025)
di: Jia, Chengxing, et al.
Pubblicazione: (2025)
Generalist Reward Models: Found Inside Large Language Models
di: Li, Yi-Chen, et al.
Pubblicazione: (2025)
di: Li, Yi-Chen, et al.
Pubblicazione: (2025)
AdaGC: Improving Training Stability for Large Language Model Pretraining
di: Wang, Guoxia, et al.
Pubblicazione: (2025)
di: Wang, Guoxia, et al.
Pubblicazione: (2025)
ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models
di: Li, Ziniu, et al.
Pubblicazione: (2023)
di: Li, Ziniu, et al.
Pubblicazione: (2023)
Cross-Subject Depression Level Classification Using EEG Signals with a Sample Confidence Method
di: Zhang, ZhongYi, et al.
Pubblicazione: (2025)
di: Zhang, ZhongYi, et al.
Pubblicazione: (2025)
Understanding Adversarial Imitation Learning in Small Sample Regime: A Stage-coupled Analysis
di: Xu, Tian, et al.
Pubblicazione: (2022)
di: Xu, Tian, et al.
Pubblicazione: (2022)
TCDE: Topic-Centric Dual Expansion of Queries and Documents with Large Language Models for Information Retrieval
di: Yang, Yu, et al.
Pubblicazione: (2025)
di: Yang, Yu, et al.
Pubblicazione: (2025)
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
di: Liu, Xu-Hui, et al.
Pubblicazione: (2024)
di: Liu, Xu-Hui, et al.
Pubblicazione: (2024)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024)
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024)
How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning
di: Tian, Minghao, et al.
Pubblicazione: (2026)
di: Tian, Minghao, et al.
Pubblicazione: (2026)
Duolando: Follower GPT with Off-Policy Reinforcement Learning for Dance Accompaniment
di: Siyao, Li, et al.
Pubblicazione: (2024)
di: Siyao, Li, et al.
Pubblicazione: (2024)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2026)
di: Xu, Xin, et al.
Pubblicazione: (2026)
Behavior-Induced Mirror-Prox Temporal-Difference Learning for Faster Off-Policy Prediction
di: Chen, Xingguo, et al.
Pubblicazione: (2026)
di: Chen, Xingguo, et al.
Pubblicazione: (2026)
Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning
di: Chen, Zizhe, et al.
Pubblicazione: (2026)
di: Chen, Zizhe, et al.
Pubblicazione: (2026)
Behavior-Aware Auxiliary Corrections for Off-Policy Temporal-Difference Prediction
di: Chen, Xingguo, et al.
Pubblicazione: (2026)
di: Chen, Xingguo, et al.
Pubblicazione: (2026)
Embeddable NbO2‐Based Modulator with Carrier Generation and Direct Digital Modulation for Wireless Internet of Things
di: Pei Chen, et al.
Pubblicazione: (2025)
di: Pei Chen, et al.
Pubblicazione: (2025)
Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models
di: Wang, Yinjie, et al.
Pubblicazione: (2025)
di: Wang, Yinjie, et al.
Pubblicazione: (2025)
Research on Model Parallelism and Data Parallelism Optimization Methods in Large Language Model-Based Recommendation Systems
di: Yang, Haowei, et al.
Pubblicazione: (2025)
di: Yang, Haowei, et al.
Pubblicazione: (2025)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)
A novel intronic variant causing aberrant splicing identified in two deaf Chinese siblings with enlarged vestibular aqueducts
di: Suyang Wang, et al.
Pubblicazione: (2024)
di: Suyang Wang, et al.
Pubblicazione: (2024)
RMLer: Synthesizing Novel Objects across Diverse Categories via Reinforcement Mixing Learning
di: Li, Jun, et al.
Pubblicazione: (2025)
di: Li, Jun, et al.
Pubblicazione: (2025)
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
di: Zhang, Fuxiang, et al.
Pubblicazione: (2024)
di: Zhang, Fuxiang, et al.
Pubblicazione: (2024)
Filling the Image Information Gap for VQA: Prompting Large Language Models to Proactively Ask Questions
di: Wang, Ziyue, et al.
Pubblicazione: (2023)
di: Wang, Ziyue, et al.
Pubblicazione: (2023)
RSATalker: Realistic Socially-Aware Talking Head Generation for Multi-Turn Conversation
di: Chen, Peng, et al.
Pubblicazione: (2026)
di: Chen, Peng, et al.
Pubblicazione: (2026)
BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning
di: Xu, Yuhang, et al.
Pubblicazione: (2026)
di: Xu, Yuhang, et al.
Pubblicazione: (2026)
Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
di: Chen, Peter, et al.
Pubblicazione: (2025)
di: Chen, Peter, et al.
Pubblicazione: (2025)
Force-IMU Fusion-Based Sensing Acupuncture Needle and Quantitative Analysis System for Acupuncture Manipulations
di: Tian, Peng, et al.
Pubblicazione: (2025)
di: Tian, Peng, et al.
Pubblicazione: (2025)
DLLMQuant: Quantizing Diffusion-based Large Language Models
di: Xu, Chen, et al.
Pubblicazione: (2025)
di: Xu, Chen, et al.
Pubblicazione: (2025)
Herman-Kluk-Like Semi-Classical Initial-Value Representation for Boltzmann Operator
di: Wang, Binhao, et al.
Pubblicazione: (2025)
di: Wang, Binhao, et al.
Pubblicazione: (2025)
GraphChain: Large Language Models for Large-scale Graph Analysis via Tool Chaining
di: Wei, Chunyu, et al.
Pubblicazione: (2025)
di: Wei, Chunyu, et al.
Pubblicazione: (2025)
Large Language Model for OWL Proofs
di: Yang, Hui, et al.
Pubblicazione: (2026)
di: Yang, Hui, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
di: Li, Ziniu, et al.
Pubblicazione: (2025) -
Policy Optimization in RLHF: The Impact of Out-of-preference Data
di: Li, Ziniu, et al.
Pubblicazione: (2023) -
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
di: Li, Ziniu, et al.
Pubblicazione: (2024) -
Bridging Formal Language with Chain-of-Thought Reasoning to Geometry Problem Solving
di: Yang, Tianyun, et al.
Pubblicazione: (2025) -
A Survey on Large Language Models for Mathematical Reasoning
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)