Natural Language Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Feng, Xidong, Wan, Ziyu, Yang, Mengyue, Wang, Ziyan, Koushik, Girish A., Du, Yali, Wen, Ying, Wang, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024)
di: Feng, Xidong, et al.
Pubblicazione: (2024)
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
di: Feng, Xidong, et al.
Pubblicazione: (2023)
di: Feng, Xidong, et al.
Pubblicazione: (2023)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
di: Wen, Muning, et al.
Pubblicazione: (2024)
di: Wen, Muning, et al.
Pubblicazione: (2024)
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
di: Wan, Ziyu, et al.
Pubblicazione: (2025)
di: Wan, Ziyu, et al.
Pubblicazione: (2025)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
di: Liu, Wei, et al.
Pubblicazione: (2025)
di: Liu, Wei, et al.
Pubblicazione: (2025)
On Subjective Uncertainty Quantification and Calibration in Natural Language Generation
di: Wang, Ziyu, et al.
Pubblicazione: (2024)
di: Wang, Ziyu, et al.
Pubblicazione: (2024)
Safe Reinforcement Learning with Free-form Natural Language Constraints and Pre-Trained Language Models
di: Lou, Xingzhou, et al.
Pubblicazione: (2024)
di: Lou, Xingzhou, et al.
Pubblicazione: (2024)
Fine-Grained Interpretation of Political Opinions in Large Language Models
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
Safe Multi-agent Reinforcement Learning with Natural Language Constraints
di: Wang, Ziyan, et al.
Pubblicazione: (2024)
di: Wang, Ziyan, et al.
Pubblicazione: (2024)
CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment
di: Guo, Siyuan, et al.
Pubblicazione: (2026)
di: Guo, Siyuan, et al.
Pubblicazione: (2026)
M3HF: Multi-agent Reinforcement Learning from Multi-phase Human Feedback of Mixed Quality
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
All Language Models Large and Small
di: Chen, Zhixun, et al.
Pubblicazione: (2024)
di: Chen, Zhixun, et al.
Pubblicazione: (2024)
VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
di: Wang, Yiping, et al.
Pubblicazione: (2025)
di: Wang, Yiping, et al.
Pubblicazione: (2025)
CoD, Towards an Interpretable Medical Agent using Chain of Diagnosis
di: Chen, Junying, et al.
Pubblicazione: (2024)
di: Chen, Junying, et al.
Pubblicazione: (2024)
Knowledge Graph Reasoning with Self-supervised Reinforcement Learning
di: Ma, Ying, et al.
Pubblicazione: (2024)
di: Ma, Ying, et al.
Pubblicazione: (2024)
Infer Human's Intentions Before Following Natural Language Instructions
di: Wan, Yanming, et al.
Pubblicazione: (2024)
di: Wan, Yanming, et al.
Pubblicazione: (2024)
From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
A Theoretical Understanding of Gradient Bias in Meta-Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2021)
di: Feng, Xidong, et al.
Pubblicazione: (2021)
A Review of Safe Reinforcement Learning: Methods, Theory and Applications
di: Gu, Shangding, et al.
Pubblicazione: (2022)
di: Gu, Shangding, et al.
Pubblicazione: (2022)
D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning
di: Zhang, Ru, et al.
Pubblicazione: (2026)
di: Zhang, Ru, et al.
Pubblicazione: (2026)
A Joint Learning Model with Variational Interaction for Multilingual Program Translation
di: Du, Yali, et al.
Pubblicazione: (2024)
di: Du, Yali, et al.
Pubblicazione: (2024)
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
di: Wang, Siwei, et al.
Pubblicazione: (2025)
di: Wang, Siwei, et al.
Pubblicazione: (2025)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
di: Bai, Fengshuo, et al.
Pubblicazione: (2024)
di: Bai, Fengshuo, et al.
Pubblicazione: (2024)
Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
Large Language Models as Computable Approximations to Solomonoff Induction
di: Wan, Jun, et al.
Pubblicazione: (2025)
di: Wan, Jun, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Wireless Symbol Detection via In-Context Learning
di: Abbas, Momin, et al.
Pubblicazione: (2024)
di: Abbas, Momin, et al.
Pubblicazione: (2024)
Large Language Model Cascades with Mixture of Thoughts Representations for Cost-efficient Reasoning
di: Yue, Murong, et al.
Pubblicazione: (2023)
di: Yue, Murong, et al.
Pubblicazione: (2023)
Ask more, know better: Reinforce-Learned Prompt Questions for Decision Making with Large Language Models
di: Yan, Xue, et al.
Pubblicazione: (2023)
di: Yan, Xue, et al.
Pubblicazione: (2023)
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
Skewed Memorization in Large Language Models: Quantification and Decomposition
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
ATLaS: Agent Tuning via Learning Critical Steps
di: Chen, Zhixun, et al.
Pubblicazione: (2025)
di: Chen, Zhixun, et al.
Pubblicazione: (2025)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
di: Wu, Peilin, et al.
Pubblicazione: (2026)
di: Wu, Peilin, et al.
Pubblicazione: (2026)
STAS: Spatial-Temporal Return Decomposition for Multi-agent Reinforcement Learning
di: Chen, Sirui, et al.
Pubblicazione: (2023)
di: Chen, Sirui, et al.
Pubblicazione: (2023)
RuAG: Learned-rule-augmented Generation for Large Language Models
di: Zhang, Yudi, et al.
Pubblicazione: (2024)
di: Zhang, Yudi, et al.
Pubblicazione: (2024)
Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
Learning from Failures in Multi-Attempt Reinforcement Learning
di: Chung, Stephen, et al.
Pubblicazione: (2025)
di: Chung, Stephen, et al.
Pubblicazione: (2025)
When More is Less: Understanding Chain-of-Thought Length in LLMs
di: Wu, Yuyang, et al.
Pubblicazione: (2025)
di: Wu, Yuyang, et al.
Pubblicazione: (2025)
Adversarial Reinforcement Learning for Large Language Model Agent Safety
di: Wang, Zizhao, et al.
Pubblicazione: (2025)
di: Wang, Zizhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024) -
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
di: Feng, Xidong, et al.
Pubblicazione: (2023) -
Reinforcing Language Agents via Policy Optimization with Action Decomposition
di: Wen, Muning, et al.
Pubblicazione: (2024) -
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
di: Wan, Ziyu, et al.
Pubblicazione: (2025) -
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
di: Liu, Wei, et al.
Pubblicazione: (2025)