Natural Language Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Feng, Xidong, Liu, Bo, Song, Yan, Fu, Haotian, Wan, Ziyu, Koushik, Girish A., Hu, Zhiyuan, Yang, Mengyue, Wen, Ying, Wang, Jun |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Natural Language Reinforcement Learning
by: Feng, Xidong, et al.
Published: (2024)
by: Feng, Xidong, et al.
Published: (2024)
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
by: Feng, Xidong, et al.
Published: (2023)
by: Feng, Xidong, et al.
Published: (2023)
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
by: Wan, Ziyu, et al.
Published: (2025)
by: Wan, Ziyu, et al.
Published: (2025)
Language Games as the Pathway to Artificial Superhuman Intelligence
by: Wen, Ying, et al.
Published: (2025)
by: Wen, Ying, et al.
Published: (2025)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
by: Wang, Jun, et al.
Published: (2024)
by: Wang, Jun, et al.
Published: (2024)
Fine-Grained Interpretation of Political Opinions in Large Language Models
by: Hu, Jingyu, et al.
Published: (2025)
by: Hu, Jingyu, et al.
Published: (2025)
Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning
by: Huang, Lei, et al.
Published: (2026)
by: Huang, Lei, et al.
Published: (2026)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
by: Wen, Muning, et al.
Published: (2024)
by: Wen, Muning, et al.
Published: (2024)
Efficient Reinforcement Learning with Large Language Model Priors
by: Yan, Xue, et al.
Published: (2024)
by: Yan, Xue, et al.
Published: (2024)
On Subjective Uncertainty Quantification and Calibration in Natural Language Generation
by: Wang, Ziyu, et al.
Published: (2024)
by: Wang, Ziyu, et al.
Published: (2024)
MiRD: Reliable Set-Valued Prediction for Open-Ended Question Answering via Miscoverage Risk Decomposition
by: Hu, Anqi, et al.
Published: (2026)
by: Hu, Anqi, et al.
Published: (2026)
Set-Valued Prediction for Large Language Models with Feasibility-Aware Coverage Guarantees
by: Li, Ye, et al.
Published: (2026)
by: Li, Ye, et al.
Published: (2026)
CTRL-RAG: Contrastive Likelihood Reward Based Reinforcement Learning for Context-Faithful RAG Models
by: Tan, Zhehao, et al.
Published: (2026)
by: Tan, Zhehao, et al.
Published: (2026)
Uncertainty of Thoughts: Uncertainty-Aware Planning Enhances Information Seeking in Large Language Models
by: Hu, Zhiyuan, et al.
Published: (2024)
by: Hu, Zhiyuan, et al.
Published: (2024)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
by: Zhang, Ziyin, et al.
Published: (2025)
by: Zhang, Ziyin, et al.
Published: (2025)
Genshin: General Shield for Natural Language Processing with Large Language Models
by: Peng, Xiao, et al.
Published: (2024)
by: Peng, Xiao, et al.
Published: (2024)
Text2Grad: Reinforcement Learning from Natural Language Feedback
by: Wang, Hanyang, et al.
Published: (2025)
by: Wang, Hanyang, et al.
Published: (2025)
Ask more, know better: Reinforce-Learned Prompt Questions for Decision Making with Large Language Models
by: Yan, Xue, et al.
Published: (2023)
by: Yan, Xue, et al.
Published: (2023)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
by: Bai, Fengshuo, et al.
Published: (2024)
by: Bai, Fengshuo, et al.
Published: (2024)
Self-assessment, Exhibition, and Recognition: a Review of Personality in Large Language Models
by: Wen, Zhiyuan, et al.
Published: (2024)
by: Wen, Zhiyuan, et al.
Published: (2024)
Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs
by: Ling Team, et al.
Published: (2025)
by: Ling Team, et al.
Published: (2025)
Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models
by: Yang, Jingyuan, et al.
Published: (2025)
by: Yang, Jingyuan, et al.
Published: (2025)
PARL-MT: Learning to Call Functions in Multi-Turn Conversation with Progress Awareness
by: Chai, Huacan, et al.
Published: (2025)
by: Chai, Huacan, et al.
Published: (2025)
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
by: Wang, Qingni, et al.
Published: (2024)
by: Wang, Qingni, et al.
Published: (2024)
Evaluation of data inconsistency for multi-modal sentiment analysis
by: Wang, Yufei, et al.
Published: (2024)
by: Wang, Yufei, et al.
Published: (2024)
Beyond Scalar Scores: Reinforcement Learning for Error-Aware Quality Estimation of Machine Translation
by: Sindhujan, Archchana, et al.
Published: (2026)
by: Sindhujan, Archchana, et al.
Published: (2026)
Beyond Natural Language: LLMs Leveraging Alternative Formats for Enhanced Reasoning and Communication
by: Chen, Weize, et al.
Published: (2024)
by: Chen, Weize, et al.
Published: (2024)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
by: Fang, Wenkai, et al.
Published: (2025)
by: Fang, Wenkai, et al.
Published: (2025)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
by: Zhang, Guibin, et al.
Published: (2025)
by: Zhang, Guibin, et al.
Published: (2025)
Learning to Compress Prompt in Natural Language Formats
by: Chuang, Yu-Neng, et al.
Published: (2024)
by: Chuang, Yu-Neng, et al.
Published: (2024)
Coupled Variational Reinforcement Learning for Language Model General Reasoning
by: Wen, Xueru, et al.
Published: (2025)
by: Wen, Xueru, et al.
Published: (2025)
PLPP: Prompt Learning with Perplexity Is Self-Distillation for Vision-Language Models
by: Liu, Biao, et al.
Published: (2024)
by: Liu, Biao, et al.
Published: (2024)
Exploring the Role of Transliteration in In-Context Learning for Low-resource Languages Written in Non-Latin Scripts
by: Ma, Chunlan, et al.
Published: (2024)
by: Ma, Chunlan, et al.
Published: (2024)
Natural Language Processing in Support of Evidence-based Medicine: A Scoping Review
by: Xu, Zihan, et al.
Published: (2025)
by: Xu, Zihan, et al.
Published: (2025)
Natural Language Fine-Tuning
by: Liu, Jia, et al.
Published: (2024)
by: Liu, Jia, et al.
Published: (2024)
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
by: Hong, Haitao, et al.
Published: (2025)
by: Hong, Haitao, et al.
Published: (2025)
OsmT: Bridging OpenStreetMap Queries and Natural Language with Open-source Tag-aware Language Models
by: Wan, Zhuoyue, et al.
Published: (2025)
by: Wan, Zhuoyue, et al.
Published: (2025)
Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
by: Yang, Jingyi, et al.
Published: (2025)
by: Yang, Jingyi, et al.
Published: (2025)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
by: Hu, Bokai, et al.
Published: (2024)
by: Hu, Bokai, et al.
Published: (2024)
Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning
by: Hu, Zhiyuan, et al.
Published: (2026)
by: Hu, Zhiyuan, et al.
Published: (2026)
Similar Items
-
Natural Language Reinforcement Learning
by: Feng, Xidong, et al.
Published: (2024) -
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
by: Feng, Xidong, et al.
Published: (2023) -
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
by: Wan, Ziyu, et al.
Published: (2025) -
Language Games as the Pathway to Artificial Superhuman Intelligence
by: Wen, Ying, et al.
Published: (2025) -
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
by: Wang, Jun, et al.
Published: (2024)