Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
Fuente:
arXiv
Saved in:
| Main Authors: | van Niekerk, Carel, Vukovic, Renato, Ruppik, Benjamin Matthias, Lin, Hsien-chin, Gašić, Milica |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Local Topology Measures of Contextual Language Model Latent Spaces With Applications to Dialogue Term Extraction
by: Ruppik, Benjamin Matthias, et al.
Published: (2024)
by: Ruppik, Benjamin Matthias, et al.
Published: (2024)
Dialogue Ontology Relation Extraction via Constrained Chain-of-Thought Decoding
by: Vukovic, Renato, et al.
Published: (2024)
by: Vukovic, Renato, et al.
Published: (2024)
A Confidence-based Acquisition Model for Self-supervised Active Learning and Label Correction
by: van Niekerk, Carel, et al.
Published: (2023)
by: van Niekerk, Carel, et al.
Published: (2023)
Emotionally Intelligent Task-oriented Dialogue Systems: Architecture, Representation, and Optimisation
by: Feng, Shutong, et al.
Published: (2025)
by: Feng, Shutong, et al.
Published: (2025)
Less is More: Local Intrinsic Dimensions of Contextual Language Models
by: Ruppik, Benjamin Matthias, et al.
Published: (2025)
by: Ruppik, Benjamin Matthias, et al.
Published: (2025)
Text-to-SQL Task-oriented Dialogue Ontology Construction
by: Vukovic, Renato, et al.
Published: (2025)
by: Vukovic, Renato, et al.
Published: (2025)
Infusing Emotions into Task-oriented Dialogue Systems: Understanding, Management, and Generation
by: Feng, Shutong, et al.
Published: (2024)
by: Feng, Shutong, et al.
Published: (2024)
Learning from Noisy Labels via Self-Taught On-the-Fly Meta Loss Rescaling
by: Heck, Michael, et al.
Published: (2024)
by: Heck, Michael, et al.
Published: (2024)
Prompt reinforcing for long-term planning of large language models
by: Lin, Hsien-Chin, et al.
Published: (2025)
by: Lin, Hsien-Chin, et al.
Published: (2025)
Exploration Through Introspection: A Self-Aware Reward Model
by: Petrowski, Michael, et al.
Published: (2026)
by: Petrowski, Michael, et al.
Published: (2026)
Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities
by: Sun, Hao, et al.
Published: (2025)
by: Sun, Hao, et al.
Published: (2025)
Legal Documents Drafting with Fine-Tuned Pre-Trained Large Language Model
by: Lin, Chun-Hsien, et al.
Published: (2024)
by: Lin, Chun-Hsien, et al.
Published: (2024)
Affect Recognition in Conversations Using Large Language Models
by: Feng, Shutong, et al.
Published: (2023)
by: Feng, Shutong, et al.
Published: (2023)
Learning to Better Search with Language Models via Guided Reinforced Self-Training
by: Moon, Seungyong, et al.
Published: (2024)
by: Moon, Seungyong, et al.
Published: (2024)
Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models
by: Jiang, Haitao, et al.
Published: (2026)
by: Jiang, Haitao, et al.
Published: (2026)
STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language Models
by: Basavatia, Shreyas, et al.
Published: (2024)
by: Basavatia, Shreyas, et al.
Published: (2024)
Aggressive Post-Training Compression on Extremely Large Language Models
by: Zhang, Zining, et al.
Published: (2024)
by: Zhang, Zining, et al.
Published: (2024)
Training Agents with Weakly Supervised Feedback from Large Language Models
by: Gong, Dihong, et al.
Published: (2024)
by: Gong, Dihong, et al.
Published: (2024)
Mapping Post-Training Forgetting in Language Models at Scale
by: Harmon, Jackson, et al.
Published: (2025)
by: Harmon, Jackson, et al.
Published: (2025)
Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
by: Zhu, Jian-Qiao, et al.
Published: (2025)
by: Zhu, Jian-Qiao, et al.
Published: (2025)
Token-Level Uncertainty-Aware Objective for Language Model Post-Training
by: Liu, Tingkai, et al.
Published: (2025)
by: Liu, Tingkai, et al.
Published: (2025)
Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models
by: Pipatanakul, Kunat, et al.
Published: (2026)
by: Pipatanakul, Kunat, et al.
Published: (2026)
Efficient Post-Training Refinement of Latent Reasoning in Large Language Models
by: Wang, Xinyuan, et al.
Published: (2025)
by: Wang, Xinyuan, et al.
Published: (2025)
Sparsity Induction for Accurate Post-Training Pruning of Large Language Models
by: Jiang, Minhao, et al.
Published: (2026)
by: Jiang, Minhao, et al.
Published: (2026)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
by: Xiao, Guangxuan, et al.
Published: (2022)
by: Xiao, Guangxuan, et al.
Published: (2022)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
by: Wang, Yiping, et al.
Published: (2025)
by: Wang, Yiping, et al.
Published: (2025)
Text2Grad: Reinforcement Learning from Natural Language Feedback
by: Wang, Hanyang, et al.
Published: (2025)
by: Wang, Hanyang, et al.
Published: (2025)
Enhancing the Traditional Chinese Medicine Capabilities of Large Language Model through Reinforcement Learning from AI Feedback
by: Yu, Song, et al.
Published: (2024)
by: Yu, Song, et al.
Published: (2024)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
by: Tao, Yongding, et al.
Published: (2025)
by: Tao, Yongding, et al.
Published: (2025)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
by: Fang, Wenkai, et al.
Published: (2025)
by: Fang, Wenkai, et al.
Published: (2025)
Reinforcement Learning from Compiler and Language Server Feedback
by: Zhang, Yifan, et al.
Published: (2025)
by: Zhang, Yifan, et al.
Published: (2025)
On the Effectiveness of Incremental Training of Large Language Models
by: Li, Miles Q., et al.
Published: (2024)
by: Li, Miles Q., et al.
Published: (2024)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
by: Xi, Zhiheng, et al.
Published: (2024)
by: Xi, Zhiheng, et al.
Published: (2024)
Training Language Models with Language Feedback at Scale
by: Scheurer, Jérémy, et al.
Published: (2023)
by: Scheurer, Jérémy, et al.
Published: (2023)
ProtRLSearch: A Multi-Round Multimodal Protein Search Agent with Large Language Models Trained via Reinforcement Learning
by: Liu, Congying, et al.
Published: (2026)
by: Liu, Congying, et al.
Published: (2026)
Contextual Reinforcement in Multimodal Token Compression for Large Language Models
by: Piero, Naderdel, et al.
Published: (2025)
by: Piero, Naderdel, et al.
Published: (2025)
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
by: Zhao, Shiwan, et al.
Published: (2026)
by: Zhao, Shiwan, et al.
Published: (2026)
Post-Training Language Models for Crosslingual Consistency
by: Liu, Tianyu, et al.
Published: (2026)
by: Liu, Tianyu, et al.
Published: (2026)
Interactions Across Blocks in Post-Training Quantization of Large Language Models
by: Shabanovi, Khasmamad, et al.
Published: (2024)
by: Shabanovi, Khasmamad, et al.
Published: (2024)
Towards a Unified View of Large Language Model Post-Training
by: Lv, Xingtai, et al.
Published: (2025)
by: Lv, Xingtai, et al.
Published: (2025)
Similar Items
-
Local Topology Measures of Contextual Language Model Latent Spaces With Applications to Dialogue Term Extraction
by: Ruppik, Benjamin Matthias, et al.
Published: (2024) -
Dialogue Ontology Relation Extraction via Constrained Chain-of-Thought Decoding
by: Vukovic, Renato, et al.
Published: (2024) -
A Confidence-based Acquisition Model for Self-supervised Active Learning and Label Correction
by: van Niekerk, Carel, et al.
Published: (2023) -
Emotionally Intelligent Task-oriented Dialogue Systems: Architecture, Representation, and Optimisation
by: Feng, Shutong, et al.
Published: (2025) -
Less is More: Local Intrinsic Dimensions of Contextual Language Models
by: Ruppik, Benjamin Matthias, et al.
Published: (2025)