Progress or Regress? Self-Improvement Reversal in Post-training
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Ting, Li, Xuefeng, Liu, Pengfei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DIVE: Diversified Iterative Self-Improvement
by: Qin, Yiwei, et al.
Published: (2025)
by: Qin, Yiwei, et al.
Published: (2025)
OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
by: Wang, Zengzhi, et al.
Published: (2025)
by: Wang, Zengzhi, et al.
Published: (2025)
ToRL: Scaling Tool-Integrated RL
by: Li, Xuefeng, et al.
Published: (2025)
by: Li, Xuefeng, et al.
Published: (2025)
Evaluating Mathematical Reasoning Beyond Accuracy
by: Xia, Shijie, et al.
Published: (2024)
by: Xia, Shijie, et al.
Published: (2024)
On Predicting the Post-training Potential of Pre-trained LLMs
by: Li, Xiaoyuan, et al.
Published: (2026)
by: Li, Xiaoyuan, et al.
Published: (2026)
LIMR: Less is More for RL Scaling
by: Li, Xuefeng, et al.
Published: (2025)
by: Li, Xuefeng, et al.
Published: (2025)
O1 Replication Journey: A Strategic Progress Report -- Part 1
by: Qin, Yiwei, et al.
Published: (2024)
by: Qin, Yiwei, et al.
Published: (2024)
A Training-Free Regeneration Paradigm: Contrastive Reflection Memory Guided Self-Verification and Self-Improvement
by: Li, Yuran, et al.
Published: (2026)
by: Li, Yuran, et al.
Published: (2026)
The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement
by: Wang, Xiaobo, et al.
Published: (2026)
by: Wang, Xiaobo, et al.
Published: (2026)
Enabling Language Models to Implicitly Learn Self-Improvement
by: Wang, Ziqi, et al.
Published: (2023)
by: Wang, Ziqi, et al.
Published: (2023)
AIR: Post-training Data Selection for Reasoning via Attention Head Influence
by: Liu, Jinrui, et al.
Published: (2025)
by: Liu, Jinrui, et al.
Published: (2025)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
by: Wang, Zengzhi, et al.
Published: (2023)
by: Wang, Zengzhi, et al.
Published: (2023)
Dynamic Noise Preference Optimization: Self-Improvement of Large Language Models with Self-Synthetic Data
by: Yang, Haoyan, et al.
Published: (2025)
by: Yang, Haoyan, et al.
Published: (2025)
O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?
by: Huang, Zhen, et al.
Published: (2024)
by: Huang, Zhen, et al.
Published: (2024)
Self-training Strategies for Sentiment Analysis: An Empirical Study
by: Liu, Haochen, et al.
Published: (2023)
by: Liu, Haochen, et al.
Published: (2023)
Post-training an LLM for RAG? Train on Self-Generated Demonstrations
by: Finlayson, Matthew, et al.
Published: (2025)
by: Finlayson, Matthew, et al.
Published: (2025)
Reverse Preference Optimization for Complex Instruction Following
by: Huang, Xiang, et al.
Published: (2025)
by: Huang, Xiang, et al.
Published: (2025)
Progressively Modality Freezing for Multi-Modal Entity Alignment
by: Huang, Yani, et al.
Published: (2024)
by: Huang, Yani, et al.
Published: (2024)
Measuring and Mitigating Post-hoc Rationalization in Reverse Chain-of-Thought Generation
by: Peng, Guangyue, et al.
Published: (2026)
by: Peng, Guangyue, et al.
Published: (2026)
Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text
by: Huang, Chengyu, et al.
Published: (2026)
by: Huang, Chengyu, et al.
Published: (2026)
Better, Faster: Harnessing Self-Improvement in Large Reasoning Models
by: Zhong, Qihuang, et al.
Published: (2026)
by: Zhong, Qihuang, et al.
Published: (2026)
Self-Trained Verification for Training- and Test-Time Self-Improvement
by: Wu, Chen Henry, et al.
Published: (2026)
by: Wu, Chen Henry, et al.
Published: (2026)
Self-Improvement Programming for Temporal Knowledge Graph Question Answering
by: Chen, Zhuo, et al.
Published: (2024)
by: Chen, Zhuo, et al.
Published: (2024)
ReGenesis: LLMs can Grow into Reasoning Generalists via Self-Improvement
by: Peng, Xiangyu, et al.
Published: (2024)
by: Peng, Xiangyu, et al.
Published: (2024)
A Comparative Study of Pre-training and Self-training
by: Wang, Yiheng, et al.
Published: (2024)
by: Wang, Yiheng, et al.
Published: (2024)
On the Impact of Calibration Data in Post-training Quantization and Pruning
by: Williams, Miles, et al.
Published: (2023)
by: Williams, Miles, et al.
Published: (2023)
Test-time Recursive Thinking: Self-Improvement without External Feedback
by: Zhuang, Yufan, et al.
Published: (2026)
by: Zhuang, Yufan, et al.
Published: (2026)
A Survey on LLM Inference-Time Self-Improvement
by: Dong, Xiangjue, et al.
Published: (2024)
by: Dong, Xiangjue, et al.
Published: (2024)
On Data Synthesis and Post-training for Visual Abstract Reasoning
by: Zhu, Ke, et al.
Published: (2025)
by: Zhu, Ke, et al.
Published: (2025)
Presenting a Paper is an Art: Self-Improvement Aesthetic Agents for Academic Presentations
by: Liu, Chengzhi, et al.
Published: (2025)
by: Liu, Chengzhi, et al.
Published: (2025)
Transferable Post-training via Inverse Value Learning
by: Lu, Xinyu, et al.
Published: (2024)
by: Lu, Xinyu, et al.
Published: (2024)
RegMix: Data Mixture as Regression for Language Model Pre-training
by: Liu, Qian, et al.
Published: (2024)
by: Liu, Qian, et al.
Published: (2024)
Self-Improvement in Multimodal Large Language Models: A Survey
by: Deng, Shijian, et al.
Published: (2025)
by: Deng, Shijian, et al.
Published: (2025)
CLEAR: Cross-Lingual Enhancement in Alignment via Reverse-training
by: Lee, Seungyoon, et al.
Published: (2026)
by: Lee, Seungyoon, et al.
Published: (2026)
Beyond Fixed Length: Bucket Pre-training is All You Need
by: Yang, Qing, et al.
Published: (2024)
by: Yang, Qing, et al.
Published: (2024)
Self-training from Self-memory in Data-to-text Generation
by: Ta, Hoang-Thang
Published: (2024)
by: Ta, Hoang-Thang
Published: (2024)
Programming Every Example: Lifting Pre-training Data Quality Like Experts at Scale
by: Zhou, Fan, et al.
Published: (2024)
by: Zhou, Fan, et al.
Published: (2024)
Harnessing the Power of Large Language Models for Empathetic Response Generation: Empirical Investigations and Improvements
by: Qian, Yushan, et al.
Published: (2023)
by: Qian, Yushan, et al.
Published: (2023)
A Survey on Post-training of Large Language Models
by: Tie, Guiyao, et al.
Published: (2025)
by: Tie, Guiyao, et al.
Published: (2025)
One Sample to Rule Them All: Extreme Data Efficiency in Multidiscipline Reasoning with Reinforcement Learning
by: Li, Yiyuan, et al.
Published: (2026)
by: Li, Yiyuan, et al.
Published: (2026)
Similar Items
-
DIVE: Diversified Iterative Self-Improvement
by: Qin, Yiwei, et al.
Published: (2025) -
OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
by: Wang, Zengzhi, et al.
Published: (2025) -
ToRL: Scaling Tool-Integrated RL
by: Li, Xuefeng, et al.
Published: (2025) -
Evaluating Mathematical Reasoning Beyond Accuracy
by: Xia, Shijie, et al.
Published: (2024) -
On Predicting the Post-training Potential of Pre-trained LLMs
by: Li, Xiaoyuan, et al.
Published: (2026)