Progress or Regress? Self-Improvement Reversal in Post-training
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Ting, Li, Xuefeng, Liu, Pengfei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DIVE: Diversified Iterative Self-Improvement
di: Qin, Yiwei, et al.
Pubblicazione: (2025)
di: Qin, Yiwei, et al.
Pubblicazione: (2025)
OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
di: Wang, Zengzhi, et al.
Pubblicazione: (2025)
di: Wang, Zengzhi, et al.
Pubblicazione: (2025)
ToRL: Scaling Tool-Integrated RL
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
Evaluating Mathematical Reasoning Beyond Accuracy
di: Xia, Shijie, et al.
Pubblicazione: (2024)
di: Xia, Shijie, et al.
Pubblicazione: (2024)
On Predicting the Post-training Potential of Pre-trained LLMs
di: Li, Xiaoyuan, et al.
Pubblicazione: (2026)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2026)
LIMR: Less is More for RL Scaling
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
O1 Replication Journey: A Strategic Progress Report -- Part 1
di: Qin, Yiwei, et al.
Pubblicazione: (2024)
di: Qin, Yiwei, et al.
Pubblicazione: (2024)
A Training-Free Regeneration Paradigm: Contrastive Reflection Memory Guided Self-Verification and Self-Improvement
di: Li, Yuran, et al.
Pubblicazione: (2026)
di: Li, Yuran, et al.
Pubblicazione: (2026)
The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement
di: Wang, Xiaobo, et al.
Pubblicazione: (2026)
di: Wang, Xiaobo, et al.
Pubblicazione: (2026)
Enabling Language Models to Implicitly Learn Self-Improvement
di: Wang, Ziqi, et al.
Pubblicazione: (2023)
di: Wang, Ziqi, et al.
Pubblicazione: (2023)
AIR: Post-training Data Selection for Reasoning via Attention Head Influence
di: Liu, Jinrui, et al.
Pubblicazione: (2025)
di: Liu, Jinrui, et al.
Pubblicazione: (2025)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
di: Wang, Zengzhi, et al.
Pubblicazione: (2023)
di: Wang, Zengzhi, et al.
Pubblicazione: (2023)
Dynamic Noise Preference Optimization: Self-Improvement of Large Language Models with Self-Synthetic Data
di: Yang, Haoyan, et al.
Pubblicazione: (2025)
di: Yang, Haoyan, et al.
Pubblicazione: (2025)
O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?
di: Huang, Zhen, et al.
Pubblicazione: (2024)
di: Huang, Zhen, et al.
Pubblicazione: (2024)
Self-training Strategies for Sentiment Analysis: An Empirical Study
di: Liu, Haochen, et al.
Pubblicazione: (2023)
di: Liu, Haochen, et al.
Pubblicazione: (2023)
Post-training an LLM for RAG? Train on Self-Generated Demonstrations
di: Finlayson, Matthew, et al.
Pubblicazione: (2025)
di: Finlayson, Matthew, et al.
Pubblicazione: (2025)
Reverse Preference Optimization for Complex Instruction Following
di: Huang, Xiang, et al.
Pubblicazione: (2025)
di: Huang, Xiang, et al.
Pubblicazione: (2025)
Progressively Modality Freezing for Multi-Modal Entity Alignment
di: Huang, Yani, et al.
Pubblicazione: (2024)
di: Huang, Yani, et al.
Pubblicazione: (2024)
Measuring and Mitigating Post-hoc Rationalization in Reverse Chain-of-Thought Generation
di: Peng, Guangyue, et al.
Pubblicazione: (2026)
di: Peng, Guangyue, et al.
Pubblicazione: (2026)
Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text
di: Huang, Chengyu, et al.
Pubblicazione: (2026)
di: Huang, Chengyu, et al.
Pubblicazione: (2026)
Better, Faster: Harnessing Self-Improvement in Large Reasoning Models
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
Self-Trained Verification for Training- and Test-Time Self-Improvement
di: Wu, Chen Henry, et al.
Pubblicazione: (2026)
di: Wu, Chen Henry, et al.
Pubblicazione: (2026)
Self-Improvement Programming for Temporal Knowledge Graph Question Answering
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
ReGenesis: LLMs can Grow into Reasoning Generalists via Self-Improvement
di: Peng, Xiangyu, et al.
Pubblicazione: (2024)
di: Peng, Xiangyu, et al.
Pubblicazione: (2024)
A Comparative Study of Pre-training and Self-training
di: Wang, Yiheng, et al.
Pubblicazione: (2024)
di: Wang, Yiheng, et al.
Pubblicazione: (2024)
On the Impact of Calibration Data in Post-training Quantization and Pruning
di: Williams, Miles, et al.
Pubblicazione: (2023)
di: Williams, Miles, et al.
Pubblicazione: (2023)
Test-time Recursive Thinking: Self-Improvement without External Feedback
di: Zhuang, Yufan, et al.
Pubblicazione: (2026)
di: Zhuang, Yufan, et al.
Pubblicazione: (2026)
A Survey on LLM Inference-Time Self-Improvement
di: Dong, Xiangjue, et al.
Pubblicazione: (2024)
di: Dong, Xiangjue, et al.
Pubblicazione: (2024)
On Data Synthesis and Post-training for Visual Abstract Reasoning
di: Zhu, Ke, et al.
Pubblicazione: (2025)
di: Zhu, Ke, et al.
Pubblicazione: (2025)
Presenting a Paper is an Art: Self-Improvement Aesthetic Agents for Academic Presentations
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
Transferable Post-training via Inverse Value Learning
di: Lu, Xinyu, et al.
Pubblicazione: (2024)
di: Lu, Xinyu, et al.
Pubblicazione: (2024)
RegMix: Data Mixture as Regression for Language Model Pre-training
di: Liu, Qian, et al.
Pubblicazione: (2024)
di: Liu, Qian, et al.
Pubblicazione: (2024)
Self-Improvement in Multimodal Large Language Models: A Survey
di: Deng, Shijian, et al.
Pubblicazione: (2025)
di: Deng, Shijian, et al.
Pubblicazione: (2025)
CLEAR: Cross-Lingual Enhancement in Alignment via Reverse-training
di: Lee, Seungyoon, et al.
Pubblicazione: (2026)
di: Lee, Seungyoon, et al.
Pubblicazione: (2026)
Beyond Fixed Length: Bucket Pre-training is All You Need
di: Yang, Qing, et al.
Pubblicazione: (2024)
di: Yang, Qing, et al.
Pubblicazione: (2024)
Self-training from Self-memory in Data-to-text Generation
di: Ta, Hoang-Thang
Pubblicazione: (2024)
di: Ta, Hoang-Thang
Pubblicazione: (2024)
Programming Every Example: Lifting Pre-training Data Quality Like Experts at Scale
di: Zhou, Fan, et al.
Pubblicazione: (2024)
di: Zhou, Fan, et al.
Pubblicazione: (2024)
Harnessing the Power of Large Language Models for Empathetic Response Generation: Empirical Investigations and Improvements
di: Qian, Yushan, et al.
Pubblicazione: (2023)
di: Qian, Yushan, et al.
Pubblicazione: (2023)
A Survey on Post-training of Large Language Models
di: Tie, Guiyao, et al.
Pubblicazione: (2025)
di: Tie, Guiyao, et al.
Pubblicazione: (2025)
One Sample to Rule Them All: Extreme Data Efficiency in Multidiscipline Reasoning with Reinforcement Learning
di: Li, Yiyuan, et al.
Pubblicazione: (2026)
di: Li, Yiyuan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DIVE: Diversified Iterative Self-Improvement
di: Qin, Yiwei, et al.
Pubblicazione: (2025) -
OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
di: Wang, Zengzhi, et al.
Pubblicazione: (2025) -
ToRL: Scaling Tool-Integrated RL
di: Li, Xuefeng, et al.
Pubblicazione: (2025) -
Evaluating Mathematical Reasoning Beyond Accuracy
di: Xia, Shijie, et al.
Pubblicazione: (2024) -
On Predicting the Post-training Potential of Pre-trained LLMs
di: Li, Xiaoyuan, et al.
Pubblicazione: (2026)