Towards a Unified View of Large Language Model Post-Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lv, Xingtai, Zuo, Yuxin, Sun, Youbang, Liu, Hongyi, Wei, Yuntian, Chen, Zhekai, Zhu, Xuekai, Zhang, Kaiyan, Wang, Bingning, Ding, Ning, Zhou, Bowen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Post-Trained MoE Can Skip Half Experts via Self-Distillation
par: Lv, Xingtai, et autres
Publié: (2026)
par: Lv, Xingtai, et autres
Publié: (2026)
Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization
par: Hua, Ermo, et autres
Publié: (2024)
par: Hua, Ermo, et autres
Publié: (2024)
Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention
par: Lv, Xingtai, et autres
Publié: (2024)
par: Lv, Xingtai, et autres
Publié: (2024)
Technologies on Effectiveness and Efficiency: A Survey of State Spaces Models
par: Lv, Xingtai, et autres
Publié: (2025)
par: Lv, Xingtai, et autres
Publié: (2025)
Fast and Slow Generating: An Empirical Study on Large and Small Language Models Collaborative Decoding
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
Intuitive Fine-Tuning: Towards Simplifying Alignment into a Single Process
par: Hua, Ermo, et autres
Publié: (2024)
par: Hua, Ermo, et autres
Publié: (2024)
How to Synthesize Text Data without Model Collapse?
par: Zhu, Xuekai, et autres
Publié: (2024)
par: Zhu, Xuekai, et autres
Publié: (2024)
How Far Can Unsupervised RLVR Scale LLM Training?
par: He, Bingxiang, et autres
Publié: (2026)
par: He, Bingxiang, et autres
Publié: (2026)
Automating Exploratory Proteomics Research via Language Models
par: Ding, Ning, et autres
Publié: (2024)
par: Ding, Ning, et autres
Publié: (2024)
Automating Exploratory Multiomics Research via Language Models
par: Qu, Shang, et autres
Publié: (2025)
par: Qu, Shang, et autres
Publié: (2025)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
TTRL: Test-Time Reinforcement Learning
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
DePass: Unified Feature Attributing by Simple Decomposed Forward Pass
par: Hong, Xiangyu, et autres
Publié: (2025)
par: Hong, Xiangyu, et autres
Publié: (2025)
FlowRL: Matching Reward Distributions for LLM Reasoning
par: Zhu, Xuekai, et autres
Publié: (2025)
par: Zhu, Xuekai, et autres
Publié: (2025)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
par: Li, Haozhan, et autres
Publié: (2025)
par: Li, Haozhan, et autres
Publié: (2025)
UltraMedical: Building Specialized Generalists in Biomedicine
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
PaD: Program-aided Distillation Can Teach Small Models Reasoning Better than Chain-of-thought Fine-tuning
par: Zhu, Xuekai, et autres
Publié: (2023)
par: Zhu, Xuekai, et autres
Publié: (2023)
A Unified View of Delta Parameter Editing in Post-Trained Large-Scale Models
par: Tang, Qiaoyu, et autres
Publié: (2024)
par: Tang, Qiaoyu, et autres
Publié: (2024)
SSRL: Self-Search Reinforcement Learning
par: Fan, Yuchen, et autres
Publié: (2025)
par: Fan, Yuchen, et autres
Publié: (2025)
CoGenesis: A Framework Collaborating Large and Small Language Models for Secure Context-Aware Instruction Following
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
Mastering Text, Code and Math Simultaneously via Fusing Highly Specialized Language Models
par: Ding, Ning, et autres
Publié: (2024)
par: Ding, Ning, et autres
Publié: (2024)
\texttt{R$^\textbf{2}$AI}: Towards Resistant and Resilient AI in an Evolving World
par: Sun, Youbang, et autres
Publié: (2025)
par: Sun, Youbang, et autres
Publié: (2025)
Critical Data Size of Language Models from a Grokking Perspective
par: Zhu, Xuekai, et autres
Publié: (2024)
par: Zhu, Xuekai, et autres
Publié: (2024)
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
par: Zhao, Shiwan, et autres
Publié: (2026)
par: Zhao, Shiwan, et autres
Publié: (2026)
Towards Building Specialized Generalist AI with System 1 and System 2 Fusion
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation
par: Pan, Jiadong, et autres
Publié: (2025)
par: Pan, Jiadong, et autres
Publié: (2025)
A Survey of Reinforcement Learning for Large Reasoning Models
par: Zhang, Kaiyan, et autres
Publié: (2025)
par: Zhang, Kaiyan, et autres
Publié: (2025)
Hybrid Alignment Training for Large Language Models
par: Wang, Chenglong, et autres
Publié: (2024)
par: Wang, Chenglong, et autres
Publié: (2024)
MetaGPT: Merging Large Language Models Using Model Exclusive Task Arithmetic
par: Zhou, Yuyan, et autres
Publié: (2024)
par: Zhou, Yuyan, et autres
Publié: (2024)
Group Causal Policy Optimization for Post-Training Large Language Models
par: Gu, Ziyin, et autres
Publié: (2025)
par: Gu, Ziyin, et autres
Publié: (2025)
S-GRPO: Unified Post-Training for Large Vision-Language Models
par: Yan, Yuming, et autres
Publié: (2026)
par: Yan, Yuming, et autres
Publié: (2026)
Generative Multi-Modal Knowledge Retrieval with Large Language Models
par: Long, Xinwei, et autres
Publié: (2024)
par: Long, Xinwei, et autres
Publié: (2024)
Improving LoRA in Privacy-preserving Federated Learning
par: Sun, Youbang, et autres
Publié: (2024)
par: Sun, Youbang, et autres
Publié: (2024)
UniMem: Towards a Unified View of Long-Context Large Language Models
par: Fang, Junjie, et autres
Publié: (2024)
par: Fang, Junjie, et autres
Publié: (2024)
Empowering Private Tutoring by Chaining Large Language Models
par: Chen, Yulin, et autres
Publié: (2023)
par: Chen, Yulin, et autres
Publié: (2023)
Towards a Unified View of Preference Learning for Large Language Models: A Survey
par: Gao, Bofei, et autres
Publié: (2024)
par: Gao, Bofei, et autres
Publié: (2024)
LPT++: Efficient Training on Mixture of Long-tailed Experts
par: Dong, Bowen, et autres
Publié: (2024)
par: Dong, Bowen, et autres
Publié: (2024)
On the Evolution of Federated Post-Training Large Language Models: A Model Accessibility View
par: Guo, Tao, et autres
Publié: (2025)
par: Guo, Tao, et autres
Publié: (2025)
Finite-Time Analysis of Stochastic Nonconvex Nonsmooth Optimization on the Riemannian Manifolds
par: Sahinoglu, Emre, et autres
Publié: (2025)
par: Sahinoglu, Emre, et autres
Publié: (2025)
UniPTS: A Unified Framework for Proficient Post-Training Sparsity
par: Xie, Jingjing, et autres
Publié: (2024)
par: Xie, Jingjing, et autres
Publié: (2024)
Documents similaires
-
Post-Trained MoE Can Skip Half Experts via Self-Distillation
par: Lv, Xingtai, et autres
Publié: (2026) -
Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization
par: Hua, Ermo, et autres
Publié: (2024) -
Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention
par: Lv, Xingtai, et autres
Publié: (2024) -
Technologies on Effectiveness and Efficiency: A Survey of State Spaces Models
par: Lv, Xingtai, et autres
Publié: (2025) -
Fast and Slow Generating: An Empirical Study on Large and Small Language Models Collaborative Decoding
par: Zhang, Kaiyan, et autres
Publié: (2024)