Rethinking Local Learning: A Cheaper and Faster Recipe for LLM Post-Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shi, Hengyu, Han, Tianyang, Wang, Peizhe, Wang, Zhiling, Yang, Xu, Su, Junhao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards
par: Han, Tianyang, et autres
Publié: (2026)
par: Han, Tianyang, et autres
Publié: (2026)
Cheaper, Better, Faster, Stronger: Robust Text-to-SQL without Chain-of-Thought or Fine-Tuning
par: Dönder, Yusuf Denizay, et autres
Publié: (2025)
par: Dönder, Yusuf Denizay, et autres
Publié: (2025)
Prompt Curriculum Learning for Efficient LLM Post-Training
par: Gao, Zhaolin, et autres
Publié: (2025)
par: Gao, Zhaolin, et autres
Publié: (2025)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
par: Xu, Ran, et autres
Publié: (2026)
par: Xu, Ran, et autres
Publié: (2026)
Faster MoE LLM Inference for Extremely Large Models
par: Yang, Haoqi, et autres
Publié: (2025)
par: Yang, Haoqi, et autres
Publié: (2025)
Consolidating Rewarded Perturbations for LLM Post-Training
par: Zhang, Zheyu, et autres
Publié: (2026)
par: Zhang, Zheyu, et autres
Publié: (2026)
Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
par: Ding, Bowen, et autres
Publié: (2025)
par: Ding, Bowen, et autres
Publié: (2025)
Dataset Decomposition: Faster LLM Training with Variable Sequence Length Curriculum
par: Pouransari, Hadi, et autres
Publié: (2024)
par: Pouransari, Hadi, et autres
Publié: (2024)
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
par: Li, Yaxuan, et autres
Publié: (2026)
par: Li, Yaxuan, et autres
Publié: (2026)
Tracking the Feature Dynamics in LLM Training: A Mechanistic Study
par: Xu, Yang, et autres
Publié: (2024)
par: Xu, Yang, et autres
Publié: (2024)
Replacement Learning: Training Neural Networks with Fewer Parameters
par: Zhang, Yuming, et autres
Publié: (2026)
par: Zhang, Yuming, et autres
Publié: (2026)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
par: Liu, Yixin, et autres
Publié: (2026)
par: Liu, Yixin, et autres
Publié: (2026)
Cascade Speculative Drafting for Even Faster LLM Inference
par: Chen, Ziyi, et autres
Publié: (2023)
par: Chen, Ziyi, et autres
Publié: (2023)
Late-to-Early Training: LET LLMs Learn Earlier, So Faster and Better
par: Zhao, Ji, et autres
Publié: (2026)
par: Zhao, Ji, et autres
Publié: (2026)
Rethinking LLM Ensembling from the Perspective of Mixture Models
par: Fu, Jiale, et autres
Publié: (2026)
par: Fu, Jiale, et autres
Publié: (2026)
Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning
par: Walton, Steven
Publié: (2025)
par: Walton, Steven
Publié: (2025)
DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training
par: Zhu, Dingwei, et autres
Publié: (2026)
par: Zhu, Dingwei, et autres
Publié: (2026)
Scaling Laws for Post Training Quantized Large Language Models
par: Xu, Zifei, et autres
Publié: (2024)
par: Xu, Zifei, et autres
Publié: (2024)
Faster LLM Inference via Sequential Monte Carlo
par: Emara, Yahya, et autres
Publié: (2026)
par: Emara, Yahya, et autres
Publié: (2026)
Knowledge Graph-Assisted LLM Post-Training for Enhanced Legal Reasoning
par: Song, Dezhao, et autres
Publié: (2026)
par: Song, Dezhao, et autres
Publié: (2026)
LLM Router: Rethinking Routing with Prefill Activations
par: Varshney, Tanay, et autres
Publié: (2026)
par: Varshney, Tanay, et autres
Publié: (2026)
Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data?
par: Wang, Shaobo, et autres
Publié: (2025)
par: Wang, Shaobo, et autres
Publié: (2025)
Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization
par: Du, He, et autres
Publié: (2026)
par: Du, He, et autres
Publié: (2026)
CLUE: Conflict-guided Localization for LLM Unlearning Framework
par: Chen, Hang, et autres
Publié: (2025)
par: Chen, Hang, et autres
Publié: (2025)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
par: Pan, Chengjun, et autres
Publié: (2026)
par: Pan, Chengjun, et autres
Publié: (2026)
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
par: Zhou, Jin Peng, et autres
Publié: (2025)
par: Zhou, Jin Peng, et autres
Publié: (2025)
DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-training
par: Wang, Zhenting, et autres
Publié: (2025)
par: Wang, Zhenting, et autres
Publié: (2025)
Efficient Post-Training Pruning of Large Language Models with Statistical Correction
par: Yu, Peiqi, et autres
Publié: (2026)
par: Yu, Peiqi, et autres
Publié: (2026)
Value Drifts: Tracing Value Alignment During LLM Post-Training
par: Bhatia, Mehar, et autres
Publié: (2025)
par: Bhatia, Mehar, et autres
Publié: (2025)
Muon is Scalable for LLM Training
par: Liu, Jingyuan, et autres
Publié: (2025)
par: Liu, Jingyuan, et autres
Publié: (2025)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
par: Xu, Hongling, et autres
Publié: (2025)
par: Xu, Hongling, et autres
Publié: (2025)
Faster, Cheaper, Better: Multi-Objective Hyperparameter Optimization for LLM and RAG Systems
par: Barker, Matthew, et autres
Publié: (2025)
par: Barker, Matthew, et autres
Publié: (2025)
Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting
par: Liu, Haoxin, et autres
Publié: (2026)
par: Liu, Haoxin, et autres
Publié: (2026)
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
par: Jiang, Haoxiang, et autres
Publié: (2026)
par: Jiang, Haoxiang, et autres
Publié: (2026)
Towards Lifelong Learning of Large Language Models: A Survey
par: Zheng, Junhao, et autres
Publié: (2024)
par: Zheng, Junhao, et autres
Publié: (2024)
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
par: Wu, Xixi, et autres
Publié: (2026)
par: Wu, Xixi, et autres
Publié: (2026)
Can Language Models Learn Typologically Implausible Languages?
par: Xu, Tianyang, et autres
Publié: (2025)
par: Xu, Tianyang, et autres
Publié: (2025)
FlashDecoding++: Faster Large Language Model Inference on GPUs
par: Hong, Ke, et autres
Publié: (2023)
par: Hong, Ke, et autres
Publié: (2023)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
Post-training an LLM for RAG? Train on Self-Generated Demonstrations
par: Finlayson, Matthew, et autres
Publié: (2025)
par: Finlayson, Matthew, et autres
Publié: (2025)
Documents similaires
-
Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards
par: Han, Tianyang, et autres
Publié: (2026) -
Cheaper, Better, Faster, Stronger: Robust Text-to-SQL without Chain-of-Thought or Fine-Tuning
par: Dönder, Yusuf Denizay, et autres
Publié: (2025) -
Prompt Curriculum Learning for Efficient LLM Post-Training
par: Gao, Zhaolin, et autres
Publié: (2025) -
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
par: Xu, Ran, et autres
Publié: (2026) -
Faster MoE LLM Inference for Extremely Large Models
par: Yang, Haoqi, et autres
Publié: (2025)