Beyond Precision: Training-Inference Mismatch is an Optimization Problem and Simple LR Scheduling Fixes It
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yaxiang, Li, Yingru, Liu, Jiacai, Xu, Jiawei, Li, Ziniu, Liu, Qian, Li, Haoyuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Note on Hybrid Online Reinforcement and Imitation Learning for LLMs: Formulations and Algorithms
di: Li, Yingru, et al.
Pubblicazione: (2025)
di: Li, Yingru, et al.
Pubblicazione: (2025)
Trust Region Masking for Long-Horizon LLM Reinforcement Learning
di: Li, Yingru, et al.
Pubblicazione: (2025)
di: Li, Yingru, et al.
Pubblicazione: (2025)
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
di: Li, Yingru, et al.
Pubblicazione: (2026)
di: Li, Yingru, et al.
Pubblicazione: (2026)
Dynamic Vocabulary Pruning: Stable LLM-RL by Taming the Tail
di: Li, Yingru, et al.
Pubblicazione: (2025)
di: Li, Yingru, et al.
Pubblicazione: (2025)
Logit Dynamics in Softmax Policy Gradient Methods
di: Li, Yingru
Pubblicazione: (2025)
di: Li, Yingru
Pubblicazione: (2025)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
di: Fu, Yuqian, et al.
Pubblicazione: (2026)
di: Fu, Yuqian, et al.
Pubblicazione: (2026)
Dr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generations
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
di: Gu, Hao, et al.
Pubblicazione: (2026)
di: Gu, Hao, et al.
Pubblicazione: (2026)
Q-Star Meets Scalable Posterior Sampling: Bridging Theory and Practice via HyperAgent
di: Li, Yingru, et al.
Pubblicazione: (2024)
di: Li, Yingru, et al.
Pubblicazione: (2024)
Divergence-Augmented Policy Optimization
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Defeating the Training-Inference Mismatch via FP16
di: Qi, Penghui, et al.
Pubblicazione: (2025)
di: Qi, Penghui, et al.
Pubblicazione: (2025)
Scalable Exploration via Ensemble++
di: Li, Yingru, et al.
Pubblicazione: (2024)
di: Li, Yingru, et al.
Pubblicazione: (2024)
Diagnosing Training Inference Mismatch in LLM Reinforcement Learning
di: Zhong, Tianle, et al.
Pubblicazione: (2026)
di: Zhong, Tianle, et al.
Pubblicazione: (2026)
Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2026)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2026)
Beyond Token-level Supervision: Unlocking the Potential of Decoding-based Regression via Reinforcement Learning
di: Chen, Ming, et al.
Pubblicazione: (2025)
di: Chen, Ming, et al.
Pubblicazione: (2025)
Prior-dependent analysis of posterior sampling reinforcement learning with function approximation
di: Li, Yingru, et al.
Pubblicazione: (2024)
di: Li, Yingru, et al.
Pubblicazione: (2024)
Mitigating Mismatch within Reference-based Preference Optimization
di: Yuan, Suqin, et al.
Pubblicazione: (2026)
di: Yuan, Suqin, et al.
Pubblicazione: (2026)
Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
di: Chen, Peter, et al.
Pubblicazione: (2025)
di: Chen, Peter, et al.
Pubblicazione: (2025)
Beyond What to Select: A Plug-and-play Oscillatory Data-Volume Scheduling for Efficient Model Training
di: Yang, Suorong, et al.
Pubblicazione: (2026)
di: Yang, Suorong, et al.
Pubblicazione: (2026)
Beyond Training: Optimizing Reinforcement Learning Based Job Shop Scheduling Through Adaptive Action Sampling
di: de Puiseau, Constantin Waubert, et al.
Pubblicazione: (2024)
di: de Puiseau, Constantin Waubert, et al.
Pubblicazione: (2024)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
di: Yin, Yishu, et al.
Pubblicazione: (2025)
di: Yin, Yishu, et al.
Pubblicazione: (2025)
Decouple Graph Neural Networks: Train Multiple Simple GNNs Simultaneously Instead of One
di: Zhang, Hongyuan, et al.
Pubblicazione: (2023)
di: Zhang, Hongyuan, et al.
Pubblicazione: (2023)
Dataset Distillation for Offline Reinforcement Learning
di: Light, Jonathan, et al.
Pubblicazione: (2024)
di: Light, Jonathan, et al.
Pubblicazione: (2024)
GradientStabilizer:Fix the Norm, Not the Gradient
di: Huang, Tianjin, et al.
Pubblicazione: (2025)
di: Huang, Tianjin, et al.
Pubblicazione: (2025)
Early Quantization Shrinks Codebook: A Simple Fix for Diversity-Preserving Tokenization
di: Zhao, Wenhao, et al.
Pubblicazione: (2026)
di: Zhao, Wenhao, et al.
Pubblicazione: (2026)
TEON: Tensorized Orthonormalization Beyond Layer-Wise Muon for Large Language Model Pre-Training
di: Zhang, Ruijie, et al.
Pubblicazione: (2026)
di: Zhang, Ruijie, et al.
Pubblicazione: (2026)
Beyond Fixed Variables: Expanding-variate Time Series Forecasting via Flat Scheme and Spatio-temporal Focal Learning
di: Ma, Minbo, et al.
Pubblicazione: (2025)
di: Ma, Minbo, et al.
Pubblicazione: (2025)
Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs
di: Li, Xuancheng, et al.
Pubblicazione: (2026)
di: Li, Xuancheng, et al.
Pubblicazione: (2026)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
di: Li, Ruixiao, et al.
Pubblicazione: (2025)
di: Li, Ruixiao, et al.
Pubblicazione: (2025)
A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning
di: Liu, Licheng, et al.
Pubblicazione: (2025)
di: Liu, Licheng, et al.
Pubblicazione: (2025)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
A Triple-Inertial Accelerated Alternating Optimization Method for Deep Learning Training
di: Yan, Chengcheng, et al.
Pubblicazione: (2025)
di: Yan, Chengcheng, et al.
Pubblicazione: (2025)
Q-Newton: Hybrid Quantum-Classical Scheduling for Accelerating Neural Network Training with Newton's Gradient Descent
di: Li, Pingzhi, et al.
Pubblicazione: (2024)
di: Li, Pingzhi, et al.
Pubblicazione: (2024)
Controllable Edge-Type-Specific Interpretation in Multi-Relational Graph Neural Networks for Drug Response Prediction
di: Li, Xiaodi, et al.
Pubblicazione: (2024)
di: Li, Xiaodi, et al.
Pubblicazione: (2024)
PAHQ: Accelerating Automated Circuit Discovery through Mixed-Precision Inference Optimization
di: Wang, Xinhai, et al.
Pubblicazione: (2025)
di: Wang, Xinhai, et al.
Pubblicazione: (2025)
CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
Anytime Training with Schedule-Free Spectral Optimization
di: Apte, Anuj, et al.
Pubblicazione: (2026)
di: Apte, Anuj, et al.
Pubblicazione: (2026)
Unleashing the Denoising Capability of Diffusion Prior for Solving Inverse Problems
di: Zhang, Jiawei, et al.
Pubblicazione: (2024)
di: Zhang, Jiawei, et al.
Pubblicazione: (2024)
Cross-Domain Policy Adaptation by Capturing Representation Mismatch
di: Lyu, Jiafei, et al.
Pubblicazione: (2024)
di: Lyu, Jiafei, et al.
Pubblicazione: (2024)
ChatScene: Knowledge-Enabled Safety-Critical Scenario Generation for Autonomous Vehicles
di: Zhang, Jiawei, et al.
Pubblicazione: (2024)
di: Zhang, Jiawei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Note on Hybrid Online Reinforcement and Imitation Learning for LLMs: Formulations and Algorithms
di: Li, Yingru, et al.
Pubblicazione: (2025) -
Trust Region Masking for Long-Horizon LLM Reinforcement Learning
di: Li, Yingru, et al.
Pubblicazione: (2025) -
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
di: Li, Yingru, et al.
Pubblicazione: (2026) -
Dynamic Vocabulary Pruning: Stable LLM-RL by Taming the Tail
di: Li, Yingru, et al.
Pubblicazione: (2025) -
Logit Dynamics in Softmax Policy Gradient Methods
di: Li, Yingru
Pubblicazione: (2025)