Diagnosing Training Inference Mismatch in LLM Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhong, Tianle, Ling, Neiwen, Pi, Yifan, Wei, Zijun, Yu, Tianshu, Fox, Geoffrey, Wu, Peng, Yu, Xiao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Comparing LLM and Fine-Tuned Model Performance on NVDRS Circumstance Extraction with Varying Prompt Complexity
by: Martin, Geoffrey, et al.
Published: (2026)
by: Martin, Geoffrey, et al.
Published: (2026)
Defeating the Training-Inference Mismatch via FP16
by: Qi, Penghui, et al.
Published: (2025)
by: Qi, Penghui, et al.
Published: (2025)
TypeFly: Flying Drones with Large Language Model
by: Chen, Guojun, et al.
Published: (2023)
by: Chen, Guojun, et al.
Published: (2023)
Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
by: Ma, Wenhan, et al.
Published: (2025)
by: Ma, Wenhan, et al.
Published: (2025)
From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations
by: Wang, Benlu, et al.
Published: (2025)
by: Wang, Benlu, et al.
Published: (2025)
Differentiable Evolutionary Reinforcement Learning
by: Cheng, Sitao, et al.
Published: (2025)
by: Cheng, Sitao, et al.
Published: (2025)
Budget-Aware Routing for Long Clinical Text
by: Qureshi, Khizar, et al.
Published: (2026)
by: Qureshi, Khizar, et al.
Published: (2026)
Beyond the limitation of a single query: Train your LLM for query expansion with Reinforcement Learning
by: Zhao, Shu, et al.
Published: (2025)
by: Zhao, Shu, et al.
Published: (2025)
Inference-Time Scaling for Generalist Reward Modeling
by: Liu, Zijun, et al.
Published: (2025)
by: Liu, Zijun, et al.
Published: (2025)
Chimera: Diagnosing Shortcut Learning in Visual-Language Understanding
by: Chi, Ziheng, et al.
Published: (2025)
by: Chi, Ziheng, et al.
Published: (2025)
ExperienceWeaver: Optimizing Small-sample Experience Learning for LLM-based Clinical Text Improvement
by: Xiao, Ziyan, et al.
Published: (2026)
by: Xiao, Ziyan, et al.
Published: (2026)
FLRC: Fine-grained Low-Rank Compressor for Efficient LLM Inference
by: Lu, Yu-Chen, et al.
Published: (2025)
by: Lu, Yu-Chen, et al.
Published: (2025)
MedExAgent: Training LLM Agents to Ask, Examine, and Diagnose in Noisy Clinical Environments
by: Gao, Yicheng, et al.
Published: (2026)
by: Gao, Yicheng, et al.
Published: (2026)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
by: Xu, Ran, et al.
Published: (2025)
by: Xu, Ran, et al.
Published: (2025)
Meta-RTL: Reinforcement-Based Meta-Transfer Learning for Low-Resource Commonsense Reasoning
by: Fu, Yu, et al.
Published: (2024)
by: Fu, Yu, et al.
Published: (2024)
Towards Robust Multimodal Sentiment Analysis with Incomplete Data
by: Zhang, Haoyu, et al.
Published: (2024)
by: Zhang, Haoyu, et al.
Published: (2024)
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
by: Panaganti, Kishan, et al.
Published: (2026)
by: Panaganti, Kishan, et al.
Published: (2026)
Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework
by: Zhao, Yunpu, et al.
Published: (2024)
by: Zhao, Yunpu, et al.
Published: (2024)
DiLA: Enhancing LLM Tool Learning with Differential Logic Layer
by: Zhang, Yu, et al.
Published: (2024)
by: Zhang, Yu, et al.
Published: (2024)
Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling
by: Li, Jiachun, et al.
Published: (2025)
by: Li, Jiachun, et al.
Published: (2025)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
by: Deng, Wenhao, et al.
Published: (2025)
by: Deng, Wenhao, et al.
Published: (2025)
Transparent Screening for LLM Inference and Training Impacts
by: Pachot, Arnault, et al.
Published: (2026)
by: Pachot, Arnault, et al.
Published: (2026)
Overcoming Vocabulary Mismatch: Vocabulary-agnostic Teacher Guided Language Modeling
by: Shin, Haebin, et al.
Published: (2025)
by: Shin, Haebin, et al.
Published: (2025)
Diagnosing Medical Datasets with Training Dynamics
by: Wenderoth, Laura
Published: (2024)
by: Wenderoth, Laura
Published: (2024)
Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
by: Parashar, Shubham, et al.
Published: (2025)
by: Parashar, Shubham, et al.
Published: (2025)
Reinforcement Learning with Token-level Feedback for Controllable Text Generation
by: Li, Wendi, et al.
Published: (2024)
by: Li, Wendi, et al.
Published: (2024)
HOMURA: Taming the Sand-Glass for Time-Constrained LLM Translation via Reinforcement Learning
by: Cui, Ziang, et al.
Published: (2026)
by: Cui, Ziang, et al.
Published: (2026)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
by: Xi, Zhiheng, et al.
Published: (2025)
by: Xi, Zhiheng, et al.
Published: (2025)
Universal Legal Article Prediction via Tight Collaboration between Supervised Classification Model and LLM
by: Chi, Xiao, et al.
Published: (2025)
by: Chi, Xiao, et al.
Published: (2025)
Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning
by: Zhang, Hang, et al.
Published: (2026)
by: Zhang, Hang, et al.
Published: (2026)
Benchmarking LLM Tool-Use in the Wild
by: Yu, Peijie, et al.
Published: (2026)
by: Yu, Peijie, et al.
Published: (2026)
Shapley Value-based Contrastive Alignment for Multimodal Information Extraction
by: Luo, Wen, et al.
Published: (2024)
by: Luo, Wen, et al.
Published: (2024)
Reinforcement Learning from Compiler and Language Server Feedback
by: Zhang, Yifan, et al.
Published: (2025)
by: Zhang, Yifan, et al.
Published: (2025)
EvoP: Robust LLM Inference via Evolutionary Pruning
by: Wu, Shangyu, et al.
Published: (2025)
by: Wu, Shangyu, et al.
Published: (2025)
Weak-to-Strong Elicitation via Mismatched Wrong Drafts
by: Deng, Wei
Published: (2026)
by: Deng, Wei
Published: (2026)
Zero-Shot Continuous Prompt Transfer: Generalizing Task Semantics Across Language Models
by: Wu, Zijun, et al.
Published: (2023)
by: Wu, Zijun, et al.
Published: (2023)
From Deferral to Learning: Online In-Context Knowledge Distillation for LLM Cascades
by: Wu, Yu, et al.
Published: (2025)
by: Wu, Yu, et al.
Published: (2025)
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
by: Sun, Yiliu, et al.
Published: (2025)
by: Sun, Yiliu, et al.
Published: (2025)
Explainable LLM-driven Multi-dimensional Distillation for E-Commerce Relevance Learning
by: Zhao, Gang, et al.
Published: (2024)
by: Zhao, Gang, et al.
Published: (2024)
Training-Free Activation Sparsity in Large Language Models
by: Liu, James, et al.
Published: (2024)
by: Liu, James, et al.
Published: (2024)
Similar Items
-
Comparing LLM and Fine-Tuned Model Performance on NVDRS Circumstance Extraction with Varying Prompt Complexity
by: Martin, Geoffrey, et al.
Published: (2026) -
Defeating the Training-Inference Mismatch via FP16
by: Qi, Penghui, et al.
Published: (2025) -
TypeFly: Flying Drones with Large Language Model
by: Chen, Guojun, et al.
Published: (2023) -
Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
by: Ma, Wenhan, et al.
Published: (2025) -
From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations
by: Wang, Benlu, et al.
Published: (2025)