Reinforcement Mid-Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Tian, Yijun, Chen, Shaoyu, Xu, Zhichao, Wang, Yawei, Bi, Jinhe, Han, Peng, Wang, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RECON: Reasoning with Condensation for Efficient Retrieval-Augmented Generation
por: Xu, Zhichao, et al.
Publicado: (2025)
por: Xu, Zhichao, et al.
Publicado: (2025)
Reinforcement Learning for LLM Post-Training: A Survey
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
ASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLM
por: Wang, Yujun, et al.
Publicado: (2025)
por: Wang, Yujun, et al.
Publicado: (2025)
Reciprocal Co-Training (RCT): Coupling Gradient-Based and Non-Differentiable Models via Reinforcement Learning
por: Tian, Yunshuo, et al.
Publicado: (2026)
por: Tian, Yunshuo, et al.
Publicado: (2026)
A Survey on LLM Mid-Training
por: Tu, Chengying, et al.
Publicado: (2025)
por: Tu, Chengying, et al.
Publicado: (2025)
HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench
por: Wang, Yueyang, et al.
Publicado: (2026)
por: Wang, Yueyang, et al.
Publicado: (2026)
LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum
por: Xu, Zhichao, et al.
Publicado: (2026)
por: Xu, Zhichao, et al.
Publicado: (2026)
Optimus: Accelerating Large-Scale Multi-Modal LLM Training by Bubble Exploitation
por: Feng, Weiqi, et al.
Publicado: (2024)
por: Feng, Weiqi, et al.
Publicado: (2024)
CSPLADE: Learned Sparse Retrieval with Causal Language Models
por: Xu, Zhichao, et al.
Publicado: (2025)
por: Xu, Zhichao, et al.
Publicado: (2025)
LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering
por: Bi, Jinhe, et al.
Publicado: (2024)
por: Bi, Jinhe, et al.
Publicado: (2024)
Large-Scale Diverse Synthesis for Mid-Training
por: Zhang, Xuemiao, et al.
Publicado: (2025)
por: Zhang, Xuemiao, et al.
Publicado: (2025)
RLSR: Reinforcement Learning with Supervised Reward Outperforms SFT in Instruction Following
por: Wang, Zhichao, et al.
Publicado: (2025)
por: Wang, Zhichao, et al.
Publicado: (2025)
Beyond Answers: Transferring Reasoning Capabilities to Smaller LLMs Using Multi-Teacher Knowledge Distillation
por: Tian, Yijun, et al.
Publicado: (2024)
por: Tian, Yijun, et al.
Publicado: (2024)
PAFT: A Parallel Training Paradigm for Effective LLM Fine-Tuning
por: Pentyala, Shiva Kumar, et al.
Publicado: (2024)
por: Pentyala, Shiva Kumar, et al.
Publicado: (2024)
Rethinking On-policy Optimization for Query Augmentation
por: Xu, Zhichao, et al.
Publicado: (2025)
por: Xu, Zhichao, et al.
Publicado: (2025)
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
por: Zhang, Charlie, et al.
Publicado: (2025)
por: Zhang, Charlie, et al.
Publicado: (2025)
Improving Automatic Summarization of Radiology Reports through Mid-Training of Large Language Models
por: Lyu, Mengxian, et al.
Publicado: (2026)
por: Lyu, Mengxian, et al.
Publicado: (2026)
Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers
por: Yang, Wang, et al.
Publicado: (2026)
por: Yang, Wang, et al.
Publicado: (2026)
GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA
por: Wang, Zhichao
Publicado: (2025)
por: Wang, Zhichao
Publicado: (2025)
Thoth: Mid-Training Bridges LLMs to Time Series Understanding
por: Lin, Jiafeng, et al.
Publicado: (2026)
por: Lin, Jiafeng, et al.
Publicado: (2026)
1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training
por: Zhao, Han, et al.
Publicado: (2025)
por: Zhao, Han, et al.
Publicado: (2025)
DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training
por: Tian, Xiaoyu, et al.
Publicado: (2025)
por: Tian, Xiaoyu, et al.
Publicado: (2025)
Mid-Training of Large Language Models: A Survey
por: Mo, Kaixiang, et al.
Publicado: (2025)
por: Mo, Kaixiang, et al.
Publicado: (2025)
Reinforcement Pre-Training
por: Dong, Qingxiu, et al.
Publicado: (2025)
por: Dong, Qingxiu, et al.
Publicado: (2025)
How Difficulty-Aware Staged Reinforcement Learning Enhances LLMs' Reasoning Capabilities: A Preliminary Experimental Study
por: Ji, Yunjie, et al.
Publicado: (2025)
por: Ji, Yunjie, et al.
Publicado: (2025)
Learning to Reason as Action Abstractions with Scalable Mid-Training RL
por: Zhang, Shenao, et al.
Publicado: (2025)
por: Zhang, Shenao, et al.
Publicado: (2025)
SentiMM: A Multimodal Multi-Agent Framework for Sentiment Analysis in Social Media
por: Xu, Xilai, et al.
Publicado: (2025)
por: Xu, Xilai, et al.
Publicado: (2025)
Re-ReST: Reflection-Reinforced Self-Training for Language Agents
por: Dou, Zi-Yi, et al.
Publicado: (2024)
por: Dou, Zi-Yi, et al.
Publicado: (2024)
Mixture-of-Instructions: Aligning Large Language Models via Mixture Prompting
por: Xu, Bowen, et al.
Publicado: (2024)
por: Xu, Bowen, et al.
Publicado: (2024)
From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training
por: Liu, Tianqiao, et al.
Publicado: (2025)
por: Liu, Tianqiao, et al.
Publicado: (2025)
OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
por: Wang, Zengzhi, et al.
Publicado: (2025)
por: Wang, Zengzhi, et al.
Publicado: (2025)
Context-aware Decoding Reduces Hallucination in Query-focused Summarization
por: Xu, Zhichao
Publicado: (2023)
por: Xu, Zhichao
Publicado: (2023)
RankMamba: Benchmarking Mamba's Document Ranking Performance in the Era of Transformers
por: Xu, Zhichao
Publicado: (2024)
por: Xu, Zhichao
Publicado: (2024)
Distillation versus Contrastive Learning: How to Train Your Rerankers
por: Xu, Zhichao, et al.
Publicado: (2025)
por: Xu, Zhichao, et al.
Publicado: (2025)
JMLR: Joint Medical LLM and Retrieval Training for Enhancing Reasoning and Professional Question Answering Capability
por: Wang, Junda, et al.
Publicado: (2024)
por: Wang, Junda, et al.
Publicado: (2024)
AlignSAE: Concept-Aligned Sparse Autoencoders
por: Yang, Minglai, et al.
Publicado: (2025)
por: Yang, Minglai, et al.
Publicado: (2025)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
por: Wang, Peng-Yuan, et al.
Publicado: (2026)
por: Wang, Peng-Yuan, et al.
Publicado: (2026)
DANCER: Entity Description Augmented Named Entity Corrector for Automatic Speech Recognition
por: Wang, Yi-Cheng, et al.
Publicado: (2024)
por: Wang, Yi-Cheng, et al.
Publicado: (2024)
Diversity Enhances an LLM's Performance in RAG and Long-context Task
por: Wang, Zhichao, et al.
Publicado: (2025)
por: Wang, Zhichao, et al.
Publicado: (2025)
PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection
por: Bi, Jinhe, et al.
Publicado: (2025)
por: Bi, Jinhe, et al.
Publicado: (2025)
Ejemplares similares
-
RECON: Reasoning with Condensation for Efficient Retrieval-Augmented Generation
por: Xu, Zhichao, et al.
Publicado: (2025) -
Reinforcement Learning for LLM Post-Training: A Survey
por: Wang, Zhichao, et al.
Publicado: (2024) -
ASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLM
por: Wang, Yujun, et al.
Publicado: (2025) -
Reciprocal Co-Training (RCT): Coupling Gradient-Based and Non-Differentiable Models via Reinforcement Learning
por: Tian, Yunshuo, et al.
Publicado: (2026) -
A Survey on LLM Mid-Training
por: Tu, Chengying, et al.
Publicado: (2025)