Linear Dynamics in the RLVR Training of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Tianle, Liu, Jiayu, Wu, Zhongyuan, Jin, Shenghao, Chen, Wei, Xu, Hao, Miao, Ning |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Unlearnability Phenomenon in RLVR for Language Models
par: Chen, Yulin, et autres
Publié: (2026)
par: Chen, Yulin, et autres
Publié: (2026)
How Far Can Unsupervised RLVR Scale LLM Training?
par: He, Bingxiang, et autres
Publié: (2026)
par: He, Bingxiang, et autres
Publié: (2026)
Knowledge Graph Large Language Model (KG-LLM) for Link Prediction
par: Shu, Dong, et autres
Publié: (2024)
par: Shu, Dong, et autres
Publié: (2024)
You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
par: Wei, Zhepei, et autres
Publié: (2026)
par: Wei, Zhepei, et autres
Publié: (2026)
Self-Distilled RLVR
par: Yang, Chenxu, et autres
Publié: (2026)
par: Yang, Chenxu, et autres
Publié: (2026)
First Activations Matter: Training-Free Methods for Dynamic Activation in Large Language Models
par: Ma, Chi, et autres
Publié: (2024)
par: Ma, Chi, et autres
Publié: (2024)
Efficient RLVR Training via Weighted Mutual Information Data Selection
par: Zhou, Xinyu, et autres
Publié: (2026)
par: Zhou, Xinyu, et autres
Publié: (2026)
Large Language Models as Tool Makers
par: Cai, Tianle, et autres
Publié: (2023)
par: Cai, Tianle, et autres
Publié: (2023)
CogGPT: Unleashing the Power of Cognitive Dynamics on Large Language Models
par: Lv, Yaojia, et autres
Publié: (2024)
par: Lv, Yaojia, et autres
Publié: (2024)
Efficient Post-Training Pruning of Large Language Models with Statistical Correction
par: Yu, Peiqi, et autres
Publié: (2026)
par: Yu, Peiqi, et autres
Publié: (2026)
Towards a Unified View of Large Language Model Post-Training
par: Lv, Xingtai, et autres
Publié: (2025)
par: Lv, Xingtai, et autres
Publié: (2025)
Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR
par: Gu, Hengrui, et autres
Publié: (2026)
par: Gu, Hengrui, et autres
Publié: (2026)
Training Large Reasoning Models Efficiently via Progressive Thought Encoding
par: Zhang, Zeliang, et autres
Publié: (2026)
par: Zhang, Zeliang, et autres
Publié: (2026)
DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models
par: Liang, Hao, et autres
Publié: (2026)
par: Liang, Hao, et autres
Publié: (2026)
Sliding Window Attention Training for Efficient Large Language Models
par: Fu, Zichuan, et autres
Publié: (2025)
par: Fu, Zichuan, et autres
Publié: (2025)
Linear Chain Transformation: Expanding Optimization Dynamics for Fine-Tuning Large Language Models
par: Wang, Yulong, et autres
Publié: (2024)
par: Wang, Yulong, et autres
Publié: (2024)
KwaiAgents: Generalized Information-seeking Agent System with Large Language Models
par: Pan, Haojie, et autres
Publié: (2023)
par: Pan, Haojie, et autres
Publié: (2023)
RLPR: Extrapolating RLVR to General Domains without Verifiers
par: Yu, Tianyu, et autres
Publié: (2025)
par: Yu, Tianyu, et autres
Publié: (2025)
Scaling Laws for Post Training Quantized Large Language Models
par: Xu, Zifei, et autres
Publié: (2024)
par: Xu, Zifei, et autres
Publié: (2024)
Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning
par: Huang, Fanding, et autres
Publié: (2025)
par: Huang, Fanding, et autres
Publié: (2025)
Leveraging Large Language Models for Automated Causal Loop Diagram Generation: Enhancing System Dynamics Modeling through Curated Prompting Techniques
par: Liu, Ning-Yuan Georgia, et autres
Publié: (2025)
par: Liu, Ning-Yuan Georgia, et autres
Publié: (2025)
Learning Dynamics in Continual Pre-Training for Large Language Models
par: Wang, Xingjin, et autres
Publié: (2025)
par: Wang, Xingjin, et autres
Publié: (2025)
How Creative Are Large Language Models in Generating Molecules?
par: Tao, Wen, et autres
Publié: (2026)
par: Tao, Wen, et autres
Publié: (2026)
DynaAct: Large Language Model Reasoning with Dynamic Action Spaces
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR
par: Li, Jiaming, et autres
Publié: (2025)
par: Li, Jiaming, et autres
Publié: (2025)
Dynamic Attention-Guided Context Decoding for Mitigating Context Faithfulness Hallucinations in Large Language Models
par: Huang, Yanwen, et autres
Publié: (2025)
par: Huang, Yanwen, et autres
Publié: (2025)
On the Origins of Linear Representations in Large Language Models
par: Jiang, Yibo, et autres
Publié: (2024)
par: Jiang, Yibo, et autres
Publié: (2024)
Tracking the Feature Dynamics in LLM Training: A Mechanistic Study
par: Xu, Yang, et autres
Publié: (2024)
par: Xu, Yang, et autres
Publié: (2024)
Lizard: An Efficient Linearization Framework for Large Language Models
par: Van Nguyen, Chien, et autres
Publié: (2025)
par: Van Nguyen, Chien, et autres
Publié: (2025)
Exploring Scaling Laws for Local SGD in Large Language Model Training
par: He, Qiaozhi, et autres
Publié: (2024)
par: He, Qiaozhi, et autres
Publié: (2024)
Data Mixing for Large Language Models Pretraining: A Survey and Outlook
par: Chen, Zhuo, et autres
Publié: (2026)
par: Chen, Zhuo, et autres
Publié: (2026)
Optimizing RLHF Training for Large Language Models with Stage Fusion
par: Zhong, Yinmin, et autres
Publié: (2024)
par: Zhong, Yinmin, et autres
Publié: (2024)
SVFit: Parameter-Efficient Fine-Tuning of Large Pre-Trained Models Using Singular Values
par: Sun, Chengwei, et autres
Publié: (2024)
par: Sun, Chengwei, et autres
Publié: (2024)
Rewards as Labels: Revisiting RLVR from a Classification Perspective
par: Zhai, Zepeng, et autres
Publié: (2026)
par: Zhai, Zepeng, et autres
Publié: (2026)
DIDS: Domain Impact-aware Data Sampling for Large Language Model Training
par: Shi, Weijie, et autres
Publié: (2025)
par: Shi, Weijie, et autres
Publié: (2025)
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
par: Chen, Zhipeng, et autres
Publié: (2026)
par: Chen, Zhipeng, et autres
Publié: (2026)
Training-Free Bayesianization for Low-Rank Adapters of Large Language Models
par: Shi, Haizhou, et autres
Publié: (2024)
par: Shi, Haizhou, et autres
Publié: (2024)
Optimizing Large Language Model Training Using FP4 Quantization
par: Wang, Ruizhe, et autres
Publié: (2025)
par: Wang, Ruizhe, et autres
Publié: (2025)
RLVR Training of LLMs Does Not Improve Thinking Ability for General QA: Evaluation Method and a Simple Solution
par: Li, Kaiyuan, et autres
Publié: (2026)
par: Li, Kaiyuan, et autres
Publié: (2026)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
par: Li, Haodong, et autres
Publié: (2024)
par: Li, Haodong, et autres
Publié: (2024)
Documents similaires
-
The Unlearnability Phenomenon in RLVR for Language Models
par: Chen, Yulin, et autres
Publié: (2026) -
How Far Can Unsupervised RLVR Scale LLM Training?
par: He, Bingxiang, et autres
Publié: (2026) -
Knowledge Graph Large Language Model (KG-LLM) for Link Prediction
par: Shu, Dong, et autres
Publié: (2024) -
You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
par: Wei, Zhepei, et autres
Publié: (2026) -
Self-Distilled RLVR
par: Yang, Chenxu, et autres
Publié: (2026)