VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Guochao, Feng, Wenfeng, Quan, Guofeng, Hao, Chuzhan, Zhang, Yuewei, Liu, Guohua, Wang, Hao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
por: Jiang, Guochao, et al.
Publicado: (2026)
por: Jiang, Guochao, et al.
Publicado: (2026)
RASD: Retrieval-Augmented Speculative Decoding
por: Quan, Guofeng, et al.
Publicado: (2025)
por: Quan, Guofeng, et al.
Publicado: (2025)
PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning
por: Feng, Wenfeng, et al.
Publicado: (2025)
por: Feng, Wenfeng, et al.
Publicado: (2025)
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning
por: Hao, Chuzhan, et al.
Publicado: (2025)
por: Hao, Chuzhan, et al.
Publicado: (2025)
Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search
por: Hao, Chuzhan, et al.
Publicado: (2026)
por: Hao, Chuzhan, et al.
Publicado: (2026)
Mixture-of-LoRAs: An Efficient Multitask Tuning for Large Language Models
por: Feng, Wenfeng, et al.
Publicado: (2024)
por: Feng, Wenfeng, et al.
Publicado: (2024)
AirRAG: Autonomous Strategic Planning and Reasoning Steer Retrieval Augmented Generation
por: Feng, Wenfeng, et al.
Publicado: (2025)
por: Feng, Wenfeng, et al.
Publicado: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2024)
por: Xi, Zhiheng, et al.
Publicado: (2024)
DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-training
por: Wang, Zhenting, et al.
Publicado: (2025)
por: Wang, Zhenting, et al.
Publicado: (2025)
FlowKV: A Disaggregated Inference Framework with Low-Latency KV Cache Transfer and Load-Aware Scheduling
por: Li, Weiqing, et al.
Publicado: (2025)
por: Li, Weiqing, et al.
Publicado: (2025)
FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization
por: Xiao, Haiyang, et al.
Publicado: (2026)
por: Xiao, Haiyang, et al.
Publicado: (2026)
Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
por: Wang, Yiping, et al.
Publicado: (2025)
por: Wang, Yiping, et al.
Publicado: (2025)
TAROT: Test-driven and Capability-adaptive Curriculum Reinforcement Fine-tuning for Code Generation with Large Language Models
por: Park, Chansung, et al.
Publicado: (2026)
por: Park, Chansung, et al.
Publicado: (2026)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
por: Huo, Yifu, et al.
Publicado: (2026)
por: Huo, Yifu, et al.
Publicado: (2026)
TPP-LLM: Modeling Temporal Point Processes by Efficiently Fine-Tuning Large Language Models
por: Liu, Zefang, et al.
Publicado: (2024)
por: Liu, Zefang, et al.
Publicado: (2024)
Fisher Information-based Efficient Curriculum Federated Learning with Large Language Models
por: Liu, Ji, et al.
Publicado: (2024)
por: Liu, Ji, et al.
Publicado: (2024)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
por: Wang, Peng-Yuan, et al.
Publicado: (2026)
por: Wang, Peng-Yuan, et al.
Publicado: (2026)
Being Strong Progressively! Enhancing Knowledge Distillation of Large Language Models through a Curriculum Learning Framework
por: Liu, Lingyuan, et al.
Publicado: (2025)
por: Liu, Lingyuan, et al.
Publicado: (2025)
Temporal Tokenization Strategies for Event Sequence Modeling with Large Language Models
por: Liu, Zefang, et al.
Publicado: (2025)
por: Liu, Zefang, et al.
Publicado: (2025)
Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
por: Wang, Siwei, et al.
Publicado: (2025)
por: Wang, Siwei, et al.
Publicado: (2025)
Enhancing Logical Reasoning in Large Language Models through Graph-based Synthetic Data
por: Zhou, Jiaming, et al.
Publicado: (2024)
por: Zhou, Jiaming, et al.
Publicado: (2024)
Linear Dynamics in the RLVR Training of Large Language Models
por: Wang, Tianle, et al.
Publicado: (2026)
por: Wang, Tianle, et al.
Publicado: (2026)
ToolSample: Dual Dynamic Sampling Methods with Curriculum Learning for RL-based Tool Learning
por: Feng, Zihao, et al.
Publicado: (2025)
por: Feng, Zihao, et al.
Publicado: (2025)
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
por: Zhang, Fuxiang, et al.
Publicado: (2024)
por: Zhang, Fuxiang, et al.
Publicado: (2024)
Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models
por: Gautam, Tanmay, et al.
Publicado: (2024)
por: Gautam, Tanmay, et al.
Publicado: (2024)
Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
por: Shi, Taiwei, et al.
Publicado: (2025)
por: Shi, Taiwei, et al.
Publicado: (2025)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025)
por: Tao, Yongding, et al.
Publicado: (2025)
Multimodal Large Language Models for Medicine: A Comprehensive Survey
por: Ye, Jiarui, et al.
Publicado: (2025)
por: Ye, Jiarui, et al.
Publicado: (2025)
Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model
por: Liang, Jing, et al.
Publicado: (2025)
por: Liang, Jing, et al.
Publicado: (2025)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
por: Cui, Ganqu, et al.
Publicado: (2025)
por: Cui, Ganqu, et al.
Publicado: (2025)
Training Large Reasoning Models Efficiently via Progressive Thought Encoding
por: Zhang, Zeliang, et al.
Publicado: (2026)
por: Zhang, Zeliang, et al.
Publicado: (2026)
Integrating Large Language Models and Reinforcement Learning for Non-Linear Reasoning
por: Alon, Yoav, et al.
Publicado: (2024)
por: Alon, Yoav, et al.
Publicado: (2024)
Continual Learning of Large Language Models: A Comprehensive Survey
por: Shi, Haizhou, et al.
Publicado: (2024)
por: Shi, Haizhou, et al.
Publicado: (2024)
TEACH: Temporal Variance-Driven Curriculum for Reinforcement Learning
por: Chaudhary, Gaurav, et al.
Publicado: (2025)
por: Chaudhary, Gaurav, et al.
Publicado: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
por: Sun, Hao
Publicado: (2024)
por: Sun, Hao
Publicado: (2024)
Training-Free Bayesianization for Low-Rank Adapters of Large Language Models
por: Shi, Haizhou, et al.
Publicado: (2024)
por: Shi, Haizhou, et al.
Publicado: (2024)
Adversarial Reinforcement Learning for Large Language Model Agent Safety
por: Wang, Zizhao, et al.
Publicado: (2025)
por: Wang, Zizhao, et al.
Publicado: (2025)
Curriculum Learning for Small Code Language Models
por: Naïr, Marwa, et al.
Publicado: (2024)
por: Naïr, Marwa, et al.
Publicado: (2024)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
por: Yao, Jiarui, et al.
Publicado: (2025)
por: Yao, Jiarui, et al.
Publicado: (2025)
Ejemplares similares
-
DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
por: Jiang, Guochao, et al.
Publicado: (2026) -
RASD: Retrieval-Augmented Speculative Decoding
por: Quan, Guofeng, et al.
Publicado: (2025) -
PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning
por: Feng, Wenfeng, et al.
Publicado: (2025) -
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning
por: Hao, Chuzhan, et al.
Publicado: (2025) -
Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search
por: Hao, Chuzhan, et al.
Publicado: (2026)