The Impact of Quantization on Large Reasoning Model Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Kumar, Medha, Xu, Zifei, Wang, Xin, Webb, Tristan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Scaling Laws for Post Training Quantized Large Language Models
von: Xu, Zifei, et al.
Veröffentlicht: (2024)
von: Xu, Zifei, et al.
Veröffentlicht: (2024)
Understanding the Difficulty of Low-Precision Post-Training Quantization for LLMs
von: Xu, Zifei, et al.
Veröffentlicht: (2024)
von: Xu, Zifei, et al.
Veröffentlicht: (2024)
Post Training Quantization of Large Language Models with Microscaling Formats
von: Sharify, Sayeh, et al.
Veröffentlicht: (2024)
von: Sharify, Sayeh, et al.
Veröffentlicht: (2024)
Early Attentive Sparsification Accelerates Neural Speech Transcription
von: Xu, Zifei, et al.
Veröffentlicht: (2025)
von: Xu, Zifei, et al.
Veröffentlicht: (2025)
MF-QAT: Multi-Format Quantization-Aware Training for Elastic Inference
von: Xu, Zifei, et al.
Veröffentlicht: (2026)
von: Xu, Zifei, et al.
Veröffentlicht: (2026)
The Impact of Quantization and Pruning on Deep Reinforcement Learning Models
von: Lu, Heng, et al.
Veröffentlicht: (2024)
von: Lu, Heng, et al.
Veröffentlicht: (2024)
Teaching Large Language Models to Reason with Reinforcement Learning
von: Havrilla, Alex, et al.
Veröffentlicht: (2024)
von: Havrilla, Alex, et al.
Veröffentlicht: (2024)
QuRL: Efficient Reinforcement Learning with Quantized Rollout
von: Li, Yuhang, et al.
Veröffentlicht: (2026)
von: Li, Yuhang, et al.
Veröffentlicht: (2026)
Mechanistic Interpretability of Reinforcement Learning Agents
von: Trim, Tristan, et al.
Veröffentlicht: (2024)
von: Trim, Tristan, et al.
Veröffentlicht: (2024)
From Narratives to Probabilistic Reasoning: Predicting and Interpreting Drivers' Hazardous Actions in Crashes Using Large Language Model
von: Chen, Boyou, et al.
Veröffentlicht: (2025)
von: Chen, Boyou, et al.
Veröffentlicht: (2025)
Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
von: Wan, Qian, et al.
Veröffentlicht: (2026)
von: Wan, Qian, et al.
Veröffentlicht: (2026)
A Survey of Reinforcement Learning for Large Reasoning Models
von: Zhang, Kaiyan, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiyan, et al.
Veröffentlicht: (2025)
SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM
von: Zhang, Xiaojiang, et al.
Veröffentlicht: (2025)
von: Zhang, Xiaojiang, et al.
Veröffentlicht: (2025)
QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals
von: Zhang, Nan, et al.
Veröffentlicht: (2026)
von: Zhang, Nan, et al.
Veröffentlicht: (2026)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
von: Wang, Yiping, et al.
Veröffentlicht: (2025)
von: Wang, Yiping, et al.
Veröffentlicht: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
Reasoning Under 1 Billion: Memory-Augmented Reinforcement Learning for Large Language Models
von: Le, Hung, et al.
Veröffentlicht: (2025)
von: Le, Hung, et al.
Veröffentlicht: (2025)
Integrating Large Language Models and Reinforcement Learning for Non-Linear Reasoning
von: Alon, Yoav, et al.
Veröffentlicht: (2024)
von: Alon, Yoav, et al.
Veröffentlicht: (2024)
On Predictability of Reinforcement Learning Dynamics for Large Language Models
von: Cai, Yuchen, et al.
Veröffentlicht: (2025)
von: Cai, Yuchen, et al.
Veröffentlicht: (2025)
An ADHD Diagnostic Interface Based on EEG Spectrograms and Deep Learning Techniques
von: Pappula, Medha, et al.
Veröffentlicht: (2024)
von: Pappula, Medha, et al.
Veröffentlicht: (2024)
AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models
von: Yeh, Cheng-Kai, et al.
Veröffentlicht: (2025)
von: Yeh, Cheng-Kai, et al.
Veröffentlicht: (2025)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
von: Bao, Yicheng, et al.
Veröffentlicht: (2026)
von: Bao, Yicheng, et al.
Veröffentlicht: (2026)
ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals
von: Saxena, Utkarsh, et al.
Veröffentlicht: (2024)
von: Saxena, Utkarsh, et al.
Veröffentlicht: (2024)
CBQ: Cross-Block Quantization for Large Language Models
von: Ding, Xin, et al.
Veröffentlicht: (2023)
von: Ding, Xin, et al.
Veröffentlicht: (2023)
LAQuant: A Simple Overhead-free Large Reasoning Model Quantization by Layer-wise Lookahead Loss
von: Choi, Euntae, et al.
Veröffentlicht: (2026)
von: Choi, Euntae, et al.
Veröffentlicht: (2026)
CRoPE: Efficient Parametrization of Rotary Positional Embedding
von: Lou, Beicheng, et al.
Veröffentlicht: (2026)
von: Lou, Beicheng, et al.
Veröffentlicht: (2026)
Quantizing Small-Scale State-Space Models for Edge AI
von: Zhao, Leo, et al.
Veröffentlicht: (2025)
von: Zhao, Leo, et al.
Veröffentlicht: (2025)
STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training
von: Liu, Minglu, et al.
Veröffentlicht: (2026)
von: Liu, Minglu, et al.
Veröffentlicht: (2026)
Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning
von: Wang, Hu, et al.
Veröffentlicht: (2025)
von: Wang, Hu, et al.
Veröffentlicht: (2025)
Sinkhorn Treatment Effects: A Causal Optimal Transport Measure
von: Agarwal, Medha, et al.
Veröffentlicht: (2026)
von: Agarwal, Medha, et al.
Veröffentlicht: (2026)
Efficient Reinforcement Learning with Large Language Model Priors
von: Yan, Xue, et al.
Veröffentlicht: (2024)
von: Yan, Xue, et al.
Veröffentlicht: (2024)
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
von: Chen, Kaiwen, et al.
Veröffentlicht: (2025)
von: Chen, Kaiwen, et al.
Veröffentlicht: (2025)
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
von: Zhao, Siyan, et al.
Veröffentlicht: (2025)
von: Zhao, Siyan, et al.
Veröffentlicht: (2025)
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
von: Fu, Wei, et al.
Veröffentlicht: (2025)
von: Fu, Wei, et al.
Veröffentlicht: (2025)
Layer-Wise High-Impact Parameter Ratio Optimization in Post-Training Quantization for Large Language Models
von: Pham, Cuong, et al.
Veröffentlicht: (2025)
von: Pham, Cuong, et al.
Veröffentlicht: (2025)
QQQ: Quality Quattuor-Bit Quantization for Large Language Models
von: Zhang, Ying, et al.
Veröffentlicht: (2024)
von: Zhang, Ying, et al.
Veröffentlicht: (2024)
Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
von: Lotfi, Sanae, et al.
Veröffentlicht: (2026)
von: Lotfi, Sanae, et al.
Veröffentlicht: (2026)
A Carbon Tracking Model for Federated Learning: Impact of Quantization and Sparsification
von: Barbieri, Luca, et al.
Veröffentlicht: (2023)
von: Barbieri, Luca, et al.
Veröffentlicht: (2023)
Statistically-Lossless Quantization of Large Language Models
von: Helcig, Michael, et al.
Veröffentlicht: (2026)
von: Helcig, Michael, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Scaling Laws for Post Training Quantized Large Language Models
von: Xu, Zifei, et al.
Veröffentlicht: (2024) -
Understanding the Difficulty of Low-Precision Post-Training Quantization for LLMs
von: Xu, Zifei, et al.
Veröffentlicht: (2024) -
Post Training Quantization of Large Language Models with Microscaling Formats
von: Sharify, Sayeh, et al.
Veröffentlicht: (2024) -
Early Attentive Sparsification Accelerates Neural Speech Transcription
von: Xu, Zifei, et al.
Veröffentlicht: (2025) -
MF-QAT: Multi-Format Quantization-Aware Training for Elastic Inference
von: Xu, Zifei, et al.
Veröffentlicht: (2026)