QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Nan, Kwek, Eugene, Zhang, Yusen, Pan, Muyu, Wang, Suhang, Mitra, Prasenjit, Zhang, Rui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models
di: Zhang, Nan, et al.
Pubblicazione: (2025)
di: Zhang, Nan, et al.
Pubblicazione: (2025)
COMPACT: Common-token Optimized Model Pruning Across Channels and Tokens
di: Kwek, Eugene, et al.
Pubblicazione: (2025)
di: Kwek, Eugene, et al.
Pubblicazione: (2025)
FlattenQuant: Breaking Through the Inference Compute-bound for Large Language Models with Per-tensor Quantization
di: Zhang, Yi, et al.
Pubblicazione: (2024)
di: Zhang, Yi, et al.
Pubblicazione: (2024)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
di: Zhang, Tianao, et al.
Pubblicazione: (2025)
di: Zhang, Tianao, et al.
Pubblicazione: (2025)
QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models
di: Zhou, Jiajun, et al.
Pubblicazione: (2025)
di: Zhou, Jiajun, et al.
Pubblicazione: (2025)
Fine-Tuned Large Language Models for Logical Translation: Reducing Hallucinations with Lang2Logic
di: Pan, Muyu, et al.
Pubblicazione: (2025)
di: Pan, Muyu, et al.
Pubblicazione: (2025)
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
SmartQuant: CXL-based AI Model Store in Support of Runtime Configurable Weight Quantization
di: Xie, Rui, et al.
Pubblicazione: (2024)
di: Xie, Rui, et al.
Pubblicazione: (2024)
LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning
di: Pan, Rui, et al.
Pubblicazione: (2024)
di: Pan, Rui, et al.
Pubblicazione: (2024)
Quant.npu: Enabling Efficient Mobile NPU Inference for on-device LLMs via Fully Static Quantization
di: Zhang, Jinghe, et al.
Pubblicazione: (2026)
di: Zhang, Jinghe, et al.
Pubblicazione: (2026)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
CLoQ: Enhancing Fine-Tuning of Quantized LLMs via Calibrated LoRA Initialization
di: Deng, Yanxia, et al.
Pubblicazione: (2025)
di: Deng, Yanxia, et al.
Pubblicazione: (2025)
On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
di: Wang, Shumin, et al.
Pubblicazione: (2026)
di: Wang, Shumin, et al.
Pubblicazione: (2026)
A General Benchmark Framework is Dynamic Graph Neural Network Need
di: Zhang, Yusen
Pubblicazione: (2024)
di: Zhang, Yusen
Pubblicazione: (2024)
OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
di: Hu, Xing, et al.
Pubblicazione: (2025)
di: Hu, Xing, et al.
Pubblicazione: (2025)
LRM: Large Reconstruction Model for Single Image to 3D
di: Hong, Yicong, et al.
Pubblicazione: (2023)
di: Hong, Yicong, et al.
Pubblicazione: (2023)
Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language Models
di: Zhang, Zhengxin, et al.
Pubblicazione: (2024)
di: Zhang, Zhengxin, et al.
Pubblicazione: (2024)
PolarQuant: Quantizing KV Caches with Polar Transformation
di: Han, Insu, et al.
Pubblicazione: (2025)
di: Han, Insu, et al.
Pubblicazione: (2025)
Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning
di: Zhang, Minmin, et al.
Pubblicazione: (2026)
di: Zhang, Minmin, et al.
Pubblicazione: (2026)
RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models
di: Wei, Quan, et al.
Pubblicazione: (2025)
di: Wei, Quan, et al.
Pubblicazione: (2025)
Boosting Large Language Models with Mask Fine-Tuning
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
EasyQuant: An Efficient Data-free Quantization Algorithm for LLMs
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning
di: Cai, Hengrui, et al.
Pubblicazione: (2023)
di: Cai, Hengrui, et al.
Pubblicazione: (2023)
Fine-tuning Large Language Model for Automated Algorithm Design
di: Liu, Fei, et al.
Pubblicazione: (2025)
di: Liu, Fei, et al.
Pubblicazione: (2025)
JudgeLRM: Large Reasoning Models as a Judge
di: Chen, Nuo, et al.
Pubblicazione: (2025)
di: Chen, Nuo, et al.
Pubblicazione: (2025)
AutoMixQ: Self-Adjusting Quantization for High Performance Memory-Efficient Fine-Tuning
di: Zhou, Changhai, et al.
Pubblicazione: (2024)
di: Zhou, Changhai, et al.
Pubblicazione: (2024)
PACZero: PAC-Private Fine-Tuning of Language Models via Sign Quantization
di: Ertan, Murat Bilgehan, et al.
Pubblicazione: (2026)
di: Ertan, Murat Bilgehan, et al.
Pubblicazione: (2026)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
di: Li, Ke, et al.
Pubblicazione: (2026)
di: Li, Ke, et al.
Pubblicazione: (2026)
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
di: Song, Jaewoo, et al.
Pubblicazione: (2025)
di: Song, Jaewoo, et al.
Pubblicazione: (2025)
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
di: Tiwari, Rishabh, et al.
Pubblicazione: (2025)
di: Tiwari, Rishabh, et al.
Pubblicazione: (2025)
Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process
di: FU, Zhizhang, et al.
Pubblicazione: (2025)
di: FU, Zhizhang, et al.
Pubblicazione: (2025)
DiscQuant: A Quantization Method for Neural Networks Inspired by Discrepancy Theory
di: Chee, Jerry, et al.
Pubblicazione: (2025)
di: Chee, Jerry, et al.
Pubblicazione: (2025)
Improving Large Language Models with Concept-Aware Fine-Tuning
di: Chen, Michael K., et al.
Pubblicazione: (2025)
di: Chen, Michael K., et al.
Pubblicazione: (2025)
FedPFT: Federated Proxy Fine-Tuning of Foundation Models
di: Peng, Zhaopeng, et al.
Pubblicazione: (2024)
di: Peng, Zhaopeng, et al.
Pubblicazione: (2024)
One QuantLLM for ALL: Fine-tuning Quantized LLMs Once for Efficient Deployments
di: Yi, Ke, et al.
Pubblicazione: (2024)
di: Yi, Ke, et al.
Pubblicazione: (2024)
Bayesian Natural Gradient Fine-Tuning of CLIP Models via Kalman Filtering
di: Abdi, Hossein, et al.
Pubblicazione: (2025)
di: Abdi, Hossein, et al.
Pubblicazione: (2025)
EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2026)
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2026)
Pioneering 4-Bit FP Quantization for Diffusion Models: Mixup-Sign Quantization and Timestep-Aware Fine-Tuning
di: Zhao, Maosen, et al.
Pubblicazione: (2025)
di: Zhao, Maosen, et al.
Pubblicazione: (2025)
MaZO: Masked Zeroth-Order Optimization for Multi-Task Fine-Tuning of Large Language Models
di: Zhang, Zhen, et al.
Pubblicazione: (2025)
di: Zhang, Zhen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models
di: Zhang, Nan, et al.
Pubblicazione: (2025) -
COMPACT: Common-token Optimized Model Pruning Across Channels and Tokens
di: Kwek, Eugene, et al.
Pubblicazione: (2025) -
FlattenQuant: Breaking Through the Inference Compute-bound for Large Language Models with Per-tensor Quantization
di: Zhang, Yi, et al.
Pubblicazione: (2024) -
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
di: Liu, Wenyuan, et al.
Pubblicazione: (2024) -
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
di: Zhang, Tianao, et al.
Pubblicazione: (2025)