Quantization Meets Reasoning: Exploring LLM Low-Bit Quantization Degradation for Mathematical Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Zhen, Su, Yupeng, Yang, Runming, Xie, Congkai, Wang, Zheng, Xie, Zhongwei, Wong, Ngai, Yang, Hongxia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning
par: Li, Zhen, et autres
Publié: (2025)
par: Li, Zhen, et autres
Publié: (2025)
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
par: Xiao, He, et autres
Publié: (2025)
par: Xiao, He, et autres
Publié: (2025)
InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning
par: Liu, Zeyu, et autres
Publié: (2025)
par: Liu, Zeyu, et autres
Publié: (2025)
Revisiting Model Interpolation for Efficient Reasoning
par: Wu, Taiqiang, et autres
Publié: (2025)
par: Wu, Taiqiang, et autres
Publié: (2025)
InfiR2: A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models
par: Wang, Wenjun, et autres
Publié: (2025)
par: Wang, Wenjun, et autres
Publié: (2025)
APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models
par: Guan, Ziyi, et autres
Publié: (2024)
par: Guan, Ziyi, et autres
Publié: (2024)
InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models
par: Xiao, He, et autres
Publié: (2025)
par: Xiao, He, et autres
Publié: (2025)
Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
par: Liu, Ruikang, et autres
Publié: (2025)
par: Liu, Ruikang, et autres
Publié: (2025)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
par: Lv, Keyu, et autres
Publié: (2026)
par: Lv, Keyu, et autres
Publié: (2026)
Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models
par: Liu, Zeyu, et autres
Publié: (2025)
par: Liu, Zeyu, et autres
Publié: (2025)
InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
par: Wang, Pengkai, et autres
Publié: (2025)
par: Wang, Pengkai, et autres
Publié: (2025)
InfiMed-Foundation: Pioneering Advanced Multimodal Medical Models with Compute-Efficient Pre-Training and Multi-Stage Fine-Tuning
par: Zhu, Guanghao, et autres
Publié: (2025)
par: Zhu, Guanghao, et autres
Publié: (2025)
InfiAlign: A Scalable and Sample-Efficient Framework for Aligning LLMs to Enhance Reasoning Capabilities
par: Cai, Shuo, et autres
Publié: (2025)
par: Cai, Shuo, et autres
Publié: (2025)
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
par: Lee, Banseok, et autres
Publié: (2025)
par: Lee, Banseok, et autres
Publié: (2025)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
par: Hu, Xing, et autres
Publié: (2024)
par: Hu, Xing, et autres
Publié: (2024)
InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
LLM-NEO: Parameter Efficient Knowledge Distillation for Large Language Models
par: Yang, Runming, et autres
Publié: (2024)
par: Yang, Runming, et autres
Publié: (2024)
Timber: Training-free Instruct Model Refining with Base via Effective Rank
par: Wu, Taiqiang, et autres
Publié: (2025)
par: Wu, Taiqiang, et autres
Publié: (2025)
Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models
par: Wu, Taiqiang, et autres
Publié: (2024)
par: Wu, Taiqiang, et autres
Publié: (2024)
InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning
par: Xie, Congkai, et autres
Publié: (2025)
par: Xie, Congkai, et autres
Publié: (2025)
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
par: Hong, Zijin, et autres
Publié: (2025)
par: Hong, Zijin, et autres
Publié: (2025)
Shadow-FT: Tuning Instruct Model via Training on Paired Base Model
par: Wu, Taiqiang, et autres
Publié: (2025)
par: Wu, Taiqiang, et autres
Publié: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
par: Li, Ke, et autres
Publié: (2026)
par: Li, Ke, et autres
Publié: (2026)
The Art of Efficient Reasoning: Data, Reward, and Optimization
par: Wu, Taiqiang, et autres
Publié: (2026)
par: Wu, Taiqiang, et autres
Publié: (2026)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
par: Wang, Dongwei, et autres
Publié: (2026)
par: Wang, Dongwei, et autres
Publié: (2026)
LoRETTA: Low-Rank Economic Tensor-Train Adaptation for Ultra-Low-Parameter Fine-Tuning of Large Language Models
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs
par: Lin, Haokun, et autres
Publié: (2025)
par: Lin, Haokun, et autres
Publié: (2025)
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
par: Zandieh, Amir, et autres
Publié: (2024)
par: Zandieh, Amir, et autres
Publié: (2024)
LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs
par: Lee, Jung Hyun, et autres
Publié: (2026)
par: Lee, Jung Hyun, et autres
Publié: (2026)
Channel-Wise Mixed-Precision Quantization for Large Language Models
par: Chen, Zihan, et autres
Publié: (2024)
par: Chen, Zihan, et autres
Publié: (2024)
SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs
par: Cheng, Wenhua, et autres
Publié: (2025)
par: Cheng, Wenhua, et autres
Publié: (2025)
From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization
par: Zhou, Chenxi, et autres
Publié: (2026)
par: Zhou, Chenxi, et autres
Publié: (2026)
System-2 Mathematical Reasoning via Enriched Instruction Tuning
par: Cai, Huanqia, et autres
Publié: (2024)
par: Cai, Huanqia, et autres
Publié: (2024)
Markov Chain of Thought for Efficient Mathematical Reasoning
par: Yang, Wen, et autres
Publié: (2024)
par: Yang, Wen, et autres
Publié: (2024)
Embedding Trajectory for Out-of-Distribution Detection in Mathematical Reasoning
par: Wang, Yiming, et autres
Publié: (2024)
par: Wang, Yiming, et autres
Publié: (2024)
LLM-FP4: 4-Bit Floating-Point Quantized Transformers
par: Liu, Shih-yang, et autres
Publié: (2023)
par: Liu, Shih-yang, et autres
Publié: (2023)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
par: Wang, Yiqi, et autres
Publié: (2024)
par: Wang, Yiqi, et autres
Publié: (2024)
Paraphrase and Solve: Exploring and Exploiting the Impact of Surface Form on Mathematical Reasoning in Large Language Models
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
Catastrophic Failure of LLM Unlearning via Quantization
par: Zhang, Zhiwei, et autres
Publié: (2024)
par: Zhang, Zhiwei, et autres
Publié: (2024)
Documents similaires
-
Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning
par: Li, Zhen, et autres
Publié: (2025) -
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
par: Xiao, He, et autres
Publié: (2025) -
InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning
par: Liu, Zeyu, et autres
Publié: (2025) -
Revisiting Model Interpolation for Efficient Reasoning
par: Wu, Taiqiang, et autres
Publié: (2025) -
InfiR2: A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models
par: Wang, Wenjun, et autres
Publié: (2025)