LAQuant: A Simple Overhead-free Large Reasoning Model Quantization by Layer-wise Lookahead Loss
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Choi, Euntae, Song, Sumin, Yoo, Sungjoo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rotate, Clip, and Partition: Towards W2A4KV4 Quantization by Integrating Rotation and Learnable Non-uniform Quantizer
par: Choi, Euntae, et autres
Publié: (2025)
par: Choi, Euntae, et autres
Publié: (2025)
Grouped Sequency-arranged Rotation: Optimizing Rotation Transformation for Quantization for Free
par: Choi, Euntae, et autres
Publié: (2025)
par: Choi, Euntae, et autres
Publié: (2025)
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
par: Son, Donghyun, et autres
Publié: (2025)
par: Son, Donghyun, et autres
Publié: (2025)
Phys3DGS: Physically-based 3D Gaussian Splatting for Inverse Rendering
par: Choi, Euntae, et autres
Publié: (2024)
par: Choi, Euntae, et autres
Publié: (2024)
Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training
par: Ahn, Myeonghwan, et autres
Publié: (2025)
par: Ahn, Myeonghwan, et autres
Publié: (2025)
Baking Relightable NeRF for Real-time Direct/Indirect Illumination Rendering
par: Choi, Euntae, et autres
Publié: (2024)
par: Choi, Euntae, et autres
Publié: (2024)
Layer-wise Quantization for Quantized Optimistic Dual Averaging
par: Nguyen, Anh Duc, et autres
Publié: (2025)
par: Nguyen, Anh Duc, et autres
Publié: (2025)
LoaQ: Layer-wise Output Approximation Quantization
par: Lin, Li, et autres
Publié: (2025)
par: Lin, Li, et autres
Publié: (2025)
On the Effect of Uncertainty on Layer-wise Inference Dynamics
par: Kim, Sunwoo, et autres
Publié: (2025)
par: Kim, Sunwoo, et autres
Publié: (2025)
MetaMix: Meta-state Precision Searcher for Mixed-precision Activation Quantization
par: Kim, Han-Byul, et autres
Publié: (2023)
par: Kim, Han-Byul, et autres
Publié: (2023)
Scaling Speculative Decoding with Lookahead Reasoning
par: Fu, Yichao, et autres
Publié: (2025)
par: Fu, Yichao, et autres
Publié: (2025)
Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models
par: Xiao, He, et autres
Publié: (2025)
par: Xiao, He, et autres
Publié: (2025)
Causal Attention with Lookahead Keys
par: Song, Zhuoqing, et autres
Publié: (2025)
par: Song, Zhuoqing, et autres
Publié: (2025)
A Few Large Shifts: Layer-Inconsistency Based Minimal Overhead Adversarial Example Detection
par: Yun, Sanggeon, et autres
Publié: (2025)
par: Yun, Sanggeon, et autres
Publié: (2025)
GuidedQuant: Large Language Model Quantization via Exploiting End Loss Guidance
par: Kim, Jinuk, et autres
Publié: (2025)
par: Kim, Jinuk, et autres
Publié: (2025)
R2 Loss: Range Restriction Loss for Model Compression and Quantization
par: Kundu, Arnav, et autres
Publié: (2023)
par: Kundu, Arnav, et autres
Publié: (2023)
Activation by Interval-wise Dropout: A Simple Way to Prevent Neural Networks from Plasticity Loss
par: Park, Sangyeon, et autres
Publié: (2025)
par: Park, Sangyeon, et autres
Publié: (2025)
Iterative Layer-wise Distillation for Efficient Compression of Large Language Models
par: Kovalev, Grigory, et autres
Publié: (2025)
par: Kovalev, Grigory, et autres
Publié: (2025)
MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration
par: Wang, Jinguang, et autres
Publié: (2025)
par: Wang, Jinguang, et autres
Publié: (2025)
Determining Layer-wise Sparsity for Large Language Models Through a Theoretical Perspective
par: Huang, Weizhong, et autres
Publié: (2025)
par: Huang, Weizhong, et autres
Publié: (2025)
Next-Depth Lookahead Tree
par: Lee, Jaeho, et autres
Publié: (2025)
par: Lee, Jaeho, et autres
Publié: (2025)
Reinforcement Learning with Lookahead Information
par: Merlis, Nadav
Publié: (2024)
par: Merlis, Nadav
Publié: (2024)
Generalization and Optimization of SGD with Lookahead
par: Li, Kangcheng, et autres
Publié: (2025)
par: Li, Kangcheng, et autres
Publié: (2025)
Lookahead Drifting Model
par: Zhang, Guoqiang, et autres
Publié: (2026)
par: Zhang, Guoqiang, et autres
Publié: (2026)
The Impact of Quantization on Large Reasoning Model Reinforcement Learning
par: Kumar, Medha, et autres
Publié: (2025)
par: Kumar, Medha, et autres
Publié: (2025)
Disentangling Recall and Reasoning in Transformer Models through Layer-wise Attention and Activation Analysis
par: Fartale, Harshwardhan, et autres
Publié: (2025)
par: Fartale, Harshwardhan, et autres
Publié: (2025)
Lookahead Counterfactual Fairness
par: Zuo, Zhiqun, et autres
Publié: (2024)
par: Zuo, Zhiqun, et autres
Publié: (2024)
Scalable Model Merging with Progressive Layer-wise Distillation
par: Xu, Jing, et autres
Publié: (2025)
par: Xu, Jing, et autres
Publié: (2025)
QTALE: Quantization-Robust Token-Adaptive Layer Execution for LLMs
par: Noh, Kanghyun, et autres
Publié: (2026)
par: Noh, Kanghyun, et autres
Publié: (2026)
The Value of Reward Lookahead in Reinforcement Learning
par: Merlis, Nadav, et autres
Publié: (2024)
par: Merlis, Nadav, et autres
Publié: (2024)
Layer-wise Derivative Controlled Networks
par: Martnishn, Rowan, et autres
Publié: (2026)
par: Martnishn, Rowan, et autres
Publié: (2026)
Layer-wise Linear Mode Connectivity
par: Adilova, Linara, et autres
Publié: (2023)
par: Adilova, Linara, et autres
Publié: (2023)
Low-Complexity Semantic Packet Aggregation for Token Communication via Lookahead Search
par: Lee, Seunghun, et autres
Publié: (2025)
par: Lee, Seunghun, et autres
Publié: (2025)
A Convex-optimization-based Layer-wise Post-training Pruner for Large Language Models
par: Zhao, Pengxiang, et autres
Publié: (2024)
par: Zhao, Pengxiang, et autres
Publié: (2024)
Rethinking Layer-wise Model Merging through Chain of Merges
par: Buzzega, Pietro, et autres
Publié: (2025)
par: Buzzega, Pietro, et autres
Publié: (2025)
Policy Mirror Descent with Lookahead
par: Protopapas, Kimon, et autres
Publié: (2024)
par: Protopapas, Kimon, et autres
Publié: (2024)
Adaptive Layer-Wise Transformations for Post-Training Quantization of Large Language Models
par: Pham, Cuong, et autres
Publié: (2025)
par: Pham, Cuong, et autres
Publié: (2025)
Tequila: Trapping-free Ternary Quantization for Large Language Models
par: Huang, Hong, et autres
Publié: (2025)
par: Huang, Hong, et autres
Publié: (2025)
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
par: Zandieh, Amir, et autres
Publié: (2024)
par: Zandieh, Amir, et autres
Publié: (2024)
Lookahead: An Inference Acceleration Framework for Large Language Model with Lossless Generation Accuracy
par: Zhao, Yao, et autres
Publié: (2023)
par: Zhao, Yao, et autres
Publié: (2023)
Documents similaires
-
Rotate, Clip, and Partition: Towards W2A4KV4 Quantization by Integrating Rotation and Learnable Non-uniform Quantizer
par: Choi, Euntae, et autres
Publié: (2025) -
Grouped Sequency-arranged Rotation: Optimizing Rotation Transformation for Quantization for Free
par: Choi, Euntae, et autres
Publié: (2025) -
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
par: Son, Donghyun, et autres
Publié: (2025) -
Phys3DGS: Physically-based 3D Gaussian Splatting for Inverse Rendering
par: Choi, Euntae, et autres
Publié: (2024) -
Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training
par: Ahn, Myeonghwan, et autres
Publié: (2025)