Two-Stage Grid Optimization for Group-wise Quantization of LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Junhan, Lee, Gukryeol, Son, Seungwoo, Kim, Jeewook, Jeon, Yongkweon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BoA: Attention-aware Post-training Quantization without Backpropagation
di: Kim, Junhan, et al.
Pubblicazione: (2024)
di: Kim, Junhan, et al.
Pubblicazione: (2024)
On the Importance of a Multi-Scale Calibration for Quantization
di: Son, Seungwoo, et al.
Pubblicazione: (2026)
di: Son, Seungwoo, et al.
Pubblicazione: (2026)
Towards Next-Level Post-Training Quantization of Hyper-Scale Transformers
di: Kim, Junhan, et al.
Pubblicazione: (2024)
di: Kim, Junhan, et al.
Pubblicazione: (2024)
TurboBoA: Faster and Exact Attention-aware Quantization without Backpropagation
di: Kim, Junhan, et al.
Pubblicazione: (2026)
di: Kim, Junhan, et al.
Pubblicazione: (2026)
LookaheadKV: Fast and Accurate KV Cache Eviction by Glimpsing into the Future without Generation
di: Ahn, Jinwoo, et al.
Pubblicazione: (2026)
di: Ahn, Jinwoo, et al.
Pubblicazione: (2026)
Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
di: Cho, Yoonjun, et al.
Pubblicazione: (2026)
di: Cho, Yoonjun, et al.
Pubblicazione: (2026)
Column-wise Quantization of Weights and Partial Sums for Accurate and Efficient Compute-In-Memory Accelerators
di: Kim, Jiyoon, et al.
Pubblicazione: (2025)
di: Kim, Jiyoon, et al.
Pubblicazione: (2025)
Unifying Block-wise PTQ and Distillation-based QAT for Progressive Quantization toward 2-bit Instruction-Tuned LLMs
di: Lee, Jung Hyun, et al.
Pubblicazione: (2025)
di: Lee, Jung Hyun, et al.
Pubblicazione: (2025)
FlexRound: Learnable Rounding based on Element-wise Division for Post-Training Quantization
di: Lee, Jung Hyun, et al.
Pubblicazione: (2023)
di: Lee, Jung Hyun, et al.
Pubblicazione: (2023)
GlowQ: Group-Shared LOw-Rank Approximation for Quantized LLMs
di: An, Selim, et al.
Pubblicazione: (2026)
di: An, Selim, et al.
Pubblicazione: (2026)
Learning to Continually Learn with the Bayesian Principle
di: Lee, Soochan, et al.
Pubblicazione: (2024)
di: Lee, Soochan, et al.
Pubblicazione: (2024)
FEATHer: Fourier-Efficient Adaptive Temporal Hierarchy Forecaster for Time-Series Forecasting
di: Lee, Jaehoon, et al.
Pubblicazione: (2026)
di: Lee, Jaehoon, et al.
Pubblicazione: (2026)
DeltaDQ: Ultra-High Delta Compression for Fine-Tuned LLMs via Group-wise Dropout and Separate Quantization
di: Jiang, Yanfeng, et al.
Pubblicazione: (2024)
di: Jiang, Yanfeng, et al.
Pubblicazione: (2024)
LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training
di: Gwak, Minju, et al.
Pubblicazione: (2026)
di: Gwak, Minju, et al.
Pubblicazione: (2026)
CodeGEMM: A Codebook-Centric Approach to Efficient GEMM in Quantized LLMs
di: Park, Gunho, et al.
Pubblicazione: (2025)
di: Park, Gunho, et al.
Pubblicazione: (2025)
OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance
di: Park, Yeo Jeong, et al.
Pubblicazione: (2026)
di: Park, Yeo Jeong, et al.
Pubblicazione: (2026)
Quantum Circuit Structure Optimization for Quantum Reinforcement Learning
di: Son, Seok Bin, et al.
Pubblicazione: (2025)
di: Son, Seok Bin, et al.
Pubblicazione: (2025)
Assigning Distinct Roles to Quantized and Low-Rank Matrices Toward Optimal Weight Decomposition
di: Cho, Yoonjun, et al.
Pubblicazione: (2025)
di: Cho, Yoonjun, et al.
Pubblicazione: (2025)
AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs
di: Park, Gunho, et al.
Pubblicazione: (2025)
di: Park, Gunho, et al.
Pubblicazione: (2025)
MUXQ: Mixed-to-Uniform Precision MatriX Quantization via Low-Rank Outlier Decomposition
di: Lee, Seoungsub, et al.
Pubblicazione: (2026)
di: Lee, Seoungsub, et al.
Pubblicazione: (2026)
MISA: Memory-Efficient LLMs Optimization with Module-wise Importance Sampling
di: Liu, Yuxi, et al.
Pubblicazione: (2025)
di: Liu, Yuxi, et al.
Pubblicazione: (2025)
Training Long-Context LLMs Efficiently via Chunk-wise Optimization
di: Li, Wenhao, et al.
Pubblicazione: (2025)
di: Li, Wenhao, et al.
Pubblicazione: (2025)
Recasting Continual Learning as Sequence Modeling
di: Lee, Soochan, et al.
Pubblicazione: (2023)
di: Lee, Soochan, et al.
Pubblicazione: (2023)
Distilling Reinforcement Learning Algorithms for In-Context Model-Based Planning
di: Son, Jaehyeon, et al.
Pubblicazione: (2025)
di: Son, Jaehyeon, et al.
Pubblicazione: (2025)
Hierarchical Attention-based Graph Neural Network with Relevance-driven Pruning
di: Kum, Seungwoo
Pubblicazione: (2026)
di: Kum, Seungwoo
Pubblicazione: (2026)
Grouped Differential Attention
di: Lim, Junghwan, et al.
Pubblicazione: (2025)
di: Lim, Junghwan, et al.
Pubblicazione: (2025)
Uncertainty Calibration with Energy Based Instance-wise Scaling in the Wild Dataset
di: Kim, Mijoo, et al.
Pubblicazione: (2024)
di: Kim, Mijoo, et al.
Pubblicazione: (2024)
MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning
di: Kim, Youngeun
Pubblicazione: (2026)
di: Kim, Youngeun
Pubblicazione: (2026)
Calibration and Transformation-Free Weight-Only LLMs Quantization via Dynamic Grouping
di: Zheng, Xinzhe, et al.
Pubblicazione: (2025)
di: Zheng, Xinzhe, et al.
Pubblicazione: (2025)
Stage-Diff: Stage-wise Long-Term Time Series Generation Based on Diffusion Models
di: Hou, Xuan, et al.
Pubblicazione: (2025)
di: Hou, Xuan, et al.
Pubblicazione: (2025)
Subspace-based Approximate Hessian Method for Zeroth-Order Optimization
di: Kim, Dongyoon, et al.
Pubblicazione: (2025)
di: Kim, Dongyoon, et al.
Pubblicazione: (2025)
Can Blindfolded LLMs Still Trade? An Anonymization-First Framework for Portfolio Optimization
di: Jeon, Joohyoung, et al.
Pubblicazione: (2026)
di: Jeon, Joohyoung, et al.
Pubblicazione: (2026)
LRQ: Optimizing Post-Training Quantization for Large Language Models by Learning Low-Rank Weight-Scaling Matrices
di: Lee, Jung Hyun, et al.
Pubblicazione: (2024)
di: Lee, Jung Hyun, et al.
Pubblicazione: (2024)
Beacon: Post-Training Quantization with Integrated Grid Selection
di: Zhang, Shihao, et al.
Pubblicazione: (2025)
di: Zhang, Shihao, et al.
Pubblicazione: (2025)
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
di: Lee, Banseok, et al.
Pubblicazione: (2025)
di: Lee, Banseok, et al.
Pubblicazione: (2025)
A Framework for Mining Collectively-Behaving Bots in MMORPGs
di: Kim, Hyunsoo, et al.
Pubblicazione: (2025)
di: Kim, Hyunsoo, et al.
Pubblicazione: (2025)
MahaVar: OOD Detection via Class-wise Mahalanobis Distance Variance under Neural Collapse
di: Kim, Donghwan, et al.
Pubblicazione: (2026)
di: Kim, Donghwan, et al.
Pubblicazione: (2026)
FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression
di: Lee, Namyoon, et al.
Pubblicazione: (2026)
di: Lee, Namyoon, et al.
Pubblicazione: (2026)
QUICK: Quantization-aware Interleaving and Conflict-free Kernel for efficient LLM inference
di: Kim, Taesu, et al.
Pubblicazione: (2024)
di: Kim, Taesu, et al.
Pubblicazione: (2024)
Optimized Feature Generation for Tabular Data via LLMs with Decision Tree Reasoning
di: Nam, Jaehyun, et al.
Pubblicazione: (2024)
di: Nam, Jaehyun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
BoA: Attention-aware Post-training Quantization without Backpropagation
di: Kim, Junhan, et al.
Pubblicazione: (2024) -
On the Importance of a Multi-Scale Calibration for Quantization
di: Son, Seungwoo, et al.
Pubblicazione: (2026) -
Towards Next-Level Post-Training Quantization of Hyper-Scale Transformers
di: Kim, Junhan, et al.
Pubblicazione: (2024) -
TurboBoA: Faster and Exact Attention-aware Quantization without Backpropagation
di: Kim, Junhan, et al.
Pubblicazione: (2026) -
LookaheadKV: Fast and Accurate KV Cache Eviction by Glimpsing into the Future without Generation
di: Ahn, Jinwoo, et al.
Pubblicazione: (2026)