Calibration and Transformation-Free Weight-Only LLMs Quantization via Dynamic Grouping
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Xinzhe, Yang, Zhen-Qun, Liu, Zishan, Xie, Haoran, Qin, S. Joe, Chen, Arlene, Lin, Fangzhen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SplitQuantV2: Enhancing Low-Bit Quantization of LLMs Without GPUs
par: Song, Jaewoo, et autres
Publié: (2025)
par: Song, Jaewoo, et autres
Publié: (2025)
DAQ: Density-Aware Post-Training Weight-Only Quantization For LLMs
par: Luo, Yingsong, et autres
Publié: (2024)
par: Luo, Yingsong, et autres
Publié: (2024)
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
par: Song, Jaewoo, et autres
Publié: (2025)
par: Song, Jaewoo, et autres
Publié: (2025)
Emotion-Enhanced Multi-Task Learning with LLMs for Aspect Category Sentiment Analysis
par: Chai, Yaping, et autres
Publié: (2025)
par: Chai, Yaping, et autres
Publié: (2025)
Predicting Multi-Type Talented Students in Secondary School Using Semi-Supervised Machine Learning
par: Zheng, Xinzhe, et autres
Publié: (2025)
par: Zheng, Xinzhe, et autres
Publié: (2025)
Unsupervised Accelerated MRI Reconstruction via Ground-Truth-Free Flow Matching
par: Luo, Xinzhe, et autres
Publié: (2025)
par: Luo, Xinzhe, et autres
Publié: (2025)
Predicting Student Dropout Risk With A Dual-Modal Abrupt Behavioral Changes Approach
par: Cheng, Jiabei, et autres
Publié: (2025)
par: Cheng, Jiabei, et autres
Publié: (2025)
SINQ: Sinkhorn-Normalized Quantization for Calibration-Free Low-Precision LLM Weights
par: Müller, Lorenz K., et autres
Publié: (2025)
par: Müller, Lorenz K., et autres
Publié: (2025)
Imagine a City: CityGenAgent for Procedural 3D City Generation
par: Liu, Zishan, et autres
Publié: (2026)
par: Liu, Zishan, et autres
Publié: (2026)
When LLMs Team Up: The Emergence of Collaborative Affective Computing
par: Lai, Wenna, et autres
Publié: (2025)
par: Lai, Wenna, et autres
Publié: (2025)
DAST: Context-Aware Compression in LLMs via Dynamic Allocation of Soft Tokens
par: Chen, Shaoshen, et autres
Publié: (2025)
par: Chen, Shaoshen, et autres
Publié: (2025)
Similarity-as-Evidence: Calibrating Overconfident VLMs for Interpretable and Label-Efficient Medical Active Learning
par: Xie, Zhuofan, et autres
Publié: (2026)
par: Xie, Zhuofan, et autres
Publié: (2026)
Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective
par: Ma, Xiaorui, et autres
Publié: (2025)
par: Ma, Xiaorui, et autres
Publié: (2025)
Text Data Augmentation for Large Language Models: A Comprehensive Survey of Methods, Challenges, and Opportunities
par: Chai, Yaping, et autres
Publié: (2025)
par: Chai, Yaping, et autres
Publié: (2025)
Semantic-preserved Augmentation with Confidence-weighted Fine-tuning for Aspect Category Sentiment Analysis
par: Chai, Yaping, et autres
Publié: (2025)
par: Chai, Yaping, et autres
Publié: (2025)
Task-Routed Mixture-of-Experts with Cognitive Appraisal for Implicit Sentiment Analysis
par: Chai, Yaping, et autres
Publié: (2026)
par: Chai, Yaping, et autres
Publié: (2026)
Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning
par: Wang, Haozhe, et autres
Publié: (2025)
par: Wang, Haozhe, et autres
Publié: (2025)
Accurate LoRA-Finetuning Quantization of LLMs via Information Retention
par: Qin, Haotong, et autres
Publié: (2024)
par: Qin, Haotong, et autres
Publié: (2024)
Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs
par: Cheng, Wenhua, et autres
Publié: (2023)
par: Cheng, Wenhua, et autres
Publié: (2023)
AdpQ: A Zero-shot Calibration Free Adaptive Post Training Quantization Method for LLMs
par: Ghaffari, Alireza, et autres
Publié: (2024)
par: Ghaffari, Alireza, et autres
Publié: (2024)
Constant-Memory Strategies in Stochastic Games: Best Responses and Equilibria
par: Zhu, Fengming, et autres
Publié: (2025)
par: Zhu, Fengming, et autres
Publié: (2025)
Computing Universal Plans for Partially Observable Multi-Agent Routing Using Answer Set Programming
par: Zhu, Fengming, et autres
Publié: (2023)
par: Zhu, Fengming, et autres
Publié: (2023)
Single-Agent Planning in a Multi-Agent System: A Unified Framework for Type-Based Planners
par: Zhu, Fengming, et autres
Publié: (2025)
par: Zhu, Fengming, et autres
Publié: (2025)
Quantized Delta Weight Is Safety Keeper
par: Liu, Yule, et autres
Publié: (2024)
par: Liu, Yule, et autres
Publié: (2024)
CondAmbigQA: A Benchmark and Dataset for Conditional Ambiguous Question Answering
par: Li, Zongxi, et autres
Publié: (2025)
par: Li, Zongxi, et autres
Publié: (2025)
Grouped Sequency-arranged Rotation: Optimizing Rotation Transformation for Quantization for Free
par: Choi, Euntae, et autres
Publié: (2025)
par: Choi, Euntae, et autres
Publié: (2025)
UPMRI: Unsupervised Parallel MRI Reconstruction via Projected Conditional Flow Matching
par: Luo, Xinzhe, et autres
Publié: (2025)
par: Luo, Xinzhe, et autres
Publié: (2025)
HARGPT: Are LLMs Zero-Shot Human Activity Recognizers?
par: Ji, Sijie, et autres
Publié: (2024)
par: Ji, Sijie, et autres
Publié: (2024)
TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling
par: Gu, Hongyaoxing, et autres
Publié: (2026)
par: Gu, Hongyaoxing, et autres
Publié: (2026)
Rethinking ChatGPT's Success: Usability and Cognitive Behaviors Enabled by Auto-regressive LLMs' Prompting
par: Li, Xinzhe, et autres
Publié: (2024)
par: Li, Xinzhe, et autres
Publié: (2024)
Weight Group-wise Post-Training Quantization for Medical Foundation Model
par: Chen, Yineng, et autres
Publié: (2026)
par: Chen, Yineng, et autres
Publié: (2026)
CLoQ: Enhancing Fine-Tuning of Quantized LLMs via Calibrated LoRA Initialization
par: Deng, Yanxia, et autres
Publié: (2025)
par: Deng, Yanxia, et autres
Publié: (2025)
Training-Free Vector Quantization via Gaussian VAEs
par: Xu, Tongda, et autres
Publié: (2025)
par: Xu, Tongda, et autres
Publié: (2025)
Integer Scale: A Free Lunch for Faster Fine-grained Quantization of LLMs
par: Li, Qingyuan, et autres
Publié: (2024)
par: Li, Qingyuan, et autres
Publié: (2024)
Fine-grained Verification via Diagnostic Reasoning Supervision for Aspect Sentiment Triplet Extraction
par: Lai, Wenna, et autres
Publié: (2026)
par: Lai, Wenna, et autres
Publié: (2026)
Scaling Image Tokenizers with Grouped Spherical Quantization
par: Wang, Jiangtao, et autres
Publié: (2024)
par: Wang, Jiangtao, et autres
Publié: (2024)
GPTAQ: Efficient Finetuning-Free Quantization for Asymmetric Calibration
par: Li, Yuhang, et autres
Publié: (2025)
par: Li, Yuhang, et autres
Publié: (2025)
Drive-Only Interaction Engineering via Dynamical Freezing
par: Xie, Songbo, et autres
Publié: (2026)
par: Xie, Songbo, et autres
Publié: (2026)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
par: Qiao, Ye, et autres
Publié: (2026)
par: Qiao, Ye, et autres
Publié: (2026)
CafeQ: Calibration-free Quantization via Learned Transformations and Adaptive Rounding
par: Sun, Ziteng, et autres
Publié: (2025)
par: Sun, Ziteng, et autres
Publié: (2025)
Documents similaires
-
SplitQuantV2: Enhancing Low-Bit Quantization of LLMs Without GPUs
par: Song, Jaewoo, et autres
Publié: (2025) -
DAQ: Density-Aware Post-Training Weight-Only Quantization For LLMs
par: Luo, Yingsong, et autres
Publié: (2024) -
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
par: Song, Jaewoo, et autres
Publié: (2025) -
Emotion-Enhanced Multi-Task Learning with LLMs for Aspect Category Sentiment Analysis
par: Chai, Yaping, et autres
Publié: (2025) -
Predicting Multi-Type Talented Students in Secondary School Using Semi-Supervised Machine Learning
par: Zheng, Xinzhe, et autres
Publié: (2025)