Quantization-Aware and Tensor-Compressed Training of Transformers for Natural Language Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Zi, Choudhary, Samridhi, Kunzmann, Siegfried, Zhang, Zheng |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CoMERA: Computing- and Memory-Efficient Training via Rank-Adaptive Tensor Optimization
par: Yang, Zi, et autres
Publié: (2024)
par: Yang, Zi, et autres
Publié: (2024)
Saten: Sparse Augmented Tensor Networks for Post-Training Compression of Large Language Models
par: Solgi, Ryan, et autres
Publié: (2025)
par: Solgi, Ryan, et autres
Publié: (2025)
ROSAQ: Rotation-based Saliency-Aware Weight Quantization for Efficiently Compressing Large Language Models
par: Yoon, Junho, et autres
Publié: (2025)
par: Yoon, Junho, et autres
Publié: (2025)
SASQ: Static Activation Scaling for Quantization-Aware Training in Large Language Models
par: Mao, Shizhuo, et autres
Publié: (2025)
par: Mao, Shizhuo, et autres
Publié: (2025)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
par: Chen, Mengzhao, et autres
Publié: (2024)
par: Chen, Mengzhao, et autres
Publié: (2024)
On the Compressibility of Quantized Large Language Models
par: Mao, Yu, et autres
Publié: (2024)
par: Mao, Yu, et autres
Publié: (2024)
SiLQ: Simple Large Language Model Quantization-Aware Training
par: Esser, Steven K., et autres
Publié: (2025)
par: Esser, Steven K., et autres
Publié: (2025)
Advancements in Natural Language Processing: Exploring Transformer-Based Architectures for Text Understanding
par: Wu, Tianhao, et autres
Publié: (2025)
par: Wu, Tianhao, et autres
Publié: (2025)
Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
par: Zhan, Zaifu, et autres
Publié: (2025)
par: Zhan, Zaifu, et autres
Publié: (2025)
Aggressive Post-Training Compression on Extremely Large Language Models
par: Zhang, Zining, et autres
Publié: (2024)
par: Zhang, Zining, et autres
Publié: (2024)
Low-Rank Quantization-Aware Training for LLMs
par: Bondarenko, Yelysei, et autres
Publié: (2024)
par: Bondarenko, Yelysei, et autres
Publié: (2024)
Exploration of Marker-Based Approaches in Argument Mining through Augmented Natural Language
par: Das, Nilmadhab, et autres
Publié: (2024)
par: Das, Nilmadhab, et autres
Publié: (2024)
Exploring the Role of Reasoning Structures for Constructing Proofs in Multi-Step Natural Language Reasoning with Large Language Models
par: Zheng, Zi'ou, et autres
Publié: (2024)
par: Zheng, Zi'ou, et autres
Publié: (2024)
CommVQ: Commutative Vector Quantization for KV Cache Compression
par: Li, Junyan, et autres
Publié: (2025)
par: Li, Junyan, et autres
Publié: (2025)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
par: Gong, Ruihao, et autres
Publié: (2024)
par: Gong, Ruihao, et autres
Publié: (2024)
LoRETTA: Low-Rank Economic Tensor-Train Adaptation for Ultra-Low-Parameter Fine-Tuning of Large Language Models
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
On-the-fly Denoising for Data Augmentation in Natural Language Understanding
par: Fang, Tianqing, et autres
Publié: (2022)
par: Fang, Tianqing, et autres
Publié: (2022)
Natural Context Drift Undermines the Natural Language Understanding of Large Language Models
par: Wu, Yulong, et autres
Publié: (2025)
par: Wu, Yulong, et autres
Publié: (2025)
AdaZeta: Adaptive Zeroth-Order Tensor-Train Adaption for Memory-Efficient Large Language Models Fine-Tuning
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Continuous Approximations for Improving Quantization Aware Training of LLMs
par: Li, He, et autres
Publié: (2024)
par: Li, He, et autres
Publié: (2024)
Label-Confidence-Aware Uncertainty Estimation in Natural Language Generation
par: Lin, Qinhong, et autres
Publié: (2024)
par: Lin, Qinhong, et autres
Publié: (2024)
Combining Transformers with Natural Language Explanations
par: Ruggeri, Federico, et autres
Publié: (2021)
par: Ruggeri, Federico, et autres
Publié: (2021)
Understanding and Tackling Label Errors in Individual-Level Nature Language Understanding
par: Xiao, Yunpeng, et autres
Publié: (2025)
par: Xiao, Yunpeng, et autres
Publié: (2025)
Understanding Network Behaviors through Natural Language Question-Answering
par: Xing, Mingzhe, et autres
Publié: (2025)
par: Xing, Mingzhe, et autres
Publié: (2025)
LatentLLM: Attention-Aware Joint Tensor Compression
par: Koike-Akino, Toshiaki, et autres
Publié: (2025)
par: Koike-Akino, Toshiaki, et autres
Publié: (2025)
Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
par: Zhang, Manyi, et autres
Publié: (2026)
par: Zhang, Manyi, et autres
Publié: (2026)
RDR: the Recap, Deliberate, and Respond Method for Enhanced Language Understanding
par: Zi, Yuxin, et autres
Publié: (2023)
par: Zi, Yuxin, et autres
Publié: (2023)
An Empirical Study on Prompt Compression for Large Language Models
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
AdaComp: Extractive Context Compression with Adaptive Predictor for Retrieval-Augmented Large Language Models
par: Zhang, Qianchi, et autres
Publié: (2024)
par: Zhang, Qianchi, et autres
Publié: (2024)
Time and Memory Trade-off of KV-Cache Compression in Tensor Transformer Decoding
par: Chen, Yifang, et autres
Publié: (2025)
par: Chen, Yifang, et autres
Publié: (2025)
Improving Natural Language Understanding for LLMs via Large-Scale Instruction Synthesis
par: Yuan, Lin, et autres
Publié: (2025)
par: Yuan, Lin, et autres
Publié: (2025)
DisCoCLIP: A Distributional Compositional Tensor Network Encoder for Vision-Language Understanding
par: Lo, Kin Ian, et autres
Publié: (2025)
par: Lo, Kin Ian, et autres
Publié: (2025)
Learning to Compress Prompt in Natural Language Formats
par: Chuang, Yu-Neng, et autres
Publié: (2024)
par: Chuang, Yu-Neng, et autres
Publié: (2024)
Integrating Symbolic Natural Language Understanding and Language Models for Word Sense Disambiguation
par: Zhao, Kexin, et autres
Publié: (2025)
par: Zhao, Kexin, et autres
Publié: (2025)
Semantic Mastery: Enhancing LLMs with Advanced Natural Language Understanding
par: Hariharan, Mohanakrishnan
Publié: (2025)
par: Hariharan, Mohanakrishnan
Publié: (2025)
DLLMQuant: Quantizing Diffusion-based Large Language Models
par: Xu, Chen, et autres
Publié: (2025)
par: Xu, Chen, et autres
Publié: (2025)
GWQ: Gradient-Aware Weight Quantization for Large Language Models
par: Shao, Yihua, et autres
Publié: (2024)
par: Shao, Yihua, et autres
Publié: (2024)
Evaluating Quantized Large Language Models
par: Li, Shiyao, et autres
Publié: (2024)
par: Li, Shiyao, et autres
Publié: (2024)
From Similarity to Structure: Training-free LLM Context Compression with Hybrid Graph Priors
par: Zhou, Yitian, et autres
Publié: (2026)
par: Zhou, Yitian, et autres
Publié: (2026)
Quantization Meets Reasoning: Exploring LLM Low-Bit Quantization Degradation for Mathematical Reasoning
par: Li, Zhen, et autres
Publié: (2025)
par: Li, Zhen, et autres
Publié: (2025)
Documents similaires
-
CoMERA: Computing- and Memory-Efficient Training via Rank-Adaptive Tensor Optimization
par: Yang, Zi, et autres
Publié: (2024) -
Saten: Sparse Augmented Tensor Networks for Post-Training Compression of Large Language Models
par: Solgi, Ryan, et autres
Publié: (2025) -
ROSAQ: Rotation-based Saliency-Aware Weight Quantization for Efficiently Compressing Large Language Models
par: Yoon, Junho, et autres
Publié: (2025) -
SASQ: Static Activation Scaling for Quantization-Aware Training in Large Language Models
par: Mao, Shizhuo, et autres
Publié: (2025) -
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
par: Chen, Mengzhao, et autres
Publié: (2024)