Evaluating Quantized Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Shiyao, Ning, Xuefei, Wang, Luning, Liu, Tengxuan, Shi, Xiangsheng, Yan, Shengen, Dai, Guohao, Yang, Huazhong, Wang, Yu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CSKV: Training-Efficient Channel Shrinking for KV Cache in Long-Context Scenarios
von: Wang, Luning, et al.
Veröffentlicht: (2024)
von: Wang, Luning, et al.
Veröffentlicht: (2024)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
von: Fu, Tianyu, et al.
Veröffentlicht: (2024)
von: Fu, Tianyu, et al.
Veröffentlicht: (2024)
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
von: Li, Shiyao, et al.
Veröffentlicht: (2024)
von: Li, Shiyao, et al.
Veröffentlicht: (2024)
A Survey on Efficient Inference for Large Language Models
von: Zhou, Zixuan, et al.
Veröffentlicht: (2024)
von: Zhou, Zixuan, et al.
Veröffentlicht: (2024)
PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs
von: Liu, Tengxuan, et al.
Veröffentlicht: (2025)
von: Liu, Tengxuan, et al.
Veröffentlicht: (2025)
Can LLMs Learn by Teaching for Better Reasoning? A Preliminary Study
von: Ning, Xuefei, et al.
Veröffentlicht: (2024)
von: Ning, Xuefei, et al.
Veröffentlicht: (2024)
Mixture of Attention Spans: Optimizing LLM Inference Efficiency with Heterogeneous Sliding-Window Lengths
von: Fu, Tianyu, et al.
Veröffentlicht: (2024)
von: Fu, Tianyu, et al.
Veröffentlicht: (2024)
R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
von: Fu, Tianyu, et al.
Veröffentlicht: (2025)
von: Fu, Tianyu, et al.
Veröffentlicht: (2025)
Skeleton-of-Thought: Prompting LLMs for Efficient Parallel Generation
von: Ning, Xuefei, et al.
Veröffentlicht: (2023)
von: Ning, Xuefei, et al.
Veröffentlicht: (2023)
MixDQ: Memory-Efficient Few-Step Text-to-Image Diffusion Models with Metric-Decoupled Mixed Precision Quantization
von: Zhao, Tianchen, et al.
Veröffentlicht: (2024)
von: Zhao, Tianchen, et al.
Veröffentlicht: (2024)
Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
von: Zhan, Zaifu, et al.
Veröffentlicht: (2025)
von: Zhan, Zaifu, et al.
Veröffentlicht: (2025)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
von: Jin, Renren, et al.
Veröffentlicht: (2024)
von: Jin, Renren, et al.
Veröffentlicht: (2024)
Language-Native Materials Processing Design by Lightly Structured Text Database and Reasoning Large Language Model
von: Liu, Yuze, et al.
Veröffentlicht: (2025)
von: Liu, Yuze, et al.
Veröffentlicht: (2025)
Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
von: Fu, Tianyu, et al.
Veröffentlicht: (2025)
von: Fu, Tianyu, et al.
Veröffentlicht: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
von: Lu, Yida, et al.
Veröffentlicht: (2025)
von: Lu, Yida, et al.
Veröffentlicht: (2025)
On the Compressibility of Quantized Large Language Models
von: Mao, Yu, et al.
Veröffentlicht: (2024)
von: Mao, Yu, et al.
Veröffentlicht: (2024)
GWQ: Gradient-Aware Weight Quantization for Large Language Models
von: Shao, Yihua, et al.
Veröffentlicht: (2024)
von: Shao, Yihua, et al.
Veröffentlicht: (2024)
DLLMQuant: Quantizing Diffusion-based Large Language Models
von: Xu, Chen, et al.
Veröffentlicht: (2025)
von: Xu, Chen, et al.
Veröffentlicht: (2025)
A Survey on Evaluation of Large Language Models
von: Chang, Yupeng, et al.
Veröffentlicht: (2023)
von: Chang, Yupeng, et al.
Veröffentlicht: (2023)
FlightLLM: Efficient Large Language Model Inference with a Complete Mapping Flow on FPGAs
von: Zeng, Shulin, et al.
Veröffentlicht: (2024)
von: Zeng, Shulin, et al.
Veröffentlicht: (2024)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
GLoRE: Evaluating Logical Reasoning of Large Language Models
von: liu, Hanmeng, et al.
Veröffentlicht: (2023)
von: liu, Hanmeng, et al.
Veröffentlicht: (2023)
Survey on Knowledge Distillation for Large Language Models: Methods, Evaluation, and Application
von: Yang, Chuanpeng, et al.
Veröffentlicht: (2024)
von: Yang, Chuanpeng, et al.
Veröffentlicht: (2024)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
von: Li, Ce, et al.
Veröffentlicht: (2025)
von: Li, Ce, et al.
Veröffentlicht: (2025)
LIFEBench: Evaluating Length Instruction Following in Large Language Models
von: Zhang, Wei, et al.
Veröffentlicht: (2025)
von: Zhang, Wei, et al.
Veröffentlicht: (2025)
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
von: Huang, Weiyu, et al.
Veröffentlicht: (2024)
von: Huang, Weiyu, et al.
Veröffentlicht: (2024)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
ReaLM: Residual Quantization Bridging Knowledge Graph Embeddings and Large Language Models
von: Guo, Wenbin, et al.
Veröffentlicht: (2025)
von: Guo, Wenbin, et al.
Veröffentlicht: (2025)
HETHUB: A Distributed Training System with Heterogeneous Cluster for Large-Scale Models
von: Xu, Si, et al.
Veröffentlicht: (2024)
von: Xu, Si, et al.
Veröffentlicht: (2024)
Evaluating the Translation Performance of Large Language Models Based on Euas-20
von: Huang, Yan, et al.
Veröffentlicht: (2024)
von: Huang, Yan, et al.
Veröffentlicht: (2024)
Characteristic AI Agents via Large Language Models
von: Wang, Xi, et al.
Veröffentlicht: (2024)
von: Wang, Xi, et al.
Veröffentlicht: (2024)
VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models
von: Zhang, Hanling, et al.
Veröffentlicht: (2025)
von: Zhang, Hanling, et al.
Veröffentlicht: (2025)
Channel-Wise Mixed-Precision Quantization for Large Language Models
von: Chen, Zihan, et al.
Veröffentlicht: (2024)
von: Chen, Zihan, et al.
Veröffentlicht: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024)
von: Liu, Yan, et al.
Veröffentlicht: (2024)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
von: Yang, Shuo, et al.
Veröffentlicht: (2025)
von: Yang, Shuo, et al.
Veröffentlicht: (2025)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
von: Xie, Qiujie, et al.
Veröffentlicht: (2025)
von: Xie, Qiujie, et al.
Veröffentlicht: (2025)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
von: Ning, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Ning, Zhiyuan, et al.
Veröffentlicht: (2025)
A Survey on Large Language Models for Mathematical Reasoning
von: Wang, Peng-Yuan, et al.
Veröffentlicht: (2025)
von: Wang, Peng-Yuan, et al.
Veröffentlicht: (2025)
RoCar: A Relationship Network-based Evaluation Method for Large Language Models
von: Wang, Ming, et al.
Veröffentlicht: (2023)
von: Wang, Ming, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
CSKV: Training-Efficient Channel Shrinking for KV Cache in Long-Context Scenarios
von: Wang, Luning, et al.
Veröffentlicht: (2024) -
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
von: Fu, Tianyu, et al.
Veröffentlicht: (2024) -
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
von: Li, Shiyao, et al.
Veröffentlicht: (2024) -
A Survey on Efficient Inference for Large Language Models
von: Zhou, Zixuan, et al.
Veröffentlicht: (2024) -
PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs
von: Liu, Tengxuan, et al.
Veröffentlicht: (2025)