CBQ: Cross-Block Quantization for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ding, Xin, Liu, Xiaoyu, Tu, Zhijun, Zhang, Yun, Li, Wei, Hu, Jie, Chen, Hanting, Tang, Yehui, Xiong, Zhiwei, Yin, Baoqun, Wang, Yunhe |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Multi-Granularity Semantic Revision for Large Language Model Distillation
von: Liu, Xiaoyu, et al.
Veröffentlicht: (2024)
von: Liu, Xiaoyu, et al.
Veröffentlicht: (2024)
Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models
von: Tu, Zhijun, et al.
Veröffentlicht: (2025)
von: Tu, Zhijun, et al.
Veröffentlicht: (2025)
Saliency-driven Dynamic Token Pruning for Large Language Models
von: Tao, Yao, et al.
Veröffentlicht: (2025)
von: Tao, Yao, et al.
Veröffentlicht: (2025)
EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models
von: Ni, Yunsheng, et al.
Veröffentlicht: (2024)
von: Ni, Yunsheng, et al.
Veröffentlicht: (2024)
EAQuant: Enhancing Post-Training Quantization for MoE Models via Expert-Aware Optimization
von: Fu, Zhongqian, et al.
Veröffentlicht: (2025)
von: Fu, Zhongqian, et al.
Veröffentlicht: (2025)
A Survey on Transformer Compression
von: Tang, Yehui, et al.
Veröffentlicht: (2024)
von: Tang, Yehui, et al.
Veröffentlicht: (2024)
DenseMamba: State Space Models with Dense Hidden Connection for Efficient Large Language Models
von: He, Wei, et al.
Veröffentlicht: (2024)
von: He, Wei, et al.
Veröffentlicht: (2024)
DiJiang: Efficient Large Language Models through Compact Kernelization
von: Chen, Hanting, et al.
Veröffentlicht: (2024)
von: Chen, Hanting, et al.
Veröffentlicht: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
von: Jie, Shibo, et al.
Veröffentlicht: (2024)
von: Jie, Shibo, et al.
Veröffentlicht: (2024)
Deferred Commitment Decoding for Diffusion Language Models
von: Shu, Yingte, et al.
Veröffentlicht: (2026)
von: Shu, Yingte, et al.
Veröffentlicht: (2026)
SLAB: Efficient Transformers with Simplified Linear Attention and Progressive Re-parameterized Batch Normalization
von: Guo, Jialong, et al.
Veröffentlicht: (2024)
von: Guo, Jialong, et al.
Veröffentlicht: (2024)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
von: Tian, Yuchuan, et al.
Veröffentlicht: (2024)
von: Tian, Yuchuan, et al.
Veröffentlicht: (2024)
Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning
von: Bi, Zhenni, et al.
Veröffentlicht: (2024)
von: Bi, Zhenni, et al.
Veröffentlicht: (2024)
IPT-V2: Efficient Image Processing Transformer using Hierarchical Attentions
von: Tu, Zhijun, et al.
Veröffentlicht: (2024)
von: Tu, Zhijun, et al.
Veröffentlicht: (2024)
SlimLLM: Accurate Structured Pruning for Large Language Models
von: Guo, Jialong, et al.
Veröffentlicht: (2025)
von: Guo, Jialong, et al.
Veröffentlicht: (2025)
Mixture of Lookup Experts
von: Jie, Shibo, et al.
Veröffentlicht: (2025)
von: Jie, Shibo, et al.
Veröffentlicht: (2025)
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
von: Liu, Jing, et al.
Veröffentlicht: (2023)
von: Liu, Jing, et al.
Veröffentlicht: (2023)
PocketLLM: Ultimate Compression of Large Language Models via Meta Networks
von: Tian, Ye, et al.
Veröffentlicht: (2025)
von: Tian, Ye, et al.
Veröffentlicht: (2025)
Interactions Across Blocks in Post-Training Quantization of Large Language Models
von: Shabanovi, Khasmamad, et al.
Veröffentlicht: (2024)
von: Shabanovi, Khasmamad, et al.
Veröffentlicht: (2024)
Distilling Semantic Priors from SAM to Efficient Image Restoration Models
von: Zhang, Quan, et al.
Veröffentlicht: (2024)
von: Zhang, Quan, et al.
Veröffentlicht: (2024)
Unshackling Context Length: An Efficient Selective Attention Approach through Query-Key Compression
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
PanGu-$π$: Enhancing Language Model Architectures via Nonlinearity Compensation
von: Wang, Yunhe, et al.
Veröffentlicht: (2023)
von: Wang, Yunhe, et al.
Veröffentlicht: (2023)
Block Circulant Adapter for Large Language Models
von: Ding, Xinyu, et al.
Veröffentlicht: (2025)
von: Ding, Xinyu, et al.
Veröffentlicht: (2025)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
von: Jin, Renren, et al.
Veröffentlicht: (2024)
von: Jin, Renren, et al.
Veröffentlicht: (2024)
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
von: Liu, Fangcheng, et al.
Veröffentlicht: (2024)
von: Liu, Fangcheng, et al.
Veröffentlicht: (2024)
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
PanGu-$π$ Pro:Rethinking Optimization and Architecture for Tiny Language Models
von: Tang, Yehui, et al.
Veröffentlicht: (2024)
von: Tang, Yehui, et al.
Veröffentlicht: (2024)
LSAQ: Layer-Specific Adaptive Quantization for Large Language Model Deployment
von: Zeng, Binrui, et al.
Veröffentlicht: (2024)
von: Zeng, Binrui, et al.
Veröffentlicht: (2024)
CFBenchmark: Chinese Financial Assistant Benchmark for Large Language Model
von: Lei, Yang, et al.
Veröffentlicht: (2023)
von: Lei, Yang, et al.
Veröffentlicht: (2023)
C-MOP: Integrating Momentum and Boundary-Aware Clustering for Enhanced Prompt Evolution
von: Yan, Binwei, et al.
Veröffentlicht: (2026)
von: Yan, Binwei, et al.
Veröffentlicht: (2026)
Can Watermarks Survive Translation? On the Cross-lingual Consistency of Text Watermark for Large Language Models
von: He, Zhiwei, et al.
Veröffentlicht: (2024)
von: He, Zhiwei, et al.
Veröffentlicht: (2024)
From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models
von: Tong, Junlong, et al.
Veröffentlicht: (2026)
von: Tong, Junlong, et al.
Veröffentlicht: (2026)
MemoryFormer: Minimize Transformer Computation by Removing Fully-Connected Layers
von: Ding, Ning, et al.
Veröffentlicht: (2024)
von: Ding, Ning, et al.
Veröffentlicht: (2024)
CFBenchmark-MM: Chinese Financial Assistant Benchmark for Multimodal Large Language Model
von: Li, Jiangtong, et al.
Veröffentlicht: (2025)
von: Li, Jiangtong, et al.
Veröffentlicht: (2025)
From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs
von: Tian, Yuchuan, et al.
Veröffentlicht: (2025)
von: Tian, Yuchuan, et al.
Veröffentlicht: (2025)
Evaluating Knowledge-based Cross-lingual Inconsistency in Large Language Models
von: Xing, Xiaolin, et al.
Veröffentlicht: (2024)
von: Xing, Xiaolin, et al.
Veröffentlicht: (2024)
Entropy-Based Block Pruning for Efficient Large Language Models
von: Yang, Liangwei, et al.
Veröffentlicht: (2025)
von: Yang, Liangwei, et al.
Veröffentlicht: (2025)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
GhostNetV3: Exploring the Training Strategies for Compact Models
von: Liu, Zhenhua, et al.
Veröffentlicht: (2024)
von: Liu, Zhenhua, et al.
Veröffentlicht: (2024)
FMBench: Adaptive Large Language Model Output Formatting
von: Wang, Yaoting, et al.
Veröffentlicht: (2026)
von: Wang, Yaoting, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Multi-Granularity Semantic Revision for Large Language Model Distillation
von: Liu, Xiaoyu, et al.
Veröffentlicht: (2024) -
Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models
von: Tu, Zhijun, et al.
Veröffentlicht: (2025) -
Saliency-driven Dynamic Token Pruning for Large Language Models
von: Tao, Yao, et al.
Veröffentlicht: (2025) -
EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models
von: Ni, Yunsheng, et al.
Veröffentlicht: (2024) -
EAQuant: Enhancing Post-Training Quantization for MoE Models via Expert-Aware Optimization
von: Fu, Zhongqian, et al.
Veröffentlicht: (2025)