FoldGPT: Simple and Effective Large Language Model Compression Scheme
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Songwei, Zeng, Chao, Li, Lianqiang, Yan, Chenqian, Fu, Lean, Mei, Xing, Chen, Fangmin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GQSA: Group Quantization and Sparsity for Accelerating Large Language Model Inference
by: Zeng, Chao, et al.
Published: (2024)
by: Zeng, Chao, et al.
Published: (2024)
Hybrid SD: Edge-Cloud Collaborative Inference for Stable Diffusion Models
by: Yan, Chenqian, et al.
Published: (2024)
by: Yan, Chenqian, et al.
Published: (2024)
Error Propagation Mechanisms and Compensation Strategies for Quantized Diffusion
by: Liu, Songwei, et al.
Published: (2025)
by: Liu, Songwei, et al.
Published: (2025)
S2O: Early Stopping for Sparse Attention via Online Permutation
by: Zhang, Yu, et al.
Published: (2026)
by: Zhang, Yu, et al.
Published: (2026)
ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models
by: Zeng, Chao, et al.
Published: (2024)
by: Zeng, Chao, et al.
Published: (2024)
Differentiable Search for Finding Optimal Quantization Strategy
by: Li, Lianqiang, et al.
Published: (2024)
by: Li, Lianqiang, et al.
Published: (2024)
SliceGPT: Compress Large Language Models by Deleting Rows and Columns
by: Ashkboos, Saleh, et al.
Published: (2024)
by: Ashkboos, Saleh, et al.
Published: (2024)
A Simple and Effective Pruning Approach for Large Language Models
by: Sun, Mingjie, et al.
Published: (2023)
by: Sun, Mingjie, et al.
Published: (2023)
An Examination on the Effectiveness of Divide-and-Conquer Prompting in Large Language Models
by: Zhang, Yizhou, et al.
Published: (2024)
by: Zhang, Yizhou, et al.
Published: (2024)
Basis Sharing: Cross-Layer Parameter Sharing for Large Language Model Compression
by: Wang, Jingcun, et al.
Published: (2024)
by: Wang, Jingcun, et al.
Published: (2024)
CogGPT: Unleashing the Power of Cognitive Dynamics on Large Language Models
by: Lv, Yaojia, et al.
Published: (2024)
by: Lv, Yaojia, et al.
Published: (2024)
Simple and Effective Masked Diffusion Language Models
by: Sahoo, Subham Sekhar, et al.
Published: (2024)
by: Sahoo, Subham Sekhar, et al.
Published: (2024)
SimpleGPT: Improving GPT via A Simple Normalization Strategy
by: Chen, Marco, et al.
Published: (2026)
by: Chen, Marco, et al.
Published: (2026)
MoDeGPT: Modular Decomposition for Large Language Model Compression
by: Lin, Chi-Heng, et al.
Published: (2024)
by: Lin, Chi-Heng, et al.
Published: (2024)
ClinicalAgent: Clinical Trial Multi-Agent System with Large Language Model-based Reasoning
by: Yue, Ling, et al.
Published: (2024)
by: Yue, Ling, et al.
Published: (2024)
SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator
by: Chen, Guoxuan, et al.
Published: (2024)
by: Chen, Guoxuan, et al.
Published: (2024)
TrialEnroll: Predicting Clinical Trial Enrollment Success with Deep & Cross Network and Large Language Models
by: Yue, Ling, et al.
Published: (2024)
by: Yue, Ling, et al.
Published: (2024)
TensorGPT: Efficient Compression of Large Language Models based on Tensor-Train Decomposition
by: Xu, Mingxue, et al.
Published: (2023)
by: Xu, Mingxue, et al.
Published: (2023)
HiGPT: Heterogeneous Graph Language Model
by: Tang, Jiabin, et al.
Published: (2024)
by: Tang, Jiabin, et al.
Published: (2024)
TWIN-GPT: Digital Twins for Clinical Trials via Large Language Model
by: Wang, Yue, et al.
Published: (2024)
by: Wang, Yue, et al.
Published: (2024)
PPC-GPT: Federated Task-Specific Compression of Large Language Models via Pruning and Chain-of-Thought Distillation
by: Fan, Tao, et al.
Published: (2025)
by: Fan, Tao, et al.
Published: (2025)
ArabianGPT: Native Arabic GPT-based Large Language Model
by: Koubaa, Anis, et al.
Published: (2024)
by: Koubaa, Anis, et al.
Published: (2024)
Simple Is Effective: The Roles of Graphs and Large Language Models in Knowledge-Graph-Based Retrieval-Augmented Generation
by: Li, Mufei, et al.
Published: (2024)
by: Li, Mufei, et al.
Published: (2024)
Reasoning is Periodicity? Improving Large Language Models Through Effective Periodicity Modeling
by: Dong, Yihong, et al.
Published: (2025)
by: Dong, Yihong, et al.
Published: (2025)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
by: Jain, Neel, et al.
Published: (2024)
by: Jain, Neel, et al.
Published: (2024)
SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling
by: Kim, Dahyun, et al.
Published: (2023)
by: Kim, Dahyun, et al.
Published: (2023)
On the Compressibility of Quantized Large Language Models
by: Mao, Yu, et al.
Published: (2024)
by: Mao, Yu, et al.
Published: (2024)
CityGPT: Empowering Urban Spatial Cognition of Large Language Models
by: Feng, Jie, et al.
Published: (2024)
by: Feng, Jie, et al.
Published: (2024)
Proxy Compression for Language Modeling
by: Zheng, Lin, et al.
Published: (2026)
by: Zheng, Lin, et al.
Published: (2026)
Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling
by: Ren, Liliang, et al.
Published: (2024)
by: Ren, Liliang, et al.
Published: (2024)
Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting
by: Qin, Zhen, et al.
Published: (2023)
by: Qin, Zhen, et al.
Published: (2023)
Radio: Rate-Distortion Optimization for Large Language Model Compression
by: Young, Sean I.
Published: (2025)
by: Young, Sean I.
Published: (2025)
Extreme Compression of Large Language Models via Additive Quantization
by: Egiazarian, Vage, et al.
Published: (2024)
by: Egiazarian, Vage, et al.
Published: (2024)
DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization
by: Liu, Xuefeng, et al.
Published: (2025)
by: Liu, Xuefeng, et al.
Published: (2025)
In-context Autoencoder for Context Compression in a Large Language Model
by: Ge, Tao, et al.
Published: (2023)
by: Ge, Tao, et al.
Published: (2023)
ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion
by: Peng, Xurui, et al.
Published: (2025)
by: Peng, Xurui, et al.
Published: (2025)
Learning to Compress Prompt in Natural Language Formats
by: Chuang, Yu-Neng, et al.
Published: (2024)
by: Chuang, Yu-Neng, et al.
Published: (2024)
FinGPT: Open-Source Financial Large Language Models
by: Yang, Hongyang, et al.
Published: (2023)
by: Yang, Hongyang, et al.
Published: (2023)
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
by: Zhu, Mingcheng, et al.
Published: (2026)
by: Zhu, Mingcheng, et al.
Published: (2026)
Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models
by: Han, Zongbo, et al.
Published: (2024)
by: Han, Zongbo, et al.
Published: (2024)
Similar Items
-
GQSA: Group Quantization and Sparsity for Accelerating Large Language Model Inference
by: Zeng, Chao, et al.
Published: (2024) -
Hybrid SD: Edge-Cloud Collaborative Inference for Stable Diffusion Models
by: Yan, Chenqian, et al.
Published: (2024) -
Error Propagation Mechanisms and Compensation Strategies for Quantized Diffusion
by: Liu, Songwei, et al.
Published: (2025) -
S2O: Early Stopping for Sparse Attention via Online Permutation
by: Zhang, Yu, et al.
Published: (2026) -
ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models
by: Zeng, Chao, et al.
Published: (2024)