A Survey on Transformer Compression
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Yehui, Wang, Yunhe, Guo, Jianyuan, Tu, Zhijun, Han, Kai, Hu, Hailin, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
par: Jie, Shibo, et autres
Publié: (2024)
par: Jie, Shibo, et autres
Publié: (2024)
SLAB: Efficient Transformers with Simplified Linear Attention and Progressive Re-parameterized Batch Normalization
par: Guo, Jialong, et autres
Publié: (2024)
par: Guo, Jialong, et autres
Publié: (2024)
Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning
par: Jie, Shibo, et autres
Publié: (2024)
par: Jie, Shibo, et autres
Publié: (2024)
SAM-DiffSR: Structure-Modulated Diffusion Model for Image Super-Resolution
par: Wang, Chengcheng, et autres
Publié: (2024)
par: Wang, Chengcheng, et autres
Publié: (2024)
ScaleNet: Scaling up Pretrained Neural Networks with Incremental Parameters
par: Hao, Zhiwei, et autres
Publié: (2025)
par: Hao, Zhiwei, et autres
Publié: (2025)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
par: Han, Kai, et autres
Publié: (2024)
par: Han, Kai, et autres
Publié: (2024)
Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding
par: Xiao, Zhongyu, et autres
Publié: (2026)
par: Xiao, Zhongyu, et autres
Publié: (2026)
White-Box Transformers via Sparse Rate Reduction: Compression Is All There Is?
par: Yu, Yaodong, et autres
Publié: (2023)
par: Yu, Yaodong, et autres
Publié: (2023)
A Survey on Data Augmentation in Large Model Era
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
ParameterNet: Parameters Are All You Need
par: Han, Kai, et autres
Publié: (2023)
par: Han, Kai, et autres
Publié: (2023)
Matryoshka Query Transformer for Large Vision-Language Models
par: Hu, Wenbo, et autres
Publié: (2024)
par: Hu, Wenbo, et autres
Publié: (2024)
Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies
par: Pathak, Surendra, et autres
Publié: (2026)
par: Pathak, Surendra, et autres
Publié: (2026)
Breaking through the learning plateaus of in-context learning in Transformer
par: Fu, Jingwen, et autres
Publié: (2023)
par: Fu, Jingwen, et autres
Publié: (2023)
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
par: Yang, Enneng, et autres
Publié: (2024)
par: Yang, Enneng, et autres
Publié: (2024)
Glyph: Scaling Context Windows via Visual-Text Compression
par: Cheng, Jiale, et autres
Publié: (2025)
par: Cheng, Jiale, et autres
Publié: (2025)
Diffusion Model-Based Video Editing: A Survey
par: Sun, Wenhao, et autres
Publié: (2024)
par: Sun, Wenhao, et autres
Publié: (2024)
S-GRPO: Unified Post-Training for Large Vision-Language Models
par: Yan, Yuming, et autres
Publié: (2026)
par: Yan, Yuming, et autres
Publié: (2026)
Efficient Scaling of Diffusion Transformers for Text-to-Image Generation
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
GhostNetV3: Exploring the Training Strategies for Compact Models
par: Liu, Zhenhua, et autres
Publié: (2024)
par: Liu, Zhenhua, et autres
Publié: (2024)
State Space Model for New-Generation Network Alternative to Transformers: A Survey
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
A Survey on Hallucination in Large Vision-Language Models
par: Liu, Hanchao, et autres
Publié: (2024)
par: Liu, Hanchao, et autres
Publié: (2024)
CRA5: Extreme Compression of ERA5 for Portable Global Climate and Weather Research via an Efficient Variational Transformer
par: Han, Tao, et autres
Publié: (2024)
par: Han, Tao, et autres
Publié: (2024)
Data-efficient Large Vision Models through Sequential Autoregression
par: Guo, Jianyuan, et autres
Publié: (2024)
par: Guo, Jianyuan, et autres
Publié: (2024)
TWEO: Transformers Without Extreme Outliers Enables FP8 Training And Quantization For Dummies
par: Liang, Guang, et autres
Publié: (2025)
par: Liang, Guang, et autres
Publié: (2025)
Optical Context Compression Is Just (Bad) Autoencoding
par: Lee, Ivan Yee, et autres
Publié: (2025)
par: Lee, Ivan Yee, et autres
Publié: (2025)
AMU-Tuning: Effective Logit Bias for CLIP-based Few-shot Learning
par: Tang, Yuwei, et autres
Publié: (2024)
par: Tang, Yuwei, et autres
Publié: (2024)
A Survey of Mix-based Data Augmentation: Taxonomy, Methods, Applications, and Explainability
par: Cao, Chengtai, et autres
Publié: (2022)
par: Cao, Chengtai, et autres
Publié: (2022)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
par: Chen, Yangyi, et autres
Publié: (2024)
par: Chen, Yangyi, et autres
Publié: (2024)
General Transform: A Unified Framework for Adaptive Transform to Enhance Representations
par: Budiutama, Gekko, et autres
Publié: (2025)
par: Budiutama, Gekko, et autres
Publié: (2025)
Prism: A Plug-in Reproducible Infrastructure for Scalable Multimodal Continual Instruction Tuning
par: Tang, Jun-Tao, et autres
Publié: (2026)
par: Tang, Jun-Tao, et autres
Publié: (2026)
Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Multimodal Information Fusion for Chart Understanding: A Survey of MLLMs -- Evolution, Limitations, and Cognitive Enhancement
par: Yi, Zhihang, et autres
Publié: (2026)
par: Yi, Zhihang, et autres
Publié: (2026)
CTP: A hybrid CNN-Transformer-PINN model for ocean front forecasting
par: Wang, Yishuo, et autres
Publié: (2025)
par: Wang, Yishuo, et autres
Publié: (2025)
Transformer-VQ: Linear-Time Transformers via Vector Quantization
par: Lingle, Lucas D.
Publié: (2023)
par: Lingle, Lucas D.
Publié: (2023)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
par: Zhang, Jingyi, et autres
Publié: (2025)
par: Zhang, Jingyi, et autres
Publié: (2025)
GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection
par: Ni, Zhenliang, et autres
Publié: (2025)
par: Ni, Zhenliang, et autres
Publié: (2025)
Transformers are Stateless Differentiable Neural Computers
par: Tang, Bo, et autres
Publié: (2026)
par: Tang, Bo, et autres
Publié: (2026)
An Empirical Study of World Model Quantization
par: Fu, Zhongqian, et autres
Publié: (2026)
par: Fu, Zhongqian, et autres
Publié: (2026)
A U-Net and Transformer Pipeline for Multilingual Image Translation
par: Sahay, Siddharth, et autres
Publié: (2025)
par: Sahay, Siddharth, et autres
Publié: (2025)
OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use
par: Hu, Xueyu, et autres
Publié: (2025)
par: Hu, Xueyu, et autres
Publié: (2025)
Documents similaires
-
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
par: Jie, Shibo, et autres
Publié: (2024) -
SLAB: Efficient Transformers with Simplified Linear Attention and Progressive Re-parameterized Batch Normalization
par: Guo, Jialong, et autres
Publié: (2024) -
Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning
par: Jie, Shibo, et autres
Publié: (2024) -
SAM-DiffSR: Structure-Modulated Diffusion Model for Image Super-Resolution
par: Wang, Chengcheng, et autres
Publié: (2024) -
ScaleNet: Scaling up Pretrained Neural Networks with Incremental Parameters
par: Hao, Zhiwei, et autres
Publié: (2025)