A Practical Tensor-Network Compression Pipeline for Production-Scale Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kozyrev, Sergii, Maiboroda, Davyd |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Diffusion Language Models for Speech Recognition
par: Naveriani, Davyd, et autres
Publié: (2026)
par: Naveriani, Davyd, et autres
Publié: (2026)
CompactifAI: Extreme Compression of Large Language Models using Quantum-Inspired Tensor Networks
par: Tomut, Andrei, et autres
Publié: (2024)
par: Tomut, Andrei, et autres
Publié: (2024)
Quantum Large Language Models via Tensor Network Disentanglers
par: Aizpurua, Borja, et autres
Publié: (2024)
par: Aizpurua, Borja, et autres
Publié: (2024)
Compressing Neural Networks Using Tensor Networks with Exponentially Fewer Variational Parameters
par: Qing, Yong, et autres
Publié: (2023)
par: Qing, Yong, et autres
Publié: (2023)
Automatically Differentiable Nonlinear Tensor Networks (ADNTNs) for Exponential Compression of Deep Neural Networks
par: Cichocki, Andrzej, et autres
Publié: (2026)
par: Cichocki, Andrzej, et autres
Publié: (2026)
A Systematic Study of Compression Ordering for Large Language Models
par: Chhawri, Shivansh, et autres
Publié: (2025)
par: Chhawri, Shivansh, et autres
Publié: (2025)
Automated Federated Pipeline for Parameter-Efficient Fine-Tuning of Large Language Models
par: Fang, Zihan, et autres
Publié: (2024)
par: Fang, Zihan, et autres
Publié: (2024)
FineZip : Pushing the Limits of Large Language Models for Practical Lossless Text Compression
par: Mittu, Fazal, et autres
Publié: (2024)
par: Mittu, Fazal, et autres
Publié: (2024)
Large Language Model Compression with Global Rank and Sparsity Optimization
par: Zhou, Changhai, et autres
Publié: (2025)
par: Zhou, Changhai, et autres
Publié: (2025)
Activation Sparsity Opportunities for Compressing General Large Language Models
par: Dhar, Nobel, et autres
Publié: (2024)
par: Dhar, Nobel, et autres
Publié: (2024)
On the Compressibility of Quantized Large Language Models
par: Mao, Yu, et autres
Publié: (2024)
par: Mao, Yu, et autres
Publié: (2024)
SeqMate: A Novel Large Language Model Pipeline for Automating RNA Sequencing
par: Mondal, Devam, et autres
Publié: (2024)
par: Mondal, Devam, et autres
Publié: (2024)
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
par: Zhou, Longsheng, et autres
Publié: (2026)
par: Zhou, Longsheng, et autres
Publié: (2026)
CoSA: Compressed Sensing-Based Adaptation of Large Language Models
par: Wei, Songtao, et autres
Publié: (2026)
par: Wei, Songtao, et autres
Publié: (2026)
GWT: Scalable Optimizer State Compression for Large Language Model Training
par: Wen, Ziqing, et autres
Publié: (2025)
par: Wen, Ziqing, et autres
Publié: (2025)
Collaborative Compression for Large-Scale MoE Deployment on Edge
par: Chen, Yixiao, et autres
Publié: (2025)
par: Chen, Yixiao, et autres
Publié: (2025)
PalmBench: A Comprehensive Benchmark of Compressed Large Language Models on Mobile Platforms
par: Li, Yilong, et autres
Publié: (2024)
par: Li, Yilong, et autres
Publié: (2024)
NoWag: A Unified Framework for Shape Preserving Compression of Large Language Models
par: Liu, Lawrence, et autres
Publié: (2025)
par: Liu, Lawrence, et autres
Publié: (2025)
Control of Overfitting with Physics
par: Kozyrev, Sergei V., et autres
Publié: (2024)
par: Kozyrev, Sergei V., et autres
Publié: (2024)
TEON: Tensorized Orthonormalization Beyond Layer-Wise Muon for Large Language Model Pre-Training
par: Zhang, Ruijie, et autres
Publié: (2026)
par: Zhang, Ruijie, et autres
Publié: (2026)
Rethinking Key-Value Cache Compression Techniques for Large Language Model Serving
par: Gao, Wei, et autres
Publié: (2025)
par: Gao, Wei, et autres
Publié: (2025)
Lillama: Large Language Models Compression via Low-Rank Feature Distillation
par: Sy, Yaya, et autres
Publié: (2024)
par: Sy, Yaya, et autres
Publié: (2024)
Practical FP4 Training for Large-Scale MoE Models on Hopper GPUs
par: Zhang, Wuyue, et autres
Publié: (2026)
par: Zhang, Wuyue, et autres
Publié: (2026)
A Scalable Pipeline for Estimating Verb Frame Frequencies Using Large Language Models
par: Morgan, Adam M., et autres
Publié: (2025)
par: Morgan, Adam M., et autres
Publié: (2025)
RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs
par: Zhou, Runlong, et autres
Publié: (2025)
par: Zhou, Runlong, et autres
Publié: (2025)
Automated Attention Pattern Discovery at Scale in Large Language Models
par: Katzy, Jonathan, et autres
Publié: (2026)
par: Katzy, Jonathan, et autres
Publié: (2026)
Scaling and Transferability of Annealing Strategies in Large Language Model Training
par: Wang, Siqi, et autres
Publié: (2025)
par: Wang, Siqi, et autres
Publié: (2025)
CALR: Corrective Adaptive Low-Rank Decomposition for Efficient Large Language Model Layer Compression
par: Kautsar, Muchammad Daniyal, et autres
Publié: (2025)
par: Kautsar, Muchammad Daniyal, et autres
Publié: (2025)
Decision Potential Surface: A Theoretical and Practical Approximation of Large Language Model Decision Boundary
par: Liang, Zi, et autres
Publié: (2025)
par: Liang, Zi, et autres
Publié: (2025)
Mixture of Latent Experts Using Tensor Products
par: Su, Zhan, et autres
Publié: (2024)
par: Su, Zhan, et autres
Publié: (2024)
When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models
par: Zhang, Nan, et autres
Publié: (2025)
par: Zhang, Nan, et autres
Publié: (2025)
Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover
par: Halder, Indranil, et autres
Publié: (2026)
par: Halder, Indranil, et autres
Publié: (2026)
Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models
par: Wang, Mingze, et autres
Publié: (2026)
par: Wang, Mingze, et autres
Publié: (2026)
Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models
par: Shu, Yao, et autres
Publié: (2024)
par: Shu, Yao, et autres
Publié: (2024)
Scaling Capability in Token Space: An Analysis of Large Vision Language Model
par: Li, Tenghui, et autres
Publié: (2024)
par: Li, Tenghui, et autres
Publié: (2024)
Clustering-driven Memory Compression for On-device Large Language Models
par: Bohdal, Ondrej, et autres
Publié: (2026)
par: Bohdal, Ondrej, et autres
Publié: (2026)
In-context Autoencoder for Context Compression in a Large Language Model
par: Ge, Tao, et autres
Publié: (2023)
par: Ge, Tao, et autres
Publié: (2023)
Communication Compression for Tensor Parallel LLM Inference
par: Hansen-Palmus, Jan, et autres
Publié: (2024)
par: Hansen-Palmus, Jan, et autres
Publié: (2024)
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
par: Ma, Shaobo, et autres
Publié: (2024)
par: Ma, Shaobo, et autres
Publié: (2024)
Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models
par: Chekalina, Viktoriia, et autres
Publié: (2025)
par: Chekalina, Viktoriia, et autres
Publié: (2025)
Documents similaires
-
Diffusion Language Models for Speech Recognition
par: Naveriani, Davyd, et autres
Publié: (2026) -
CompactifAI: Extreme Compression of Large Language Models using Quantum-Inspired Tensor Networks
par: Tomut, Andrei, et autres
Publié: (2024) -
Quantum Large Language Models via Tensor Network Disentanglers
par: Aizpurua, Borja, et autres
Publié: (2024) -
Compressing Neural Networks Using Tensor Networks with Exponentially Fewer Variational Parameters
par: Qing, Yong, et autres
Publié: (2023) -
Automatically Differentiable Nonlinear Tensor Networks (ADNTNs) for Exponential Compression of Deep Neural Networks
par: Cichocki, Andrzej, et autres
Publié: (2026)