Superpipeline: A Universal Approach for Reducing GPU Memory Usage in Large Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Abbasi, Reza, Lim, Sernam |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GPU Memory Usage Optimization for Backward Propagation in Deep Network Training
por: Hong, Ding-Yong, et al.
Publicado: (2025)
por: Hong, Ding-Yong, et al.
Publicado: (2025)
LLMem: Estimating GPU Memory Usage for Fine-Tuning Pre-Trained LLMs
por: Kim, Taeho, et al.
Publicado: (2024)
por: Kim, Taeho, et al.
Publicado: (2024)
Tri-Accel: Curvature-Aware Precision-Adaptive and Memory-Elastic Optimization for Efficient GPU Usage
por: Sheibanian, Mohsen, et al.
Publicado: (2025)
por: Sheibanian, Mohsen, et al.
Publicado: (2025)
On the Universality of Transformer Architectures; How Much Attention Is Enough?
por: Abbasi, Amirreza, et al.
Publicado: (2025)
por: Abbasi, Amirreza, et al.
Publicado: (2025)
ZO2: Scalable Zeroth-Order Fine-Tuning for Extremely Large Language Models with Limited GPU Memory
por: Wang, Liangyu, et al.
Publicado: (2025)
por: Wang, Liangyu, et al.
Publicado: (2025)
Opportunities in deep learning methods development for computational biology
por: Lee, Alex Jihun, et al.
Publicado: (2024)
por: Lee, Alex Jihun, et al.
Publicado: (2024)
Expanding Sparse Tuning for Low Memory Usage
por: Shen, Shufan, et al.
Publicado: (2024)
por: Shen, Shufan, et al.
Publicado: (2024)
Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended
por: Kamath, Aditya K, et al.
Publicado: (2026)
por: Kamath, Aditya K, et al.
Publicado: (2026)
Mastering Memory Tasks with World Models
por: Samsami, Mohammad Reza, et al.
Publicado: (2024)
por: Samsami, Mohammad Reza, et al.
Publicado: (2024)
GPU Memory Prediction for Multimodal Model Training
por: Jeong, Jinwoo, et al.
Publicado: (2025)
por: Jeong, Jinwoo, et al.
Publicado: (2025)
MeMoir: A Software-Driven Covert Channel based on Memory Usage
por: Gonzalez-Gomez, Jeferson, et al.
Publicado: (2024)
por: Gonzalez-Gomez, Jeferson, et al.
Publicado: (2024)
Mind the Memory Gap: Unveiling GPU Bottlenecks in Large-Batch LLM Inference
por: Recasens, Pol G., et al.
Publicado: (2025)
por: Recasens, Pol G., et al.
Publicado: (2025)
Loki: Representation over Architecture for Diffusion-Based Portrait Animation
por: Navard, Pouyan, et al.
Publicado: (2026)
por: Navard, Pouyan, et al.
Publicado: (2026)
FloE: On-the-Fly MoE Inference on Memory-constrained GPU
por: Zhou, Yuxin, et al.
Publicado: (2025)
por: Zhou, Yuxin, et al.
Publicado: (2025)
Universality in Transfer Learning for Linear Models
por: Ghane, Reza, et al.
Publicado: (2024)
por: Ghane, Reza, et al.
Publicado: (2024)
Physical Activation Functions (PAFs): An Approach for More Efficient Induction of Physics into Physics-Informed Neural Networks (PINNs)
por: Abbasi, Jassem, et al.
Publicado: (2022)
por: Abbasi, Jassem, et al.
Publicado: (2022)
Scaling On-Device GPU Inference for Large Generative Models
por: Tang, Jiuqiang, et al.
Publicado: (2025)
por: Tang, Jiuqiang, et al.
Publicado: (2025)
Gaussian Universality for Diffusion Models
por: Ghane, Reza, et al.
Publicado: (2025)
por: Ghane, Reza, et al.
Publicado: (2025)
GPU-Fuzz: Finding Memory Errors in Deep Learning Frameworks
por: Li, Zihao, et al.
Publicado: (2026)
por: Li, Zihao, et al.
Publicado: (2026)
Ready2Unlearn: A Learning-Time Approach for Preparing Models with Future Unlearning Readiness
por: Duan, Hanyu, et al.
Publicado: (2025)
por: Duan, Hanyu, et al.
Publicado: (2025)
Machine Learning Applications to Computational Plasma Physics and Reduced-Order Plasma Modeling: A Perspective
por: Faraji, Farbod, et al.
Publicado: (2024)
por: Faraji, Farbod, et al.
Publicado: (2024)
xMem: A CPU-Based Approach for Accurate Estimation of GPU Memory in Deep Learning Training Workloads
por: Shi, Jiabo, et al.
Publicado: (2025)
por: Shi, Jiabo, et al.
Publicado: (2025)
Inverted Activations: Reducing Memory Footprint in Neural Network Training
por: Novikov, Georgii, et al.
Publicado: (2024)
por: Novikov, Georgii, et al.
Publicado: (2024)
Reducing Fine-Tuning Memory Overhead by Approximate and Memory-Sharing Backpropagation
por: Yang, Yuchen, et al.
Publicado: (2024)
por: Yang, Yuchen, et al.
Publicado: (2024)
GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models
por: Taneja, Maanas, et al.
Publicado: (2026)
por: Taneja, Maanas, et al.
Publicado: (2026)
Reinforcement Learning for Dynamic Memory Allocation
por: Lim, Arisrei, et al.
Publicado: (2024)
por: Lim, Arisrei, et al.
Publicado: (2024)
Mobility-Assisted Decentralized Federated Learning: Convergence Analysis and A Data-Driven Approach
por: Jahani, Reza, et al.
Publicado: (2025)
por: Jahani, Reza, et al.
Publicado: (2025)
Learning Latent Space Dynamics with Model-Form Uncertainties: A Stochastic Reduced-Order Modeling Approach
por: Yong, Jin Yi, et al.
Publicado: (2024)
por: Yong, Jin Yi, et al.
Publicado: (2024)
LLMPerf: GPU Performance Modeling meets Large Language Models
por: Nguyen, Khoi N. M., et al.
Publicado: (2025)
por: Nguyen, Khoi N. M., et al.
Publicado: (2025)
Parallel Track Transformers: Enabling Fast GPU Inference with Reduced Synchronization
por: Wang, Chong, et al.
Publicado: (2026)
por: Wang, Chong, et al.
Publicado: (2026)
Multi-Stage Prototype Learning for Interpretable Time Series Classification
por: Kalisetti, Bhavesh, et al.
Publicado: (2021)
por: Kalisetti, Bhavesh, et al.
Publicado: (2021)
Memory-Reduced Meta-Learning with Guaranteed Convergence
por: Yang, Honglin, et al.
Publicado: (2024)
por: Yang, Honglin, et al.
Publicado: (2024)
Semantic-Aware Scheduling for GPU Clusters with Large Language Models
por: Wang, Zerui, et al.
Publicado: (2025)
por: Wang, Zerui, et al.
Publicado: (2025)
Online Learning Models for Vehicle Usage Prediction During COVID-19
por: Lindroth, Tobias, et al.
Publicado: (2022)
por: Lindroth, Tobias, et al.
Publicado: (2022)
FRUGAL: Memory-Efficient Optimization by Reducing State Overhead for Scalable Training
por: Zmushko, Philip, et al.
Publicado: (2024)
por: Zmushko, Philip, et al.
Publicado: (2024)
Reducing Smoothness with Expressive Memory Enhanced Hierarchical Graph Neural Networks
por: Bailie, Thomas, et al.
Publicado: (2025)
por: Bailie, Thomas, et al.
Publicado: (2025)
The Mosaic Memory of Large Language Models
por: Shilov, Igor, et al.
Publicado: (2024)
por: Shilov, Igor, et al.
Publicado: (2024)
SoftDTW-CUDA-Torch: Memory-Efficient GPU-Accelerated Soft Dynamic Time Warping for PyTorch
por: Weber, Ron Shapira, et al.
Publicado: (2026)
por: Weber, Ron Shapira, et al.
Publicado: (2026)
LLM Enhancer: Merged Approach using Vector Embedding for Reducing Large Language Model Hallucinations with External Knowledge
por: Rayhan, Naheed, et al.
Publicado: (2025)
por: Rayhan, Naheed, et al.
Publicado: (2025)
PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU
por: Song, Yixin, et al.
Publicado: (2023)
por: Song, Yixin, et al.
Publicado: (2023)
Ejemplares similares
-
GPU Memory Usage Optimization for Backward Propagation in Deep Network Training
por: Hong, Ding-Yong, et al.
Publicado: (2025) -
LLMem: Estimating GPU Memory Usage for Fine-Tuning Pre-Trained LLMs
por: Kim, Taeho, et al.
Publicado: (2024) -
Tri-Accel: Curvature-Aware Precision-Adaptive and Memory-Elastic Optimization for Efficient GPU Usage
por: Sheibanian, Mohsen, et al.
Publicado: (2025) -
On the Universality of Transformer Architectures; How Much Attention Is Enough?
por: Abbasi, Amirreza, et al.
Publicado: (2025) -
ZO2: Scalable Zeroth-Order Fine-Tuning for Extremely Large Language Models with Limited GPU Memory
por: Wang, Liangyu, et al.
Publicado: (2025)