DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | An, Hyeonjun, Kim, Sihyun, Lim, Chaerim, Kim, Hyunjoon, Sen, Rathijit, Jung, Sangmin, Lee, Hyeonsoo, Kim, Dongwook, Yu, Takki, Jeong, Jinkyu, Kim, Youngsok, Park, Kwanghyun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GraNNDis: Efficient Unified Distributed Training Framework for Deep GNNs on Large Clusters
di: Song, Jaeyong, et al.
Pubblicazione: (2023)
di: Song, Jaeyong, et al.
Pubblicazione: (2023)
AGAThA: Fast and Efficient GPU Acceleration of Guided Sequence Alignment for Long Read Mapping
di: Park, Seongyeon, et al.
Pubblicazione: (2024)
di: Park, Seongyeon, et al.
Pubblicazione: (2024)
Zorse: Optimizing LLM Training Efficiency on Heterogeneous GPU Clusters
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2025)
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2025)
Exqutor: Extended Query Optimizer for Vector-augmented Analytical Queries
di: Kim, Hyunjoon, et al.
Pubblicazione: (2025)
di: Kim, Hyunjoon, et al.
Pubblicazione: (2025)
PID-Comm: A Fast and Flexible Collective Communication Framework for Commodity Processing-in-DIMM Devices
di: Noh, Si Ung, et al.
Pubblicazione: (2024)
di: Noh, Si Ung, et al.
Pubblicazione: (2024)
SpotVista: Availability-Aware Recommendation System for Reliable and Cost-Efficient Multi-Node Spot Instances
di: Kim, Taeyoon, et al.
Pubblicazione: (2026)
di: Kim, Taeyoon, et al.
Pubblicazione: (2026)
PrefillShare: A Shared Prefill Module for KV Reuse in Multi-LLM Disaggregated Serving
di: Woo, Sunghyeon, et al.
Pubblicazione: (2026)
di: Woo, Sunghyeon, et al.
Pubblicazione: (2026)
TimelyFreeze: Adaptive Parameter Freezing Mechanism for Pipeline Parallelism
di: Cho, Seonghye, et al.
Pubblicazione: (2026)
di: Cho, Seonghye, et al.
Pubblicazione: (2026)
Terabyte-Scale Analytics in the Blink of an Eye
di: Wu, Bowen, et al.
Pubblicazione: (2025)
di: Wu, Bowen, et al.
Pubblicazione: (2025)
DeepVM: Integrating Spot and On-Demand VMs for Cost-Efficient Deep Learning Clusters in the Cloud
di: Kim, Yoochan, et al.
Pubblicazione: (2024)
di: Kim, Yoochan, et al.
Pubblicazione: (2024)
Ding-Dong Ditch: Peeking Into Spot Instance Availability
di: Kim, Kyumin, et al.
Pubblicazione: (2026)
di: Kim, Kyumin, et al.
Pubblicazione: (2026)
TraCT: Disaggregated LLM Serving with CXL Shared Memory KV Cache at Rack-Scale
di: Yoon, Dongha, et al.
Pubblicazione: (2025)
di: Yoon, Dongha, et al.
Pubblicazione: (2025)
HetCCL: Accelerating LLM Training with Heterogeneous GPUs
di: Kim, Heehoon, et al.
Pubblicazione: (2026)
di: Kim, Heehoon, et al.
Pubblicazione: (2026)
KubePACS: Kubernetes Cluster Using Performant, Highly Available, and Cost Efficient Spot Instances
di: Kim, Taeyoon, et al.
Pubblicazione: (2026)
di: Kim, Taeyoon, et al.
Pubblicazione: (2026)
Pairbot: A Novel Model for Autonomous Mobile Robot Systems Consisting of Paired Robots
di: Kim, Yonghwan, et al.
Pubblicazione: (2020)
di: Kim, Yonghwan, et al.
Pubblicazione: (2020)
Are Your Epochs Too Epic? Batch Free Can Be Harmful
di: Kim, Daewoo, et al.
Pubblicazione: (2024)
di: Kim, Daewoo, et al.
Pubblicazione: (2024)
Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation
di: Wu, Tianyuan, et al.
Pubblicazione: (2025)
di: Wu, Tianyuan, et al.
Pubblicazione: (2025)
DiffusionPipe: Training Large Diffusion Models with Efficient Pipelines
di: Tian, Ye, et al.
Pubblicazione: (2024)
di: Tian, Ye, et al.
Pubblicazione: (2024)
Cost-Efficient LLM Serving in the Cloud: VM Selection with KV Cache Offloading
di: Kim, Kihyun, et al.
Pubblicazione: (2025)
di: Kim, Kihyun, et al.
Pubblicazione: (2025)
Dooly: Configuration-Agnostic, Redundancy-Aware Profiling for LLM Inference Simulation
di: Kim, Joon Ha, et al.
Pubblicazione: (2026)
di: Kim, Joon Ha, et al.
Pubblicazione: (2026)
A Case Study of API Design for Interoperability and Security of the Internet of Things
di: Kim, Dongha, et al.
Pubblicazione: (2024)
di: Kim, Dongha, et al.
Pubblicazione: (2024)
Pipette: Automatic Fine-grained Large Language Model Training Configurator for Real-World Clusters
di: Yim, Jinkyu, et al.
Pubblicazione: (2024)
di: Yim, Jinkyu, et al.
Pubblicazione: (2024)
ScalePool: Hybrid XLink-CXL Fabric for Composable Resource Disaggregation in Unified Scale-up Domains
di: Woo, Hyein, et al.
Pubblicazione: (2025)
di: Woo, Hyein, et al.
Pubblicazione: (2025)
TAPAAL SMC: Statistical Model Checking of Stochastic Timed-Arc Petri Nets
di: Dubois, Tanguy, et al.
Pubblicazione: (2026)
di: Dubois, Tanguy, et al.
Pubblicazione: (2026)
HE2C: A Holistic Approach for Allocating Latency-Sensitive AI Tasks across Edge-Cloud
di: Kim, Minseo, et al.
Pubblicazione: (2024)
di: Kim, Minseo, et al.
Pubblicazione: (2024)
FlashSketch: Sketch-Kernel Co-Design for Fast Sparse Sketching on GPUs
di: Dwaraknath, Rajat Vadiraj, et al.
Pubblicazione: (2026)
di: Dwaraknath, Rajat Vadiraj, et al.
Pubblicazione: (2026)
PathWeaver: A High-Throughput Multi-GPU System for Graph-Based Approximate Nearest Neighbor Search
di: Kim, Sukjin, et al.
Pubblicazione: (2025)
di: Kim, Sukjin, et al.
Pubblicazione: (2025)
CrossPipe: Towards Optimal Pipeline Schedules for Cross-Datacenter Training
di: Chen, Tiancheng, et al.
Pubblicazione: (2025)
di: Chen, Tiancheng, et al.
Pubblicazione: (2025)
A Flexible Programmable Pipeline Parallelism Framework for Efficient DNN Training
di: Jiang, Lijuan, et al.
Pubblicazione: (2025)
di: Jiang, Lijuan, et al.
Pubblicazione: (2025)
DawnPiper: A Memory-scablable Pipeline Parallel Training Framework
di: Peng, Xuan, et al.
Pubblicazione: (2025)
di: Peng, Xuan, et al.
Pubblicazione: (2025)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
di: Li, Shiju, et al.
Pubblicazione: (2025)
di: Li, Shiju, et al.
Pubblicazione: (2025)
MPI-over-CXL: Enhancing Communication Efficiency in Distributed HPC Systems
di: Kwon, Miryeong, et al.
Pubblicazione: (2025)
di: Kwon, Miryeong, et al.
Pubblicazione: (2025)
TensorSocket: Shared Data Loading for Deep Learning Training
di: Robroek, Ties, et al.
Pubblicazione: (2024)
di: Robroek, Ties, et al.
Pubblicazione: (2024)
DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline
di: Xue, Zhenliang, et al.
Pubblicazione: (2025)
di: Xue, Zhenliang, et al.
Pubblicazione: (2025)
Revisiting Early-Learning Regularization When Federated Learning Meets Noisy Labels
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
JanusPipe: Efficient Pipeline Parallel Training for Machine Learning Interatomic Potentials
di: Wang, Hongyu, et al.
Pubblicazione: (2026)
di: Wang, Hongyu, et al.
Pubblicazione: (2026)
GCAPS: GPU Context-Aware Preemptive Priority-based Scheduling for Real-Time Tasks
di: Wang, Yidi, et al.
Pubblicazione: (2024)
di: Wang, Yidi, et al.
Pubblicazione: (2024)
Generative Artificial Intelligence Reproducibility and Consensus
di: Kim, Edward, et al.
Pubblicazione: (2023)
di: Kim, Edward, et al.
Pubblicazione: (2023)
GriNNder: Breaking the Memory Capacity Wall in Full-Graph GNN Training with Storage Offloading
di: Song, Jaeyong, et al.
Pubblicazione: (2026)
di: Song, Jaeyong, et al.
Pubblicazione: (2026)
LUT-GEMM: Quantized Matrix Multiplication based on LUTs for Efficient Inference in Large-Scale Generative Language Models
di: Park, Gunho, et al.
Pubblicazione: (2022)
di: Park, Gunho, et al.
Pubblicazione: (2022)
Documenti analoghi
-
GraNNDis: Efficient Unified Distributed Training Framework for Deep GNNs on Large Clusters
di: Song, Jaeyong, et al.
Pubblicazione: (2023) -
AGAThA: Fast and Efficient GPU Acceleration of Guided Sequence Alignment for Long Read Mapping
di: Park, Seongyeon, et al.
Pubblicazione: (2024) -
Zorse: Optimizing LLM Training Efficiency on Heterogeneous GPU Clusters
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2025) -
Exqutor: Extended Query Optimizer for Vector-augmented Analytical Queries
di: Kim, Hyunjoon, et al.
Pubblicazione: (2025) -
PID-Comm: A Fast and Flexible Collective Communication Framework for Commodity Processing-in-DIMM Devices
di: Noh, Si Ung, et al.
Pubblicazione: (2024)