DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | An, Hyeonjun, Kim, Sihyun, Lim, Chaerim, Kim, Hyunjoon, Sen, Rathijit, Jung, Sangmin, Lee, Hyeonsoo, Kim, Dongwook, Yu, Takki, Jeong, Jinkyu, Kim, Youngsok, Park, Kwanghyun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GraNNDis: Efficient Unified Distributed Training Framework for Deep GNNs on Large Clusters
par: Song, Jaeyong, et autres
Publié: (2023)
par: Song, Jaeyong, et autres
Publié: (2023)
AGAThA: Fast and Efficient GPU Acceleration of Guided Sequence Alignment for Long Read Mapping
par: Park, Seongyeon, et autres
Publié: (2024)
par: Park, Seongyeon, et autres
Publié: (2024)
Zorse: Optimizing LLM Training Efficiency on Heterogeneous GPU Clusters
par: Guo, Runsheng Benson, et autres
Publié: (2025)
par: Guo, Runsheng Benson, et autres
Publié: (2025)
Exqutor: Extended Query Optimizer for Vector-augmented Analytical Queries
par: Kim, Hyunjoon, et autres
Publié: (2025)
par: Kim, Hyunjoon, et autres
Publié: (2025)
PID-Comm: A Fast and Flexible Collective Communication Framework for Commodity Processing-in-DIMM Devices
par: Noh, Si Ung, et autres
Publié: (2024)
par: Noh, Si Ung, et autres
Publié: (2024)
SpotVista: Availability-Aware Recommendation System for Reliable and Cost-Efficient Multi-Node Spot Instances
par: Kim, Taeyoon, et autres
Publié: (2026)
par: Kim, Taeyoon, et autres
Publié: (2026)
PrefillShare: A Shared Prefill Module for KV Reuse in Multi-LLM Disaggregated Serving
par: Woo, Sunghyeon, et autres
Publié: (2026)
par: Woo, Sunghyeon, et autres
Publié: (2026)
TimelyFreeze: Adaptive Parameter Freezing Mechanism for Pipeline Parallelism
par: Cho, Seonghye, et autres
Publié: (2026)
par: Cho, Seonghye, et autres
Publié: (2026)
Terabyte-Scale Analytics in the Blink of an Eye
par: Wu, Bowen, et autres
Publié: (2025)
par: Wu, Bowen, et autres
Publié: (2025)
DeepVM: Integrating Spot and On-Demand VMs for Cost-Efficient Deep Learning Clusters in the Cloud
par: Kim, Yoochan, et autres
Publié: (2024)
par: Kim, Yoochan, et autres
Publié: (2024)
Ding-Dong Ditch: Peeking Into Spot Instance Availability
par: Kim, Kyumin, et autres
Publié: (2026)
par: Kim, Kyumin, et autres
Publié: (2026)
TraCT: Disaggregated LLM Serving with CXL Shared Memory KV Cache at Rack-Scale
par: Yoon, Dongha, et autres
Publié: (2025)
par: Yoon, Dongha, et autres
Publié: (2025)
HetCCL: Accelerating LLM Training with Heterogeneous GPUs
par: Kim, Heehoon, et autres
Publié: (2026)
par: Kim, Heehoon, et autres
Publié: (2026)
KubePACS: Kubernetes Cluster Using Performant, Highly Available, and Cost Efficient Spot Instances
par: Kim, Taeyoon, et autres
Publié: (2026)
par: Kim, Taeyoon, et autres
Publié: (2026)
Pairbot: A Novel Model for Autonomous Mobile Robot Systems Consisting of Paired Robots
par: Kim, Yonghwan, et autres
Publié: (2020)
par: Kim, Yonghwan, et autres
Publié: (2020)
Are Your Epochs Too Epic? Batch Free Can Be Harmful
par: Kim, Daewoo, et autres
Publié: (2024)
par: Kim, Daewoo, et autres
Publié: (2024)
Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation
par: Wu, Tianyuan, et autres
Publié: (2025)
par: Wu, Tianyuan, et autres
Publié: (2025)
DiffusionPipe: Training Large Diffusion Models with Efficient Pipelines
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
Cost-Efficient LLM Serving in the Cloud: VM Selection with KV Cache Offloading
par: Kim, Kihyun, et autres
Publié: (2025)
par: Kim, Kihyun, et autres
Publié: (2025)
Dooly: Configuration-Agnostic, Redundancy-Aware Profiling for LLM Inference Simulation
par: Kim, Joon Ha, et autres
Publié: (2026)
par: Kim, Joon Ha, et autres
Publié: (2026)
A Case Study of API Design for Interoperability and Security of the Internet of Things
par: Kim, Dongha, et autres
Publié: (2024)
par: Kim, Dongha, et autres
Publié: (2024)
Pipette: Automatic Fine-grained Large Language Model Training Configurator for Real-World Clusters
par: Yim, Jinkyu, et autres
Publié: (2024)
par: Yim, Jinkyu, et autres
Publié: (2024)
ScalePool: Hybrid XLink-CXL Fabric for Composable Resource Disaggregation in Unified Scale-up Domains
par: Woo, Hyein, et autres
Publié: (2025)
par: Woo, Hyein, et autres
Publié: (2025)
TAPAAL SMC: Statistical Model Checking of Stochastic Timed-Arc Petri Nets
par: Dubois, Tanguy, et autres
Publié: (2026)
par: Dubois, Tanguy, et autres
Publié: (2026)
HE2C: A Holistic Approach for Allocating Latency-Sensitive AI Tasks across Edge-Cloud
par: Kim, Minseo, et autres
Publié: (2024)
par: Kim, Minseo, et autres
Publié: (2024)
FlashSketch: Sketch-Kernel Co-Design for Fast Sparse Sketching on GPUs
par: Dwaraknath, Rajat Vadiraj, et autres
Publié: (2026)
par: Dwaraknath, Rajat Vadiraj, et autres
Publié: (2026)
PathWeaver: A High-Throughput Multi-GPU System for Graph-Based Approximate Nearest Neighbor Search
par: Kim, Sukjin, et autres
Publié: (2025)
par: Kim, Sukjin, et autres
Publié: (2025)
CrossPipe: Towards Optimal Pipeline Schedules for Cross-Datacenter Training
par: Chen, Tiancheng, et autres
Publié: (2025)
par: Chen, Tiancheng, et autres
Publié: (2025)
A Flexible Programmable Pipeline Parallelism Framework for Efficient DNN Training
par: Jiang, Lijuan, et autres
Publié: (2025)
par: Jiang, Lijuan, et autres
Publié: (2025)
DawnPiper: A Memory-scablable Pipeline Parallel Training Framework
par: Peng, Xuan, et autres
Publié: (2025)
par: Peng, Xuan, et autres
Publié: (2025)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
par: Li, Shiju, et autres
Publié: (2025)
par: Li, Shiju, et autres
Publié: (2025)
MPI-over-CXL: Enhancing Communication Efficiency in Distributed HPC Systems
par: Kwon, Miryeong, et autres
Publié: (2025)
par: Kwon, Miryeong, et autres
Publié: (2025)
TensorSocket: Shared Data Loading for Deep Learning Training
par: Robroek, Ties, et autres
Publié: (2024)
par: Robroek, Ties, et autres
Publié: (2024)
DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline
par: Xue, Zhenliang, et autres
Publié: (2025)
par: Xue, Zhenliang, et autres
Publié: (2025)
Revisiting Early-Learning Regularization When Federated Learning Meets Noisy Labels
par: Kim, Taehyeon, et autres
Publié: (2024)
par: Kim, Taehyeon, et autres
Publié: (2024)
JanusPipe: Efficient Pipeline Parallel Training for Machine Learning Interatomic Potentials
par: Wang, Hongyu, et autres
Publié: (2026)
par: Wang, Hongyu, et autres
Publié: (2026)
GCAPS: GPU Context-Aware Preemptive Priority-based Scheduling for Real-Time Tasks
par: Wang, Yidi, et autres
Publié: (2024)
par: Wang, Yidi, et autres
Publié: (2024)
Generative Artificial Intelligence Reproducibility and Consensus
par: Kim, Edward, et autres
Publié: (2023)
par: Kim, Edward, et autres
Publié: (2023)
GriNNder: Breaking the Memory Capacity Wall in Full-Graph GNN Training with Storage Offloading
par: Song, Jaeyong, et autres
Publié: (2026)
par: Song, Jaeyong, et autres
Publié: (2026)
LUT-GEMM: Quantized Matrix Multiplication based on LUTs for Efficient Inference in Large-Scale Generative Language Models
par: Park, Gunho, et autres
Publié: (2022)
par: Park, Gunho, et autres
Publié: (2022)
Documents similaires
-
GraNNDis: Efficient Unified Distributed Training Framework for Deep GNNs on Large Clusters
par: Song, Jaeyong, et autres
Publié: (2023) -
AGAThA: Fast and Efficient GPU Acceleration of Guided Sequence Alignment for Long Read Mapping
par: Park, Seongyeon, et autres
Publié: (2024) -
Zorse: Optimizing LLM Training Efficiency on Heterogeneous GPU Clusters
par: Guo, Runsheng Benson, et autres
Publié: (2025) -
Exqutor: Extended Query Optimizer for Vector-augmented Analytical Queries
par: Kim, Hyunjoon, et autres
Publié: (2025) -
PID-Comm: A Fast and Flexible Collective Communication Framework for Commodity Processing-in-DIMM Devices
par: Noh, Si Ung, et autres
Publié: (2024)