MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jiang, Ziheng, Lin, Haibin, Zhong, Yinmin, Huang, Qi, Chen, Yangrui, Zhang, Zhi, Peng, Yanghua, Li, Xiang, Xie, Cong, Nong, Shibiao, Jia, Yulu, He, Sun, Chen, Hongmin, Bai, Zhihao, Hou, Qi, Yan, Shipeng, Zhou, Ding, Sheng, Yiyao, Jiang, Zhuo, Xu, Haohan, Wei, Haoran, Zhang, Zhang, Nie, Pengfei, Zou, Leqi, Zhao, Sida, Xiang, Liang, Liu, Zherui, Li, Zhe, Jia, Xiaoying, Ye, Jianxi, Jin, Xin, Liu, Xin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training
von: Zhao, Juntao, et al.
Veröffentlicht: (2025)
von: Zhao, Juntao, et al.
Veröffentlicht: (2025)
MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism
von: Zhu, Ruidong, et al.
Veröffentlicht: (2025)
von: Zhu, Ruidong, et al.
Veröffentlicht: (2025)
MegaScale-MoE: Large-Scale Communication-Efficient Training of Mixture-of-Experts Models in Production
von: Jin, Chao, et al.
Veröffentlicht: (2025)
von: Jin, Chao, et al.
Veröffentlicht: (2025)
MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production
von: Xue, Chunyu, et al.
Veröffentlicht: (2026)
von: Xue, Chunyu, et al.
Veröffentlicht: (2026)
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
von: Hu, Jingcheng, et al.
Veröffentlicht: (2025)
von: Hu, Jingcheng, et al.
Veröffentlicht: (2025)
FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion
von: Chang, Li-Wen, et al.
Veröffentlicht: (2024)
von: Chang, Li-Wen, et al.
Veröffentlicht: (2024)
Optimus: Accelerating Large-Scale Multi-Modal LLM Training by Bubble Exploitation
von: Feng, Weiqi, et al.
Veröffentlicht: (2024)
von: Feng, Weiqi, et al.
Veröffentlicht: (2024)
MegaSynth: Scaling Up 3D Scene Reconstruction with Synthesized Data
von: Jiang, Hanwen, et al.
Veröffentlicht: (2024)
von: Jiang, Hanwen, et al.
Veröffentlicht: (2024)
Scaling Worst-Case Optimal Datalog to GPUs
von: Sun, Yihao, et al.
Veröffentlicht: (2026)
von: Sun, Yihao, et al.
Veröffentlicht: (2026)
Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning
von: Zhang, Sixian, et al.
Veröffentlicht: (2026)
von: Zhang, Sixian, et al.
Veröffentlicht: (2026)
ByteScale: Efficient Scaling of LLM Training with a 2048K Context Length on More Than 12,000 GPUs
von: Ge, Hao, et al.
Veröffentlicht: (2025)
von: Ge, Hao, et al.
Veröffentlicht: (2025)
[TeSeS 2 ] 2− : The First Heterotriple‐Chalcogenide Motifs Decode Giant Mid‐Far Infrared Birefringence
von: Bo Zhang, et al.
Veröffentlicht: (2025)
von: Bo Zhang, et al.
Veröffentlicht: (2025)
Learning Dual-Domain Multi-Scale Representations for Single Image Deraining
von: Zou, Shun, et al.
Veröffentlicht: (2025)
von: Zou, Shun, et al.
Veröffentlicht: (2025)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
von: Wang, Xiang, et al.
Veröffentlicht: (2025)
von: Wang, Xiang, et al.
Veröffentlicht: (2025)
MegaScenes: Scene-Level View Synthesis at Scale
von: Tung, Joseph, et al.
Veröffentlicht: (2024)
von: Tung, Joseph, et al.
Veröffentlicht: (2024)
MegaHan97K: A Large-Scale Dataset for Mega-Category Chinese Character Recognition with over 97K Categories
von: Zhang, Yuyi, et al.
Veröffentlicht: (2025)
von: Zhang, Yuyi, et al.
Veröffentlicht: (2025)
LCA ‐ NeRF : Large‐Scale Scene Neural Rendering With Clustered Appearance Embedding
von: Ziyu Zhang, et al.
Veröffentlicht: (2025)
von: Ziyu Zhang, et al.
Veröffentlicht: (2025)
Predicting clinically significant prostate cancer in elderly patients: A nomogram approach with shear wave elastography
von: Xiang Liu, et al.
Veröffentlicht: (2024)
von: Xiang Liu, et al.
Veröffentlicht: (2024)
CAE-DFKD: Bridging the Transferability Gap in Data-Free Knowledge Distillation
von: Zhang, Zherui, et al.
Veröffentlicht: (2025)
von: Zhang, Zherui, et al.
Veröffentlicht: (2025)
MegaFlow: Large-Scale Distributed Orchestration System for the Agentic Era
von: Zhang, Lei, et al.
Veröffentlicht: (2026)
von: Zhang, Lei, et al.
Veröffentlicht: (2026)
StereoVAE: A lightweight stereo-matching system using embedded GPUs
von: Chang, Qiong, et al.
Veröffentlicht: (2023)
von: Chang, Qiong, et al.
Veröffentlicht: (2023)
Thermalization And Convergence To Equilibrium Of The Noisy Voter Model
von: Aljovin, Enzo, et al.
Veröffentlicht: (2024)
von: Aljovin, Enzo, et al.
Veröffentlicht: (2024)
Quantitative hydrodynamics for a generalized contact model
von: Amorim, Julian, et al.
Veröffentlicht: (2024)
von: Amorim, Julian, et al.
Veröffentlicht: (2024)
Mixing time for an epidemic model on graphs with external sources of infection
von: KhudaBukhsh, Wasiur R., et al.
Veröffentlicht: (2025)
von: KhudaBukhsh, Wasiur R., et al.
Veröffentlicht: (2025)
Recent Advancements in COFs‐Based Heterostructures for CO₂ Photoreduction
von: Qi Li, et al.
Veröffentlicht: (2025)
von: Qi Li, et al.
Veröffentlicht: (2025)
Nonbonding Electron Inversion‐Driven Structural Engineering: Synergistic Enhancement of Linear and Nonlinear Optical Properties
von: Jia‐Xiang Zhang, et al.
Veröffentlicht: (2025)
von: Jia‐Xiang Zhang, et al.
Veröffentlicht: (2025)
Nonbonding Electron Inversion‐Driven Structural Engineering: Synergistic Enhancement of Linear and Nonlinear Optical Properties
von: Jia‐Xiang Zhang, et al.
Veröffentlicht: (2025)
von: Jia‐Xiang Zhang, et al.
Veröffentlicht: (2025)
BASKET: A Large-Scale Video Dataset for Fine-Grained Skill Estimation
von: Pan, Yulu, et al.
Veröffentlicht: (2025)
von: Pan, Yulu, et al.
Veröffentlicht: (2025)
Environmental Quantum States Trigger Emission in Nonlinear Photonics
von: Li, Jia-Qi, et al.
Veröffentlicht: (2025)
von: Li, Jia-Qi, et al.
Veröffentlicht: (2025)
Non‐Identification Adaptive Control for Large‐Scale Nonlinear Systems With Uncertain Measurement Sensitivity
von: Xinxu Ju, et al.
Veröffentlicht: (2025)
von: Xinxu Ju, et al.
Veröffentlicht: (2025)
LSGS-Loc: Towards Robust 3DGS-Based Visual Localization for Large-Scale UAV Scenarios
von: Zhang, Xiang, et al.
Veröffentlicht: (2026)
von: Zhang, Xiang, et al.
Veröffentlicht: (2026)
A Multi-Scale Spatial-Temporal Network for Wireless Video Transmission
von: Zhou, Xinyi, et al.
Veröffentlicht: (2024)
von: Zhou, Xinyi, et al.
Veröffentlicht: (2024)
Benchmarking Cross-Scale Perception Ability of Large Multimodal Models in Material Science
von: Zheng, Yuting, et al.
Veröffentlicht: (2026)
von: Zheng, Yuting, et al.
Veröffentlicht: (2026)
Scaling Behaviors of Evolutionary Algorithms on GPUs: When Does Parallelism Pay Off?
von: Yu, Xinmeng, et al.
Veröffentlicht: (2026)
von: Yu, Xinmeng, et al.
Veröffentlicht: (2026)
Scaling Limits for Exponential Hedging in the Brownian Framework
von: Dolinksy, Yan, et al.
Veröffentlicht: (2025)
von: Dolinksy, Yan, et al.
Veröffentlicht: (2025)
Scaling Limits for Exponential Hedging in Trinomial Models
von: Dolinsky, Yan, et al.
Veröffentlicht: (2026)
von: Dolinsky, Yan, et al.
Veröffentlicht: (2026)
Enhanced Scale-aware Depth Estimation for Monocular Endoscopic Scenes with Geometric Modeling
von: Wei, Ruofeng, et al.
Veröffentlicht: (2024)
von: Wei, Ruofeng, et al.
Veröffentlicht: (2024)
veScale-FSDP: Flexible and High-Performance FSDP at Scale
von: Wang, Zezhou, et al.
Veröffentlicht: (2026)
von: Wang, Zezhou, et al.
Veröffentlicht: (2026)
Development and Testing of the Cyber Malevolent Creativity Behavior Scale
von: Chenxi Liu, et al.
Veröffentlicht: (2024)
von: Chenxi Liu, et al.
Veröffentlicht: (2024)
SAMamba: Adaptive State Space Modeling with Hierarchical Vision for Infrared Small Target Detection
von: Xu, Wenhao, et al.
Veröffentlicht: (2025)
von: Xu, Wenhao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training
von: Zhao, Juntao, et al.
Veröffentlicht: (2025) -
MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism
von: Zhu, Ruidong, et al.
Veröffentlicht: (2025) -
MegaScale-MoE: Large-Scale Communication-Efficient Training of Mixture-of-Experts Models in Production
von: Jin, Chao, et al.
Veröffentlicht: (2025) -
MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production
von: Xue, Chunyu, et al.
Veröffentlicht: (2026) -
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
von: Hu, Jingcheng, et al.
Veröffentlicht: (2025)