Unlocking Full Efficiency of Token Filtering in Large Language Model Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Chai, Di, Li, Pengbo, Zhang, Feiyuan, Jin, Yilun, Tian, Han, Xu, Kaiqiang, Yuan, Binhang, Shen, Dian, Zhang, Junxue, Chen, Kai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Schedule-Level Shared-Prefix Reuse for LLM RL Training
di: Li, Pengbo, et al.
Pubblicazione: (2026)
di: Li, Pengbo, et al.
Pubblicazione: (2026)
CALVO: Improve Serving Efficiency for LLM Inferences with Intense Network Demands
di: Wang, Weiye, et al.
Pubblicazione: (2026)
di: Wang, Weiye, et al.
Pubblicazione: (2026)
HexGen-2: Disaggregated Generative Inference of LLMs in Heterogeneous Environment
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware
di: Liang, Yan, et al.
Pubblicazione: (2026)
di: Liang, Yan, et al.
Pubblicazione: (2026)
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
di: Yan, Ran, et al.
Pubblicazione: (2024)
di: Yan, Ran, et al.
Pubblicazione: (2024)
Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
A Survey for Federated Learning Evaluations: Goals and Measures
di: Chai, Di, et al.
Pubblicazione: (2023)
di: Chai, Di, et al.
Pubblicazione: (2023)
Efficient Pre-Training of LLMs via Topology-Aware Communication Alignment on More Than 9600 GPUs
di: He, Guoliang, et al.
Pubblicazione: (2025)
di: He, Guoliang, et al.
Pubblicazione: (2025)
NeutronTP: Load-Balanced Distributed Full-Graph GNN Training with Tensor Parallelism
di: Ai, Xin, et al.
Pubblicazione: (2024)
di: Ai, Xin, et al.
Pubblicazione: (2024)
Cascadia: An Efficient Cascade Serving System for Large Language Models
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
Design and Operation of Shared Machine Learning Clusters on Campus
di: Xu, Kaiqiang, et al.
Pubblicazione: (2021)
di: Xu, Kaiqiang, et al.
Pubblicazione: (2021)
HexGen: Generative Inference of Large Language Model over Heterogeneous Environment
di: Jiang, Youhe, et al.
Pubblicazione: (2023)
di: Jiang, Youhe, et al.
Pubblicazione: (2023)
DistFlow: A Fully Distributed RL Framework for Scalable and Efficient LLM Post-Training
di: Wang, Zhixin, et al.
Pubblicazione: (2025)
di: Wang, Zhixin, et al.
Pubblicazione: (2025)
KUBEDIRECT: Unleashing the Full Power of the Cluster Manager for Serverless Computing
di: Qi, Sheng, et al.
Pubblicazione: (2026)
di: Qi, Sheng, et al.
Pubblicazione: (2026)
DRust: Language-Guided Distributed Shared Memory with Fine Granularity, Full Transparency, and Ultra Efficiency
di: Ma, Haoran, et al.
Pubblicazione: (2024)
di: Ma, Haoran, et al.
Pubblicazione: (2024)
Straggler Tolerant and Resilient DL Training on Homogeneous GPUs
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
HopGNN: Boosting Distributed GNN Training Efficiency via Feature-Centric Model Migration
di: Chen, Weijian, et al.
Pubblicazione: (2024)
di: Chen, Weijian, et al.
Pubblicazione: (2024)
Beyond Pre-Training: The Full Lifecycle of Foundation Models on HPC Systems
di: Conciatore, Dino, et al.
Pubblicazione: (2026)
di: Conciatore, Dino, et al.
Pubblicazione: (2026)
HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling
di: Peng, You, et al.
Pubblicazione: (2026)
di: Peng, You, et al.
Pubblicazione: (2026)
LoHan: Low-Cost High-Performance Framework to Fine-Tune 100B Model on a Consumer GPU
di: Liao, Changyue, et al.
Pubblicazione: (2024)
di: Liao, Changyue, et al.
Pubblicazione: (2024)
Hecate: Unlocking Efficient Sparse Model Training via Fully Sharded Sparse Data Parallelism
di: Qing, Yuhao, et al.
Pubblicazione: (2025)
di: Qing, Yuhao, et al.
Pubblicazione: (2025)
CO2: Efficient Distributed Training with Full Communication-Computation Overlap
di: Sun, Weigao, et al.
Pubblicazione: (2024)
di: Sun, Weigao, et al.
Pubblicazione: (2024)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
di: Li, Suyi, et al.
Pubblicazione: (2024)
di: Li, Suyi, et al.
Pubblicazione: (2024)
Parallax: Efficient LLM Inference Service over Decentralized Environment
di: Tong, Chris, et al.
Pubblicazione: (2025)
di: Tong, Chris, et al.
Pubblicazione: (2025)
Zorse: Optimizing LLM Training Efficiency on Heterogeneous GPU Clusters
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2025)
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2025)
Staggered Batch Scheduling: Co-optimizing Time-to-First-Token and Throughput for High-Efficiency LLM Inference
di: Tian, Jian, et al.
Pubblicazione: (2025)
di: Tian, Jian, et al.
Pubblicazione: (2025)
TokenScale: Timely and Accurate Autoscaling for Disaggregated LLM Serving with Token Velocity
di: Lai, Ruiqi, et al.
Pubblicazione: (2025)
di: Lai, Ruiqi, et al.
Pubblicazione: (2025)
Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation
di: Chen, Fahao, et al.
Pubblicazione: (2024)
di: Chen, Fahao, et al.
Pubblicazione: (2024)
GriNNder: Breaking the Memory Capacity Wall in Full-Graph GNN Training with Storage Offloading
di: Song, Jaeyong, et al.
Pubblicazione: (2026)
di: Song, Jaeyong, et al.
Pubblicazione: (2026)
Fine-Grained Vectorized Merge Sorting on RISC-V: From Register to Cache
di: Zhang, Jin, et al.
Pubblicazione: (2024)
di: Zhang, Jin, et al.
Pubblicazione: (2024)
ClusterFusion++: Expanding Cluster-Level Fusion to Full Transformer-Block Decoding
di: Jin, ChiHeng, et al.
Pubblicazione: (2026)
di: Jin, ChiHeng, et al.
Pubblicazione: (2026)
Atomic Smart Contract Interoperability with High Efficiency via Cross-Chain Integrated Execution
di: Yin, Chaoyue, et al.
Pubblicazione: (2025)
di: Yin, Chaoyue, et al.
Pubblicazione: (2025)
Redox: Improving I/O Efficiency of Model Training Through File Redirection
di: Li, Yuhao, et al.
Pubblicazione: (2025)
di: Li, Yuhao, et al.
Pubblicazione: (2025)
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
di: Zhang, Zili, et al.
Pubblicazione: (2024)
di: Zhang, Zili, et al.
Pubblicazione: (2024)
ZeroPP: Unleashing Exceptional Parallelism Efficiency through Tensor-Parallelism-Free Methodology
di: Tang, Ding, et al.
Pubblicazione: (2024)
di: Tang, Ding, et al.
Pubblicazione: (2024)
EaCO: Resource Sharing Dynamics and Its Impact on Energy Efficiency for DNN Training
di: Haghshenas, Kawsar, et al.
Pubblicazione: (2024)
di: Haghshenas, Kawsar, et al.
Pubblicazione: (2024)
Stable-MoE: Lyapunov-based Token Routing for Distributed Mixture-of-Experts Training over Edge Networks
di: Shi, Long, et al.
Pubblicazione: (2025)
di: Shi, Long, et al.
Pubblicazione: (2025)
BurstEngine: an Efficient Distributed Framework for Training Transformers on Extremely Long Sequences of over 1M Tokens
di: Sun, Ao, et al.
Pubblicazione: (2025)
di: Sun, Ao, et al.
Pubblicazione: (2025)
Enhancing Memory Efficiency in Large Language Model Training Through Chronos-aware Pipeline Parallelism
di: Lin, Xinyuan, et al.
Pubblicazione: (2025)
di: Lin, Xinyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Schedule-Level Shared-Prefix Reuse for LLM RL Training
di: Li, Pengbo, et al.
Pubblicazione: (2026) -
CALVO: Improve Serving Efficiency for LLM Inferences with Intense Network Demands
di: Wang, Weiye, et al.
Pubblicazione: (2026) -
HexGen-2: Disaggregated Generative Inference of LLMs in Heterogeneous Environment
di: Jiang, Youhe, et al.
Pubblicazione: (2025) -
HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware
di: Liang, Yan, et al.
Pubblicazione: (2026) -
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
di: Yan, Ran, et al.
Pubblicazione: (2024)