Salvato in:
| Autori principali: | Liu, Junming, Zhang, Yusen, Zhang, Rongchao, Zhu, Wenkai, Wu, Tian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2603.05957 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Conflict-Free Replicated Data Types for Neural Network Model Merging: A Two-Layer Architecture Enabling CRDT-Compliant Model Merging Across 26 Strategies
di: Gillespie, Ryan
Pubblicazione: (2026)
di: Gillespie, Ryan
Pubblicazione: (2026)
MergePipe: A Budget-Aware Parameter Management System for Scalable LLM Merging
di: Wang, Yuanyi, et al.
Pubblicazione: (2026)
di: Wang, Yuanyi, et al.
Pubblicazione: (2026)
Nightjar: Dynamic Adaptive Speculative Decoding for Large Language Models Serving
di: Li, Rui, et al.
Pubblicazione: (2025)
di: Li, Rui, et al.
Pubblicazione: (2025)
Adaptive Fault Tolerance Mechanisms of Large Language Models in Cloud Computing Environments
di: Jin, Yihong, et al.
Pubblicazione: (2025)
di: Jin, Yihong, et al.
Pubblicazione: (2025)
A-IO: Adaptive Inference Orchestration for Memory-Bound NPUs
di: Zhang, Chen, et al.
Pubblicazione: (2026)
di: Zhang, Chen, et al.
Pubblicazione: (2026)
Data-Juicer 2.0: Cloud-Scale Adaptive Data Processing for and with Foundation Models
di: Chen, Daoyuan, et al.
Pubblicazione: (2024)
di: Chen, Daoyuan, et al.
Pubblicazione: (2024)
Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment
di: Qazi, Muhammad Azlan, et al.
Pubblicazione: (2026)
di: Qazi, Muhammad Azlan, et al.
Pubblicazione: (2026)
ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference
di: Shen, Zixu, et al.
Pubblicazione: (2025)
di: Shen, Zixu, et al.
Pubblicazione: (2025)
Trade-offs in Decentralized Agentic AI Discovery Across the Compute Continuum
di: Dazzi, Patrizio, et al.
Pubblicazione: (2026)
di: Dazzi, Patrizio, et al.
Pubblicazione: (2026)
PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning
di: Wang, Yisu, et al.
Pubblicazione: (2025)
di: Wang, Yisu, et al.
Pubblicazione: (2025)
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
di: Zhao, Long, et al.
Pubblicazione: (2026)
di: Zhao, Long, et al.
Pubblicazione: (2026)
AdaPtis: Reducing Pipeline Bubbles with Adaptive Pipeline Parallelism on Heterogeneous Models
di: Guo, Jihu, et al.
Pubblicazione: (2025)
di: Guo, Jihu, et al.
Pubblicazione: (2025)
ScaleAcross Explorer: Exploring Communication Optimization for Scale-Across AI Model Training
di: Li, Minghao, et al.
Pubblicazione: (2026)
di: Li, Minghao, et al.
Pubblicazione: (2026)
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
di: Zheng, Yijie, et al.
Pubblicazione: (2025)
di: Zheng, Yijie, et al.
Pubblicazione: (2025)
Deploying Foundation Model Powered Agent Services: A Survey
di: Xu, Wenchao, et al.
Pubblicazione: (2024)
di: Xu, Wenchao, et al.
Pubblicazione: (2024)
AIBrix: Towards Scalable, Cost-Effective Large Language Model Inference Infrastructure
di: The AIBrix Team, et al.
Pubblicazione: (2025)
di: The AIBrix Team, et al.
Pubblicazione: (2025)
SkyServe: Serving AI Models across Regions and Clouds with Spot Instances
di: Mao, Ziming, et al.
Pubblicazione: (2024)
di: Mao, Ziming, et al.
Pubblicazione: (2024)
Multi-IaC-Eval: Benchmarking Cloud Infrastructure as Code Across Multiple Formats
di: Davidson, Sam, et al.
Pubblicazione: (2025)
di: Davidson, Sam, et al.
Pubblicazione: (2025)
SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment
di: Zhu, Wenqiao, et al.
Pubblicazione: (2025)
di: Zhu, Wenqiao, et al.
Pubblicazione: (2025)
Dynamic Resource Allocation for Virtual Machine Migration Optimization using Machine Learning
di: Gong, Yulu, et al.
Pubblicazione: (2024)
di: Gong, Yulu, et al.
Pubblicazione: (2024)
Electricity Cost Minimization for Multi-Workflow Allocation in Geo-Distributed Data Centers
di: Wang, Shuang, et al.
Pubblicazione: (2025)
di: Wang, Shuang, et al.
Pubblicazione: (2025)
Research on Model Parallelism and Data Parallelism Optimization Methods in Large Language Model-Based Recommendation Systems
di: Yang, Haowei, et al.
Pubblicazione: (2025)
di: Yang, Haowei, et al.
Pubblicazione: (2025)
Equinox: Holistic Fair Scheduling in Serving Large Language Models
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
CCL-D: A High-Precision Diagnostic System for Slow and Hang Anomalies in Large-Scale Model Training
di: Gu, Yida, et al.
Pubblicazione: (2026)
di: Gu, Yida, et al.
Pubblicazione: (2026)
KAITIAN: A Unified Communication Framework for Enabling Efficient Collaboration Across Heterogeneous Accelerators in Embodied AI Systems
di: Lin, Jieke, et al.
Pubblicazione: (2025)
di: Lin, Jieke, et al.
Pubblicazione: (2025)
PlanetServe: A Decentralized, Scalable, and Privacy-Preserving Overlay for Democratizing Large Language Model Serving
di: Fang, Fei, et al.
Pubblicazione: (2025)
di: Fang, Fei, et al.
Pubblicazione: (2025)
SparOA: Sparse and Operator-aware Hybrid Scheduling for Edge DNN Inference
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
NeurLZ: An Online Neural Learning-Based Method to Enhance Scientific Lossy Compression
di: Jia, Wenqi, et al.
Pubblicazione: (2024)
di: Jia, Wenqi, et al.
Pubblicazione: (2024)
WORKSWORLD: A Domain for Integrated Numeric Planning and Scheduling of Distributed Pipelined Workflows
di: Paul, Taylor, et al.
Pubblicazione: (2026)
di: Paul, Taylor, et al.
Pubblicazione: (2026)
Mosaic: Data-Free Knowledge Distillation via Mixture-of-Experts for Heterogeneous Distributed Environments
di: Liu, Junming, et al.
Pubblicazione: (2025)
di: Liu, Junming, et al.
Pubblicazione: (2025)
Mind the Boundary: Stabilizing Gemini Enterprise A2A via a Cloud Run Hub Across Projects and Accounts
di: Morita, Takao
Pubblicazione: (2026)
di: Morita, Takao
Pubblicazione: (2026)
TimelyFreeze: Adaptive Parameter Freezing Mechanism for Pipeline Parallelism
di: Cho, Seonghye, et al.
Pubblicazione: (2026)
di: Cho, Seonghye, et al.
Pubblicazione: (2026)
An Upload-Efficient Scheme for Transferring Knowledge From a Server-Side Pre-trained Generator to Clients in Heterogeneous Federated Learning
di: Zhang, Jianqing, et al.
Pubblicazione: (2024)
di: Zhang, Jianqing, et al.
Pubblicazione: (2024)
Adaptive AI-based Decentralized Resource Management in the Cloud-Edge Continuum
di: Li, Lanpei, et al.
Pubblicazione: (2025)
di: Li, Lanpei, et al.
Pubblicazione: (2025)
Para-B&B: Load-Balanced Deterministic Parallelization of Solving MIP
di: Zhang, Jinyu, et al.
Pubblicazione: (2026)
di: Zhang, Jinyu, et al.
Pubblicazione: (2026)
Verify Distributed Deep Learning Model Implementation Refinement with Iterative Relation Inference
di: Wang, Zhanghan, et al.
Pubblicazione: (2025)
di: Wang, Zhanghan, et al.
Pubblicazione: (2025)
PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization
di: Lei, Kelun, et al.
Pubblicazione: (2025)
di: Lei, Kelun, et al.
Pubblicazione: (2025)
Deep Reinforcement Learning for Fault-Adaptive Routing in Eisenstein-Jacobi Interconnection Topologies
di: Charrwi, Mohammad Walid, et al.
Pubblicazione: (2026)
di: Charrwi, Mohammad Walid, et al.
Pubblicazione: (2026)
StreamServe: Adaptive Speculative Flows for Low-Latency Disaggregated LLM Serving
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
Enhancing Communication Efficiency in FL with Adaptive Gradient Quantization and Communication Frequency Optimization
di: Tariq, Asadullah, et al.
Pubblicazione: (2025)
di: Tariq, Asadullah, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Conflict-Free Replicated Data Types for Neural Network Model Merging: A Two-Layer Architecture Enabling CRDT-Compliant Model Merging Across 26 Strategies
di: Gillespie, Ryan
Pubblicazione: (2026) -
MergePipe: A Budget-Aware Parameter Management System for Scalable LLM Merging
di: Wang, Yuanyi, et al.
Pubblicazione: (2026) -
Nightjar: Dynamic Adaptive Speculative Decoding for Large Language Models Serving
di: Li, Rui, et al.
Pubblicazione: (2025) -
Adaptive Fault Tolerance Mechanisms of Large Language Models in Cloud Computing Environments
di: Jin, Yihong, et al.
Pubblicazione: (2025) -
A-IO: Adaptive Inference Orchestration for Memory-Bound NPUs
di: Zhang, Chen, et al.
Pubblicazione: (2026)