LlamaDuo: LLMOps Pipeline for Seamless Migration from Service LLMs to Small-Scale Local LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Park, Chansung, Jiang, Juyong, Wang, Fan, Paul, Sayak, Tang, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chat AI: A Seamless Slurm-Native Solution for HPC-Based Services
par: Doosthosseini, Ali, et autres
Publié: (2024)
par: Doosthosseini, Ali, et autres
Publié: (2024)
Seamless Transitions: A Comprehensive Review of Live Migration Technologies
par: Attar-Khorasani, Sima, et autres
Publié: (2025)
par: Attar-Khorasani, Sima, et autres
Publié: (2025)
Declarative Data Pipeline for Large Scale ML Services
par: Yang, Yunzhao, et autres
Publié: (2025)
par: Yang, Yunzhao, et autres
Publié: (2025)
FourierMoE: Fourier Mixture-of-Experts Adaptation of Large Language Models
par: Jiang, Juyong, et autres
Publié: (2026)
par: Jiang, Juyong, et autres
Publié: (2026)
SHADOW: Seamless Handoff And Zero-Downtime Orchestrated Workload Migration for Stateful Microservices
par: Dinh-Tuan, Hai
Publié: (2026)
par: Dinh-Tuan, Hai
Publié: (2026)
FlashRecovery: Fast and Low-Cost Recovery from Failures for Large-Scale Training of LLMs
par: Zhang, Haijun, et autres
Publié: (2025)
par: Zhang, Haijun, et autres
Publié: (2025)
WORKSWORLD: A Domain for Integrated Numeric Planning and Scheduling of Distributed Pipelined Workflows
par: Paul, Taylor, et autres
Publié: (2026)
par: Paul, Taylor, et autres
Publié: (2026)
Training LLMs with Fault Tolerant HSDP on 100,000 GPUs
par: Salpekar, Omkar, et autres
Publié: (2026)
par: Salpekar, Omkar, et autres
Publié: (2026)
Llama Guard 3-1B-INT4: Compact and Efficient Safeguard for Human-AI Conversations
par: Fedorov, Igor, et autres
Publié: (2024)
par: Fedorov, Igor, et autres
Publié: (2024)
DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline
par: Xue, Zhenliang, et autres
Publié: (2025)
par: Xue, Zhenliang, et autres
Publié: (2025)
An Evaluation of LLMs Inference on Popular Single-board Computers
par: Tung, et autres
Publié: (2025)
par: Tung, et autres
Publié: (2025)
ELANA: A Simple Energy and Latency Analyzer for LLMs
par: Chiang, Hung-Yueh, et autres
Publié: (2025)
par: Chiang, Hung-Yueh, et autres
Publié: (2025)
Why Smaller Is Slower? Dimensional Misalignment in Compressed LLMs
par: Xin, Jihao, et autres
Publié: (2026)
par: Xin, Jihao, et autres
Publié: (2026)
Balanced and Elastic End-to-end Training of Dynamic LLMs
par: Wahib, Mohamed, et autres
Publié: (2025)
par: Wahib, Mohamed, et autres
Publié: (2025)
FlowSpec: Continuous Pipelined Speculative Decoding for Efficient Distributed LLM Inference
par: Liu, Xing, et autres
Publié: (2025)
par: Liu, Xing, et autres
Publié: (2025)
AdaPtis: Reducing Pipeline Bubbles with Adaptive Pipeline Parallelism on Heterogeneous Models
par: Guo, Jihu, et autres
Publié: (2025)
par: Guo, Jihu, et autres
Publié: (2025)
Autobahn: Seamless high speed BFT
par: Giridharan, Neil, et autres
Publié: (2024)
par: Giridharan, Neil, et autres
Publié: (2024)
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization
par: Tschand, Arya, et autres
Publié: (2025)
par: Tschand, Arya, et autres
Publié: (2025)
AQUA: Network-Accelerated Memory Offloading for LLMs in Scale-Up GPU Domains
par: Kumar, Abhishek Vijaya, et autres
Publié: (2024)
par: Kumar, Abhishek Vijaya, et autres
Publié: (2024)
DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance
par: Zhang, Yuning, et autres
Publié: (2025)
par: Zhang, Yuning, et autres
Publié: (2025)
IoT-MCP: Bridging LLMs and IoT Systems Through Model Context Protocol
par: Yang, Ningyuan, et autres
Publié: (2025)
par: Yang, Ningyuan, et autres
Publié: (2025)
HexGen-2: Disaggregated Generative Inference of LLMs in Heterogeneous Environment
par: Jiang, Youhe, et autres
Publié: (2025)
par: Jiang, Youhe, et autres
Publié: (2025)
FreeRide: Harvesting Bubbles in Pipeline Parallelism
par: Zhang, Jiashu, et autres
Publié: (2024)
par: Zhang, Jiashu, et autres
Publié: (2024)
Automated Planning for Optimal Data Pipeline Instantiation
par: Amado, Leonardo Rosa, et autres
Publié: (2025)
par: Amado, Leonardo Rosa, et autres
Publié: (2025)
Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices
par: Shen, Tao, et autres
Publié: (2025)
par: Shen, Tao, et autres
Publié: (2025)
NestedFP: High-Performance, Memory-Efficient Dual-Precision Floating Point Support for LLMs
par: Lee, Haeun, et autres
Publié: (2025)
par: Lee, Haeun, et autres
Publié: (2025)
Towards Seamless Serverless Computing Across an Edge-Cloud Continuum
par: Simion, Emilian, et autres
Publié: (2024)
par: Simion, Emilian, et autres
Publié: (2024)
Enabling Seamless Data Security, Consensus, and Trading in Vehicular Networks
par: Vieira, Emanuel, et autres
Publié: (2024)
par: Vieira, Emanuel, et autres
Publié: (2024)
A System for Microserving of LLMs
par: Jin, Hongyi, et autres
Publié: (2024)
par: Jin, Hongyi, et autres
Publié: (2024)
PipeBoost: Resilient Pipelined Architecture for Fast Serverless LLM Scaling
par: Liu, Chongpeng, et autres
Publié: (2025)
par: Liu, Chongpeng, et autres
Publié: (2025)
Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines
par: Wagenländer, Marcel, et autres
Publié: (2026)
par: Wagenländer, Marcel, et autres
Publié: (2026)
TimelyFreeze: Adaptive Parameter Freezing Mechanism for Pipeline Parallelism
par: Cho, Seonghye, et autres
Publié: (2026)
par: Cho, Seonghye, et autres
Publié: (2026)
SkipPipe: Partial and Reordered Pipelining Framework for Training LLMs in Heterogeneous Networks
par: Blagoev, Nikolay, et autres
Publié: (2025)
par: Blagoev, Nikolay, et autres
Publié: (2025)
Predictive-LoRA: A Proactive and Fragmentation-Aware Serverless Inference System for LLMs
par: Ni, Yinan, et autres
Publié: (2025)
par: Ni, Yinan, et autres
Publié: (2025)
HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware
par: Liang, Yan, et autres
Publié: (2026)
par: Liang, Yan, et autres
Publié: (2026)
Enabling Seamless Transitions from Experimental to Production HPC for Interactive Workflows
par: Etz, Brian D., et autres
Publié: (2025)
par: Etz, Brian D., et autres
Publié: (2025)
Efficient Pre-Training of LLMs via Topology-Aware Communication Alignment on More Than 9600 GPUs
par: He, Guoliang, et autres
Publié: (2025)
par: He, Guoliang, et autres
Publié: (2025)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
par: He, Zifan, et autres
Publié: (2026)
par: He, Zifan, et autres
Publié: (2026)
Artificial Intelligence for Cost-Aware Resource Prediction in Big Data Pipelines
par: Goyal, Harshit
Publié: (2025)
par: Goyal, Harshit
Publié: (2025)
MARLaaS: Multi-Tenant Asynchronous Reinforcement Learning as a Service
par: Yu, Timothy Tin Long, et autres
Publié: (2026)
par: Yu, Timothy Tin Long, et autres
Publié: (2026)
Documents similaires
-
Chat AI: A Seamless Slurm-Native Solution for HPC-Based Services
par: Doosthosseini, Ali, et autres
Publié: (2024) -
Seamless Transitions: A Comprehensive Review of Live Migration Technologies
par: Attar-Khorasani, Sima, et autres
Publié: (2025) -
Declarative Data Pipeline for Large Scale ML Services
par: Yang, Yunzhao, et autres
Publié: (2025) -
FourierMoE: Fourier Mixture-of-Experts Adaptation of Large Language Models
par: Jiang, Juyong, et autres
Publié: (2026) -
SHADOW: Seamless Handoff And Zero-Downtime Orchestrated Workload Migration for Stateful Microservices
par: Dinh-Tuan, Hai
Publié: (2026)