Salvato in:
| Autori principali: | Sundar, Nataraj Agaram, Morabia, Tejas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2606.01513 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hierarchical Online Prompt Mutation with Dual-Loop Feedback for Guardrailed Evidence Document Generation: A Production-Evaluation Case Study
di: Morabia, Nataraj Agaram Sundar Tejas
Pubblicazione: (2026)
di: Morabia, Nataraj Agaram Sundar Tejas
Pubblicazione: (2026)
Learned Best-Effort LLM Serving
di: Jha, Siddharth, et al.
Pubblicazione: (2024)
di: Jha, Siddharth, et al.
Pubblicazione: (2024)
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
di: Zheng, Yijie, et al.
Pubblicazione: (2025)
di: Zheng, Yijie, et al.
Pubblicazione: (2025)
PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation
di: Ichikawa, Yuma, et al.
Pubblicazione: (2025)
di: Ichikawa, Yuma, et al.
Pubblicazione: (2025)
A Feature Engineering Approach for Business Impact-Oriented Failure Detection in Distributed Instant Payment Systems
di: Porcelli, Lorenzo
Pubblicazione: (2025)
di: Porcelli, Lorenzo
Pubblicazione: (2025)
Toward Sustainable GenAI using Generation Directives for Carbon-Friendly Large Language Model Inference
di: Li, Baolin, et al.
Pubblicazione: (2024)
di: Li, Baolin, et al.
Pubblicazione: (2024)
Alto: Orchestrating Distributed Compound AI Systems with Nested Ancestry
di: Raghavan, Deepti, et al.
Pubblicazione: (2024)
di: Raghavan, Deepti, et al.
Pubblicazione: (2024)
ALTO: Adaptive LoRA Tuning and Orchestration for Heterogeneous LoRA Training Workloads
di: Zuo, Jingwei, et al.
Pubblicazione: (2026)
di: Zuo, Jingwei, et al.
Pubblicazione: (2026)
KV-Runahead: Scalable Causal LLM Inference by Parallel Key-Value Cache Generation
di: Cho, Minsik, et al.
Pubblicazione: (2024)
di: Cho, Minsik, et al.
Pubblicazione: (2024)
Systems and Algorithms for Convolutional Multi-Hybrid Language Models at Scale
di: Ku, Jerome, et al.
Pubblicazione: (2025)
di: Ku, Jerome, et al.
Pubblicazione: (2025)
AdaServe: Accelerating Multi-SLO LLM Serving with SLO-Customized Speculative Decoding
di: Li, Zikun, et al.
Pubblicazione: (2025)
di: Li, Zikun, et al.
Pubblicazione: (2025)
Compress then Serve: Serving Thousands of LoRA Adapters with Little Overhead
di: Brüel-Gabrielsson, Rickard, et al.
Pubblicazione: (2024)
di: Brüel-Gabrielsson, Rickard, et al.
Pubblicazione: (2024)
Advancing MoE Efficiency: A Collaboration-Constrained Routing (C2R) Strategy for Better Expert Parallelism Design
di: Zhang, Mohan, et al.
Pubblicazione: (2025)
di: Zhang, Mohan, et al.
Pubblicazione: (2025)
CudaForge: An Agent Framework with Hardware Feedback for CUDA Kernel Optimization
di: Zhang, Zijian, et al.
Pubblicazione: (2025)
di: Zhang, Zijian, et al.
Pubblicazione: (2025)
BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching
di: Zheng, Zhen, et al.
Pubblicazione: (2024)
di: Zheng, Zhen, et al.
Pubblicazione: (2024)
FourierMoE: Fourier Mixture-of-Experts Adaptation of Large Language Models
di: Jiang, Juyong, et al.
Pubblicazione: (2026)
di: Jiang, Juyong, et al.
Pubblicazione: (2026)
Trust The Typical
di: Ganguly, Debargha, et al.
Pubblicazione: (2026)
di: Ganguly, Debargha, et al.
Pubblicazione: (2026)
Challenges in Deploying Long-Context Transformers: A Theoretical Peak Performance Analysis
di: Fu, Yao
Pubblicazione: (2024)
di: Fu, Yao
Pubblicazione: (2024)
Bitnet.cpp: Efficient Edge Inference for Ternary LLMs
di: Wang, Jinheng, et al.
Pubblicazione: (2025)
di: Wang, Jinheng, et al.
Pubblicazione: (2025)
Improving Parallel Program Performance with LLM Optimizers via Agent-System Interfaces
di: Wei, Anjiang, et al.
Pubblicazione: (2024)
di: Wei, Anjiang, et al.
Pubblicazione: (2024)
Linear-MoE: Linear Sequence Modeling Meets Mixture-of-Experts
di: Sun, Weigao, et al.
Pubblicazione: (2025)
di: Sun, Weigao, et al.
Pubblicazione: (2025)
SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications
di: Oliaro, Gabriele, et al.
Pubblicazione: (2024)
di: Oliaro, Gabriele, et al.
Pubblicazione: (2024)
Minions: Cost-efficient Collaboration Between On-device and Cloud Language Models
di: Narayan, Avanika, et al.
Pubblicazione: (2025)
di: Narayan, Avanika, et al.
Pubblicazione: (2025)
MACE: A Hybrid LLM Serving System with Colocated SLO-aware Continuous Retraining Alignment
di: Li, Yufei, et al.
Pubblicazione: (2025)
di: Li, Yufei, et al.
Pubblicazione: (2025)
MineDraft: A Framework for Batch Parallel Speculative Decoding
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
DLoRA: Distributed Parameter-Efficient Fine-Tuning Solution for Large Language Model
di: Gao, Chao, et al.
Pubblicazione: (2024)
di: Gao, Chao, et al.
Pubblicazione: (2024)
Efficient Deployment of Large Language Models on Resource-constrained Devices
di: Yao, Zhiwei, et al.
Pubblicazione: (2025)
di: Yao, Zhiwei, et al.
Pubblicazione: (2025)
Liger Kernel: Efficient Triton Kernels for LLM Training
di: Hsu, Pin-Lun, et al.
Pubblicazione: (2024)
di: Hsu, Pin-Lun, et al.
Pubblicazione: (2024)
FinGPT-HPC: Efficient Pretraining and Finetuning Large Language Models for Financial Applications with High-Performance Computing
di: Liu, Xiao-Yang, et al.
Pubblicazione: (2024)
di: Liu, Xiao-Yang, et al.
Pubblicazione: (2024)
ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation
di: Mei, Zhiyu, et al.
Pubblicazione: (2024)
di: Mei, Zhiyu, et al.
Pubblicazione: (2024)
Fisher Information-based Efficient Curriculum Federated Learning with Large Language Models
di: Liu, Ji, et al.
Pubblicazione: (2024)
di: Liu, Ji, et al.
Pubblicazione: (2024)
Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques
di: Behera, Adarsh Prasad, et al.
Pubblicazione: (2025)
di: Behera, Adarsh Prasad, et al.
Pubblicazione: (2025)
LongCat-Flash Technical Report
di: Meituan LongCat Team, et al.
Pubblicazione: (2025)
di: Meituan LongCat Team, et al.
Pubblicazione: (2025)
TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training
di: Liang, Wanchao, et al.
Pubblicazione: (2024)
di: Liang, Wanchao, et al.
Pubblicazione: (2024)
A Sparsity Predicting Approach for Large Language Models via Activation Pattern Clustering
di: Dhar, Nobel, et al.
Pubblicazione: (2025)
di: Dhar, Nobel, et al.
Pubblicazione: (2025)
Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs
di: Mamun, Md Abdullah Al, et al.
Pubblicazione: (2025)
di: Mamun, Md Abdullah Al, et al.
Pubblicazione: (2025)
GPUTOK: GPU Accelerated Byte Level BPE Tokenization
di: Kadamba, Venu Gopal, et al.
Pubblicazione: (2026)
di: Kadamba, Venu Gopal, et al.
Pubblicazione: (2026)
Data Driven Optimization of GPU efficiency for Distributed LLM Adapter Serving
di: Agullo, Ferran, et al.
Pubblicazione: (2026)
di: Agullo, Ferran, et al.
Pubblicazione: (2026)
Make Every Draft Count: Hidden State based Speculative Decoding
di: Chen, Yuetao, et al.
Pubblicazione: (2026)
di: Chen, Yuetao, et al.
Pubblicazione: (2026)
BlackMamba: Mixture of Experts for State-Space Models
di: Anthony, Quentin, et al.
Pubblicazione: (2024)
di: Anthony, Quentin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Hierarchical Online Prompt Mutation with Dual-Loop Feedback for Guardrailed Evidence Document Generation: A Production-Evaluation Case Study
di: Morabia, Nataraj Agaram Sundar Tejas
Pubblicazione: (2026) -
Learned Best-Effort LLM Serving
di: Jha, Siddharth, et al.
Pubblicazione: (2024) -
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
di: Zheng, Yijie, et al.
Pubblicazione: (2025) -
PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation
di: Ichikawa, Yuma, et al.
Pubblicazione: (2025) -
A Feature Engineering Approach for Business Impact-Oriented Failure Detection in Distributed Instant Payment Systems
di: Porcelli, Lorenzo
Pubblicazione: (2025)