iOS as Acceleration
Fuente:
arXiv
Salvato in:
| Autore principale: | Chen, Alexander K. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Accelerated Digital Twin Learning for Edge AI: A Comparison of FPGA and Mobile GPU
di: Xu, Bin, et al.
Pubblicazione: (2025)
di: Xu, Bin, et al.
Pubblicazione: (2025)
HadaCore: Tensor Core Accelerated Hadamard Transform Kernel
di: Agarwal, Krish, et al.
Pubblicazione: (2024)
di: Agarwal, Krish, et al.
Pubblicazione: (2024)
Accelerating Large Language Model Training with Hybrid GPU-based Compression
di: Xu, Lang, et al.
Pubblicazione: (2024)
di: Xu, Lang, et al.
Pubblicazione: (2024)
A Survey on Large Language Model Acceleration based on KV Cache Management
di: Li, Haoyang, et al.
Pubblicazione: (2024)
di: Li, Haoyang, et al.
Pubblicazione: (2024)
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
Accelerating LLM Inference with Precomputed Query Storage
di: Park, Jay H., et al.
Pubblicazione: (2025)
di: Park, Jay H., et al.
Pubblicazione: (2025)
HiveMind: OS-Inspired Scheduling for Concurrent LLM Agent Workloads
di: Agyemang, Justice Owusu, et al.
Pubblicazione: (2026)
di: Agyemang, Justice Owusu, et al.
Pubblicazione: (2026)
iScheduler: Reinforcement Learning-Driven Continual Optimization for Large-Scale Resource Investment Problems
di: Hu, Yi-Xiang, et al.
Pubblicazione: (2026)
di: Hu, Yi-Xiang, et al.
Pubblicazione: (2026)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
di: He, Zifan, et al.
Pubblicazione: (2026)
di: He, Zifan, et al.
Pubblicazione: (2026)
Towards Scalable GPU-Accelerated SNN Training via Temporal Fusion
di: Li, Yanchen, et al.
Pubblicazione: (2024)
di: Li, Yanchen, et al.
Pubblicazione: (2024)
Speeding up Local Optimization in Vehicle Routing with Tensor-based GPU Acceleration
di: Lei, Zhenyu, et al.
Pubblicazione: (2025)
di: Lei, Zhenyu, et al.
Pubblicazione: (2025)
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
di: Zhao, Long, et al.
Pubblicazione: (2026)
di: Zhao, Long, et al.
Pubblicazione: (2026)
Keep Your Friends Close: Leveraging Affinity Groups to Accelerate AI Inference Workflows
di: Garrett, Thiago, et al.
Pubblicazione: (2023)
di: Garrett, Thiago, et al.
Pubblicazione: (2023)
ProbSelect: Stochastic Client Selection for GPU-Accelerated Compute Devices in the 3D Continuum
di: Stanisic, Andrija, et al.
Pubblicazione: (2025)
di: Stanisic, Andrija, et al.
Pubblicazione: (2025)
Act While Thinking: Accelerating LLM Agents via Pattern-Aware Speculative Tool Execution
di: Sui, Yifan, et al.
Pubblicazione: (2026)
di: Sui, Yifan, et al.
Pubblicazione: (2026)
Accelerating Latency-Critical Applications with AI-Powered Semi-Automatic Fine-Grained Parallelization on SMT Processors
di: Los, Denis, et al.
Pubblicazione: (2025)
di: Los, Denis, et al.
Pubblicazione: (2025)
KAITIAN: A Unified Communication Framework for Enabling Efficient Collaboration Across Heterogeneous Accelerators in Embodied AI Systems
di: Lin, Jieke, et al.
Pubblicazione: (2025)
di: Lin, Jieke, et al.
Pubblicazione: (2025)
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
di: Zheng, Yijie, et al.
Pubblicazione: (2025)
di: Zheng, Yijie, et al.
Pubblicazione: (2025)
Accelerating a Triton Fused Kernel for W4A16 Quantized Inference with SplitK work decomposition
di: Hoque, Adnan, et al.
Pubblicazione: (2024)
di: Hoque, Adnan, et al.
Pubblicazione: (2024)
Space Filling Curves is All You Need: Communication-Avoiding Matrix Multiplication Made Simple
di: Georganas, Evangelos, et al.
Pubblicazione: (2026)
di: Georganas, Evangelos, et al.
Pubblicazione: (2026)
Harnessing Deep Learning and HPC Kernels via High-Level Loop and Tensor Abstractions on CPU Architectures
di: Georganas, Evangelos, et al.
Pubblicazione: (2023)
di: Georganas, Evangelos, et al.
Pubblicazione: (2023)
Scaling Performance of Large Language Model Pretraining
di: Interrante-Grant, Alexander, et al.
Pubblicazione: (2025)
di: Interrante-Grant, Alexander, et al.
Pubblicazione: (2025)
Distributed LLM Pretraining During Renewable Curtailment Windows: A Feasibility Study
di: Wiesner, Philipp, et al.
Pubblicazione: (2026)
di: Wiesner, Philipp, et al.
Pubblicazione: (2026)
Optimus: Accelerating Large-Scale Multi-Modal LLM Training by Bubble Exploitation
di: Feng, Weiqi, et al.
Pubblicazione: (2024)
di: Feng, Weiqi, et al.
Pubblicazione: (2024)
ProMoE: Fast MoE-based LLM Serving using Proactive Caching
di: Song, Xiaoniu, et al.
Pubblicazione: (2024)
di: Song, Xiaoniu, et al.
Pubblicazione: (2024)
CA-AC-MPC: CUDA-Accelerated Actor-Critic Model Predictive Control
di: Buo, Antoonio, et al.
Pubblicazione: (2026)
di: Buo, Antoonio, et al.
Pubblicazione: (2026)
KunServe: Parameter-centric Memory Management for Efficient Memory Overloading Handling in LLM Serving
di: Cheng, Rongxin, et al.
Pubblicazione: (2024)
di: Cheng, Rongxin, et al.
Pubblicazione: (2024)
Accelerating HDC-CNN Hybrid Models Using Custom Instructions on RISC-V GPUs
di: Matsumi, Wakuto, et al.
Pubblicazione: (2025)
di: Matsumi, Wakuto, et al.
Pubblicazione: (2025)
PALS: Power-Aware LLM Serving for Mixture-of-Experts Models
di: Hankendi, Can, et al.
Pubblicazione: (2026)
di: Hankendi, Can, et al.
Pubblicazione: (2026)
Adaptation of AI-accelerated CFD Simulations to the IPU platform
di: Rosciszewski, P., et al.
Pubblicazione: (2026)
di: Rosciszewski, P., et al.
Pubblicazione: (2026)
Mesh-Attention: A New Communication-Efficient Distributed Attention with Improved Data Locality
di: Chen, Sirui, et al.
Pubblicazione: (2025)
di: Chen, Sirui, et al.
Pubblicazione: (2025)
Deploying Graph Neural Networks in Wireless Networks: A Link Stability Viewpoint
di: Li, Jun, et al.
Pubblicazione: (2024)
di: Li, Jun, et al.
Pubblicazione: (2024)
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026)
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026)
Opara: Exploiting Operator Parallelism for Expediting DNN Inference on GPUs
di: Chen, Aodong, et al.
Pubblicazione: (2023)
di: Chen, Aodong, et al.
Pubblicazione: (2023)
Story of Two GPUs: Characterizing the Resilience of Hopper H100 and Ampere A100 GPUs
di: Cui, Shengkun, et al.
Pubblicazione: (2025)
di: Cui, Shengkun, et al.
Pubblicazione: (2025)
ECCENTRIC: Edge-Cloud Collaboration Framework for Distributed Inference Using Knowledge Adaptation
di: Kamani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Kamani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning
di: Xu, Lang, et al.
Pubblicazione: (2025)
di: Xu, Lang, et al.
Pubblicazione: (2025)
Equinox: Holistic Fair Scheduling in Serving Large Language Models
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
KVCache Cache in the Wild: Characterizing and Optimizing KVCache Cache at a Large Cloud Provider
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
Characterizing Mobile SoC for Accelerating Heterogeneous LLM Inference
di: Chen, Le, et al.
Pubblicazione: (2025)
di: Chen, Le, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Accelerated Digital Twin Learning for Edge AI: A Comparison of FPGA and Mobile GPU
di: Xu, Bin, et al.
Pubblicazione: (2025) -
HadaCore: Tensor Core Accelerated Hadamard Transform Kernel
di: Agarwal, Krish, et al.
Pubblicazione: (2024) -
Accelerating Large Language Model Training with Hybrid GPU-based Compression
di: Xu, Lang, et al.
Pubblicazione: (2024) -
A Survey on Large Language Model Acceleration based on KV Cache Management
di: Li, Haoyang, et al.
Pubblicazione: (2024) -
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
di: Xu, Jiaming, et al.
Pubblicazione: (2025)