Towards Scalable GPU-Accelerated SNN Training via Temporal Fusion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yanchen, Li, Jiachun, Sun, Kebin, Leng, Luziwei, Cheng, Ran |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Accelerating Large Language Model Training with Hybrid GPU-based Compression
par: Xu, Lang, et autres
Publié: (2024)
par: Xu, Lang, et autres
Publié: (2024)
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
par: Zhao, Long, et autres
Publié: (2026)
par: Zhao, Long, et autres
Publié: (2026)
ClusterFusion: Expanding Operator Fusion Scope for LLM Inference via Cluster-Level Collective Primitive
par: Luo, Xinhao, et autres
Publié: (2025)
par: Luo, Xinhao, et autres
Publié: (2025)
ParaGAN: A Scalable Distributed Training Framework for Generative Adversarial Networks
par: Shi, Ziji, et autres
Publié: (2024)
par: Shi, Ziji, et autres
Publié: (2024)
Speeding up Local Optimization in Vehicle Routing with Tensor-based GPU Acceleration
par: Lei, Zhenyu, et autres
Publié: (2025)
par: Lei, Zhenyu, et autres
Publié: (2025)
Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers
par: Singh, Siddharth, et autres
Publié: (2025)
par: Singh, Siddharth, et autres
Publié: (2025)
TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training
par: Ye, Chenhao, et autres
Publié: (2026)
par: Ye, Chenhao, et autres
Publié: (2026)
Accelerated Digital Twin Learning for Edge AI: A Comparison of FPGA and Mobile GPU
par: Xu, Bin, et autres
Publié: (2025)
par: Xu, Bin, et autres
Publié: (2025)
LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems
par: Li, Yufei, et autres
Publié: (2025)
par: Li, Yufei, et autres
Publié: (2025)
Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence
par: Chen, Xinquan, et autres
Publié: (2026)
par: Chen, Xinquan, et autres
Publié: (2026)
ProbSelect: Stochastic Client Selection for GPU-Accelerated Compute Devices in the 3D Continuum
par: Stanisic, Andrija, et autres
Publié: (2025)
par: Stanisic, Andrija, et autres
Publié: (2025)
AEGIS: Scaling Long-Sequence Homomorphic Encrypted Transformer Inference via Hybrid Parallelism on Multi-GPU Systems
par: Gong, Zhaoting, et autres
Publié: (2026)
par: Gong, Zhaoting, et autres
Publié: (2026)
MSCCL++: Rethinking GPU Communication Abstractions for AI Inference
par: Hwang, Changho, et autres
Publié: (2025)
par: Hwang, Changho, et autres
Publié: (2025)
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
par: Zheng, Yijie, et autres
Publié: (2025)
par: Zheng, Yijie, et autres
Publié: (2025)
Thousand-GPU Large-Scale Training and Optimization Recipe for AI-Native Cloud Embodied Intelligence Infrastructure
par: Guo, Yongjian, et autres
Publié: (2026)
par: Guo, Yongjian, et autres
Publié: (2026)
GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems
par: VG, Jithin, et autres
Publié: (2025)
par: VG, Jithin, et autres
Publié: (2025)
Practical offloading for fine-tuning LLM on commodity GPU via learned sparse projectors
par: Chen, Siyuan, et autres
Publié: (2024)
par: Chen, Siyuan, et autres
Publié: (2024)
FairKV: Balancing Per-Head KV Cache for Fast Multi-GPU Inference
par: Zhao, Bingzhe, et autres
Publié: (2025)
par: Zhao, Bingzhe, et autres
Publié: (2025)
TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training
par: Liu, Man, et autres
Publié: (2026)
par: Liu, Man, et autres
Publié: (2026)
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
par: Wu, Qi, et autres
Publié: (2026)
par: Wu, Qi, et autres
Publié: (2026)
HPCTransCompile: An AI Compiler Generated Dataset for High-Performance CUDA Transpilation and LLM Preliminary Exploration
par: Lv, Jiaqi, et autres
Publié: (2025)
par: Lv, Jiaqi, et autres
Publié: (2025)
GPU Memory Prediction for Multimodal Model Training
par: Jeong, Jinwoo, et autres
Publié: (2025)
par: Jeong, Jinwoo, et autres
Publié: (2025)
AIBrix: Towards Scalable, Cost-Effective Large Language Model Inference Infrastructure
par: The AIBrix Team, et autres
Publié: (2025)
par: The AIBrix Team, et autres
Publié: (2025)
Act While Thinking: Accelerating LLM Agents via Pattern-Aware Speculative Tool Execution
par: Sui, Yifan, et autres
Publié: (2026)
par: Sui, Yifan, et autres
Publié: (2026)
Power- and Fragmentation-aware Online Scheduling for GPU Datacenters
par: Lettich, Francesco, et autres
Publié: (2024)
par: Lettich, Francesco, et autres
Publié: (2024)
UCCL-Zip: Lossless Compression Supercharged GPU Communication
par: Ma, Shuang, et autres
Publié: (2026)
par: Ma, Shuang, et autres
Publié: (2026)
A Survey on Large Language Model Acceleration based on KV Cache Management
par: Li, Haoyang, et autres
Publié: (2024)
par: Li, Haoyang, et autres
Publié: (2024)
Beyond the GPU: The Strategic Role of FPGAs in the Next Wave of AI
par: Jiménez, Arturo Urías
Publié: (2025)
par: Jiménez, Arturo Urías
Publié: (2025)
Lobster: A GPU-Accelerated Framework for Neurosymbolic Programming
par: Biberstein, Paul, et autres
Publié: (2025)
par: Biberstein, Paul, et autres
Publié: (2025)
FlashRecovery: Fast and Low-Cost Recovery from Failures for Large-Scale Training of LLMs
par: Zhang, Haijun, et autres
Publié: (2025)
par: Zhang, Haijun, et autres
Publié: (2025)
Tangram: Accelerating Serverless LLM Loading through GPU Memory Reuse and Affinity
par: Zhu, Wenbin, et autres
Publié: (2025)
par: Zhu, Wenbin, et autres
Publié: (2025)
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization
par: Tschand, Arya, et autres
Publié: (2025)
par: Tschand, Arya, et autres
Publié: (2025)
An Efficient Heterogeneous Co-Design for Fine-Tuning on a Single GPU
par: Yang, Ruijia, et autres
Publié: (2026)
par: Yang, Ruijia, et autres
Publié: (2026)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
par: He, Zifan, et autres
Publié: (2026)
par: He, Zifan, et autres
Publié: (2026)
Beluga: A CXL-Based Memory Architecture for Scalable and Efficient LLM KVCache Management
par: Yang, Xinjun, et autres
Publié: (2025)
par: Yang, Xinjun, et autres
Publié: (2025)
Accurate GPU Memory Prediction for Deep Learning Jobs through Dynamic Analysis
par: Shi, Jiabo, et autres
Publié: (2025)
par: Shi, Jiabo, et autres
Publié: (2025)
Reducing Fragmentation and Starvation in GPU Clusters through Dynamic Multi-Objective Scheduling
par: Mamirov, Akhmadillo
Publié: (2025)
par: Mamirov, Akhmadillo
Publié: (2025)
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
par: Spoczynski, Marcin, et autres
Publié: (2026)
par: Spoczynski, Marcin, et autres
Publié: (2026)
Why Should the Server Do It All?: A Scalable, Versatile, and Model-Agnostic Framework for Server-Light DNN Inference over Massively Distributed Clients via Training-Free Intermediate Feature Compression
par: Sung, Mingyu, et autres
Publié: (2025)
par: Sung, Mingyu, et autres
Publié: (2025)
Debunking the CUDA Myth Towards GPU-based AI Systems
par: Lee, Yunjae, et autres
Publié: (2024)
par: Lee, Yunjae, et autres
Publié: (2024)
Documents similaires
-
Accelerating Large Language Model Training with Hybrid GPU-based Compression
par: Xu, Lang, et autres
Publié: (2024) -
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
par: Zhao, Long, et autres
Publié: (2026) -
ClusterFusion: Expanding Operator Fusion Scope for LLM Inference via Cluster-Level Collective Primitive
par: Luo, Xinhao, et autres
Publié: (2025) -
ParaGAN: A Scalable Distributed Training Framework for Generative Adversarial Networks
par: Shi, Ziji, et autres
Publié: (2024) -
Speeding up Local Optimization in Vehicle Routing with Tensor-based GPU Acceleration
par: Lei, Zhenyu, et autres
Publié: (2025)