Speeding up Local Optimization in Vehicle Routing with Tensor-based GPU Acceleration
Fuente:
arXiv
Guardado en:
| Autores principales: | Lei, Zhenyu, Hao, Jin-Kao, Wu, Qinghua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A GPU-Accelerated Hybrid Method for a Class of Multi-Depot Vehicle Routing Problems
por: Lei, Zhenyu, et al.
Publicado: (2026)
por: Lei, Zhenyu, et al.
Publicado: (2026)
Accelerating Large Language Model Training with Hybrid GPU-based Compression
por: Xu, Lang, et al.
Publicado: (2024)
por: Xu, Lang, et al.
Publicado: (2024)
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
por: Zhao, Long, et al.
Publicado: (2026)
por: Zhao, Long, et al.
Publicado: (2026)
Towards Scalable GPU-Accelerated SNN Training via Temporal Fusion
por: Li, Yanchen, et al.
Publicado: (2024)
por: Li, Yanchen, et al.
Publicado: (2024)
FedPAW: Federated Learning with Personalized Aggregation Weights for Urban Vehicle Speed Prediction
por: He, Yuepeng, et al.
Publicado: (2024)
por: He, Yuepeng, et al.
Publicado: (2024)
HadaCore: Tensor Core Accelerated Hadamard Transform Kernel
por: Agarwal, Krish, et al.
Publicado: (2024)
por: Agarwal, Krish, et al.
Publicado: (2024)
Accelerated Digital Twin Learning for Edge AI: A Comparison of FPGA and Mobile GPU
por: Xu, Bin, et al.
Publicado: (2025)
por: Xu, Bin, et al.
Publicado: (2025)
MSCCL++: Rethinking GPU Communication Abstractions for AI Inference
por: Hwang, Changho, et al.
Publicado: (2025)
por: Hwang, Changho, et al.
Publicado: (2025)
ProbSelect: Stochastic Client Selection for GPU-Accelerated Compute Devices in the 3D Continuum
por: Stanisic, Andrija, et al.
Publicado: (2025)
por: Stanisic, Andrija, et al.
Publicado: (2025)
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization
por: Tschand, Arya, et al.
Publicado: (2025)
por: Tschand, Arya, et al.
Publicado: (2025)
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
por: Spoczynski, Marcin, et al.
Publicado: (2026)
por: Spoczynski, Marcin, et al.
Publicado: (2026)
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
por: Wijeratne, Sasindu, et al.
Publicado: (2025)
por: Wijeratne, Sasindu, et al.
Publicado: (2025)
GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems
por: VG, Jithin, et al.
Publicado: (2025)
por: VG, Jithin, et al.
Publicado: (2025)
UCCL-Zip: Lossless Compression Supercharged GPU Communication
por: Ma, Shuang, et al.
Publicado: (2026)
por: Ma, Shuang, et al.
Publicado: (2026)
A Survey on Large Language Model Acceleration based on KV Cache Management
por: Li, Haoyang, et al.
Publicado: (2024)
por: Li, Haoyang, et al.
Publicado: (2024)
Accelerating Drug Discovery in AutoDock-GPU with Tensor Cores
por: Schieffer, Gabin, et al.
Publicado: (2024)
por: Schieffer, Gabin, et al.
Publicado: (2024)
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
por: Wu, Qi, et al.
Publicado: (2026)
por: Wu, Qi, et al.
Publicado: (2026)
TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training
por: Liu, Man, et al.
Publicado: (2026)
por: Liu, Man, et al.
Publicado: (2026)
Speeding up Policy Simulation in Supply Chain RL
por: Farias, Vivek, et al.
Publicado: (2024)
por: Farias, Vivek, et al.
Publicado: (2024)
Power- and Fragmentation-aware Online Scheduling for GPU Datacenters
por: Lettich, Francesco, et al.
Publicado: (2024)
por: Lettich, Francesco, et al.
Publicado: (2024)
Beyond the GPU: The Strategic Role of FPGAs in the Next Wave of AI
por: Jiménez, Arturo Urías
Publicado: (2025)
por: Jiménez, Arturo Urías
Publicado: (2025)
STAGE: A Symbolic Tensor grAph GEnerator for distributed AI system co-design
por: Man, Changhai, et al.
Publicado: (2025)
por: Man, Changhai, et al.
Publicado: (2025)
An Efficient Heterogeneous Co-Design for Fine-Tuning on a Single GPU
por: Yang, Ruijia, et al.
Publicado: (2026)
por: Yang, Ruijia, et al.
Publicado: (2026)
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
por: Zheng, Yijie, et al.
Publicado: (2025)
por: Zheng, Yijie, et al.
Publicado: (2025)
Accurate GPU Memory Prediction for Deep Learning Jobs through Dynamic Analysis
por: Shi, Jiabo, et al.
Publicado: (2025)
por: Shi, Jiabo, et al.
Publicado: (2025)
Reducing Fragmentation and Starvation in GPU Clusters through Dynamic Multi-Objective Scheduling
por: Mamirov, Akhmadillo
Publicado: (2025)
por: Mamirov, Akhmadillo
Publicado: (2025)
D$^{2}$MoE: Dual Routing and Dynamic Scheduling for Efficient On-Device MoE-based LLM Serving
por: Wang, Haodong, et al.
Publicado: (2025)
por: Wang, Haodong, et al.
Publicado: (2025)
A Preliminary Study on Accelerating Simulation Optimization with GPU Implementation
por: He, Jinghai, et al.
Publicado: (2024)
por: He, Jinghai, et al.
Publicado: (2024)
Latency-Aware 2-Opt Monotonic Local Search for Distributed Constraint Optimization
por: Rachmut, Ben, et al.
Publicado: (2025)
por: Rachmut, Ben, et al.
Publicado: (2025)
Dynamic Pricing for Electric Vehicle Charging
por: Kalakanti, Arun Kumar, et al.
Publicado: (2024)
por: Kalakanti, Arun Kumar, et al.
Publicado: (2024)
PolyKAN: Efficient Fused GPU Operators for Polynomial Kolmogorov-Arnold Network Variants
por: Yu, Mingkun, et al.
Publicado: (2025)
por: Yu, Mingkun, et al.
Publicado: (2025)
FairKV: Balancing Per-Head KV Cache for Fast Multi-GPU Inference
por: Zhao, Bingzhe, et al.
Publicado: (2025)
por: Zhao, Bingzhe, et al.
Publicado: (2025)
Practical offloading for fine-tuning LLM on commodity GPU via learned sparse projectors
por: Chen, Siyuan, et al.
Publicado: (2024)
por: Chen, Siyuan, et al.
Publicado: (2024)
Watt Counts: Energy-Aware Benchmark for Sustainable LLM Inference on Heterogeneous GPU Architectures
por: Argerich, Mauricio Fadel, et al.
Publicado: (2026)
por: Argerich, Mauricio Fadel, et al.
Publicado: (2026)
Tangram: Accelerating Serverless LLM Loading through GPU Memory Reuse and Affinity
por: Zhu, Wenbin, et al.
Publicado: (2025)
por: Zhu, Wenbin, et al.
Publicado: (2025)
A Parallel CPU-GPU Framework for Batching Heuristic Operations in Depth-First Heuristic Search
por: Futuhi, Ehsan, et al.
Publicado: (2025)
por: Futuhi, Ehsan, et al.
Publicado: (2025)
Act While Thinking: Accelerating LLM Agents via Pattern-Aware Speculative Tool Execution
por: Sui, Yifan, et al.
Publicado: (2026)
por: Sui, Yifan, et al.
Publicado: (2026)
iOS as Acceleration
por: Chen, Alexander K.
Publicado: (2025)
por: Chen, Alexander K.
Publicado: (2025)
TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training
por: Ye, Chenhao, et al.
Publicado: (2026)
por: Ye, Chenhao, et al.
Publicado: (2026)
Thousand-GPU Large-Scale Training and Optimization Recipe for AI-Native Cloud Embodied Intelligence Infrastructure
por: Guo, Yongjian, et al.
Publicado: (2026)
por: Guo, Yongjian, et al.
Publicado: (2026)
Ejemplares similares
-
A GPU-Accelerated Hybrid Method for a Class of Multi-Depot Vehicle Routing Problems
por: Lei, Zhenyu, et al.
Publicado: (2026) -
Accelerating Large Language Model Training with Hybrid GPU-based Compression
por: Xu, Lang, et al.
Publicado: (2024) -
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
por: Zhao, Long, et al.
Publicado: (2026) -
Towards Scalable GPU-Accelerated SNN Training via Temporal Fusion
por: Li, Yanchen, et al.
Publicado: (2024) -
FedPAW: Federated Learning with Personalized Aggregation Weights for Urban Vehicle Speed Prediction
por: He, Yuepeng, et al.
Publicado: (2024)