Cooling Matters: Benchmarking Large Language Models and Vision-Language Models on Liquid-Cooled Versus Air-Cooled H100 GPU Systems
Fuente:
arXiv
Saved in:
| Main Authors: | Latif, Imran, Shafique, Muhammad Ali, Ullah, Hayat, Newkirk, Alex C., Yu, Xi, Munir, Arslan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Coordinated Cooling and Compute Management for AI Datacenters
by: Abera, Nardos Belay, et al.
Published: (2026)
by: Abera, Nardos Belay, et al.
Published: (2026)
DCGen 1.1 Technical Report: Generating Datacenter Configurations (including IT, Power, Cooling)
by: Gnibga, Wedan Emmanuel, et al.
Published: (2026)
by: Gnibga, Wedan Emmanuel, et al.
Published: (2026)
Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management
by: Qianli, Liu, et al.
Published: (2025)
by: Qianli, Liu, et al.
Published: (2025)
A Two-Level Thermal Cycling-aware Task Mapping Technique for Reliability Management in Manycore Systems
by: Khani, Fatemeh Hossein, et al.
Published: (2024)
by: Khani, Fatemeh Hossein, et al.
Published: (2024)
LoHan: Low-Cost High-Performance Framework to Fine-Tune 100B Model on a Consumer GPU
by: Liao, Changyue, et al.
Published: (2024)
by: Liao, Changyue, et al.
Published: (2024)
Benchmarking the Performance of Large Language Models on the Cerebras Wafer Scale Engine
by: Zhang, Zuoning, et al.
Published: (2024)
by: Zhang, Zuoning, et al.
Published: (2024)
CacheFL: Privacy-Preserving and Efficient Federated Cache Model Fine-Tuning for Vision-Language Models
by: Yi, Mengjun, et al.
Published: (2025)
by: Yi, Mengjun, et al.
Published: (2025)
Semantic-Aware Scheduling for GPU Clusters with Large Language Models
by: Wang, Zerui, et al.
Published: (2025)
by: Wang, Zerui, et al.
Published: (2025)
SkyHOST: A Unified Architecture for Cross-Cloud Hybrid Object and Stream Transfer
by: Tariq, Muhammad Arslan, et al.
Published: (2026)
by: Tariq, Muhammad Arslan, et al.
Published: (2026)
Accelerating Large Language Model Training with Hybrid GPU-based Compression
by: Xu, Lang, et al.
Published: (2024)
by: Xu, Lang, et al.
Published: (2024)
LLMPerf: GPU Performance Modeling meets Large Language Models
by: Nguyen, Khoi N. M., et al.
Published: (2025)
by: Nguyen, Khoi N. M., et al.
Published: (2025)
City-Scale Visibility Graph Analysis via GPU-Accelerated HyperBall
by: Hodge, Alex, et al.
Published: (2026)
by: Hodge, Alex, et al.
Published: (2026)
Cephalo: Harnessing Heterogeneous GPU Clusters for Training Transformer Models
by: Guo, Runsheng Benson, et al.
Published: (2024)
by: Guo, Runsheng Benson, et al.
Published: (2024)
AGILE: Lightweight and Efficient Asynchronous GPU-SSD Integration
by: Yang, Zhuoping, et al.
Published: (2025)
by: Yang, Zhuoping, et al.
Published: (2025)
Mélange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity
by: Griggs, Tyler, et al.
Published: (2024)
by: Griggs, Tyler, et al.
Published: (2024)
CityPulse: Real-Time Traffic Data Analytics and Congestion Prediction
by: Teledjieu, Idriss Djiofack, et al.
Published: (2025)
by: Teledjieu, Idriss Djiofack, et al.
Published: (2025)
Evaluation of Programming Models and Performance for Stencil Computation on Current GPU Architectures
by: Shan, Baodi, et al.
Published: (2024)
by: Shan, Baodi, et al.
Published: (2024)
An Edge-based WiFi Fingerprinting Indoor Localization Using Convolutional Neural Network and Convolutional Auto-Encoder
by: Kargar-Barzi, Amin, et al.
Published: (2023)
by: Kargar-Barzi, Amin, et al.
Published: (2023)
scaleTRIM: Scalable TRuncation-Based Integer Approximate Multiplier with Linearization and Compensation
by: Farahmand, Ebrahim, et al.
Published: (2023)
by: Farahmand, Ebrahim, et al.
Published: (2023)
HarMoEny: Efficient Multi-GPU Inference of MoE Models
by: Doucet, Zachary, et al.
Published: (2025)
by: Doucet, Zachary, et al.
Published: (2025)
HPC Digital Twins for Evaluating Scheduling Policies, Incentive Structures and their Impact on Power and Cooling
by: Maiterth, Matthias, et al.
Published: (2025)
by: Maiterth, Matthias, et al.
Published: (2025)
Intel(R) SHMEM: GPU-initiated OpenSHMEM using SYCL
by: Brooks, Alex, et al.
Published: (2024)
by: Brooks, Alex, et al.
Published: (2024)
SPIN: Accelerating Large Language Model Inference with Heterogeneous Speculative Models
by: Chen, Fahao, et al.
Published: (2025)
by: Chen, Fahao, et al.
Published: (2025)
MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU
by: Yuan, Zhengqing, et al.
Published: (2026)
by: Yuan, Zhengqing, et al.
Published: (2026)
Comparative Study of Large Language Model Architectures on Frontier
by: Yin, Junqi, et al.
Published: (2024)
by: Yin, Junqi, et al.
Published: (2024)
SLO-Aware Scheduling for Large Language Model Inferences
by: Huang, Jinqi, et al.
Published: (2025)
by: Huang, Jinqi, et al.
Published: (2025)
Improving GPU Multi-Tenancy Through Dynamic Multi-Instance GPU Reconfiguration
by: Wang, Tianyu, et al.
Published: (2024)
by: Wang, Tianyu, et al.
Published: (2024)
Taking GPU Programming Models to Task for Performance Portability
by: Davis, Joshua H., et al.
Published: (2024)
by: Davis, Joshua H., et al.
Published: (2024)
DeepServe: Serverless Large Language Model Serving at Scale
by: Hu, Junhao, et al.
Published: (2025)
by: Hu, Junhao, et al.
Published: (2025)
Cascadia: An Efficient Cascade Serving System for Large Language Models
by: Jiang, Youhe, et al.
Published: (2025)
by: Jiang, Youhe, et al.
Published: (2025)
Characterizing Communication Patterns in Distributed Large Language Model Inference
by: Xu, Lang, et al.
Published: (2025)
by: Xu, Lang, et al.
Published: (2025)
Split Fine-Tuning for Large Language Models in Wireless Networks
by: Zhang, Songge, et al.
Published: (2025)
by: Zhang, Songge, et al.
Published: (2025)
Weighted Matching in a Poly-Streaming Model
by: Ullah, Ahammed, et al.
Published: (2025)
by: Ullah, Ahammed, et al.
Published: (2025)
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
by: Zhang, Zili, et al.
Published: (2024)
by: Zhang, Zili, et al.
Published: (2024)
Accelerating Biclique Counting on GPU
by: Qiu, Linshan, et al.
Published: (2024)
by: Qiu, Linshan, et al.
Published: (2024)
GPU Sharing with Triples Mode
by: Byun, Chansup, et al.
Published: (2024)
by: Byun, Chansup, et al.
Published: (2024)
ParvaGPU: Efficient Spatial GPU Sharing for Large-Scale DNN Inference in Cloud Environments
by: Lee, Munkyu, et al.
Published: (2024)
by: Lee, Munkyu, et al.
Published: (2024)
Accelerating Intra-Node GPU-to-GPU Communication Through Multi-Path Transfers with CUDA Graphs
by: Sojoodi, Amirhossein, et al.
Published: (2026)
by: Sojoodi, Amirhossein, et al.
Published: (2026)
NanoFlow: Towards Optimal Large Language Model Serving Throughput
by: Zhu, Kan, et al.
Published: (2024)
by: Zhu, Kan, et al.
Published: (2024)
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
by: Ma, Chenxiang, et al.
Published: (2025)
by: Ma, Chenxiang, et al.
Published: (2025)
Similar Items
-
Coordinated Cooling and Compute Management for AI Datacenters
by: Abera, Nardos Belay, et al.
Published: (2026) -
DCGen 1.1 Technical Report: Generating Datacenter Configurations (including IT, Power, Cooling)
by: Gnibga, Wedan Emmanuel, et al.
Published: (2026) -
Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management
by: Qianli, Liu, et al.
Published: (2025) -
A Two-Level Thermal Cycling-aware Task Mapping Technique for Reliability Management in Manycore Systems
by: Khani, Fatemeh Hossein, et al.
Published: (2024) -
LoHan: Low-Cost High-Performance Framework to Fine-Tune 100B Model on a Consumer GPU
by: Liao, Changyue, et al.
Published: (2024)