RIMMS: Runtime Integrated Memory Management System for Heterogeneous Computing
Fuente:
arXiv
Salvato in:
| Autori principali: | Gener, Serhan, Ukarande, Aditya, Murthy, Shilpa Mysore Srinivasa, Hassan, Sahil, Mack, Joshua, Chakrabarti, Chaitali, Ogras, Umit, Akoglu, Ali |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
di: Sharma, Harsh, et al.
Pubblicazione: (2023)
di: Sharma, Harsh, et al.
Pubblicazione: (2023)
Efficient, VRAM-Constrained xLM Inference on Clients
di: Ukarande, Aditya, et al.
Pubblicazione: (2026)
di: Ukarande, Aditya, et al.
Pubblicazione: (2026)
DUET: Disaggregated Hybrid Mamba-Transformer LLMs with Prefill and Decode-Specific Packages
di: Kanani, Alish, et al.
Pubblicazione: (2026)
di: Kanani, Alish, et al.
Pubblicazione: (2026)
Towards an Adaptive Runtime System for Cloud-Native HPC
di: Bhosale, Aditya, et al.
Pubblicazione: (2026)
di: Bhosale, Aditya, et al.
Pubblicazione: (2026)
Jenga: Effective Memory Management for Serving LLM with Heterogeneity
di: Zhang, Chen, et al.
Pubblicazione: (2025)
di: Zhang, Chen, et al.
Pubblicazione: (2025)
SYMPHONY: Improving Memory Management for LLM Inference Workloads
di: Agarwal, Saurabh, et al.
Pubblicazione: (2024)
di: Agarwal, Saurabh, et al.
Pubblicazione: (2024)
On the Runtime of Local Mutual Exclusion for Anonymous Dynamic Networks
di: Chaturvedi, Anya, et al.
Pubblicazione: (2025)
di: Chaturvedi, Anya, et al.
Pubblicazione: (2025)
Junctiond: Extending FaaS Runtimes with Kernel-Bypass
di: Saurez, Enrique, et al.
Pubblicazione: (2024)
di: Saurez, Enrique, et al.
Pubblicazione: (2024)
INSPIRIT: Optimizing Heterogeneous Task Scheduling through Adaptive Priority in Task-based Runtime Systems
di: Wang, Yiqing, et al.
Pubblicazione: (2024)
di: Wang, Yiqing, et al.
Pubblicazione: (2024)
AME: An Efficient Heterogeneous Agentic Memory Engine for Smartphones
di: Zhao, Xinkui, et al.
Pubblicazione: (2025)
di: Zhao, Xinkui, et al.
Pubblicazione: (2025)
Coordinated Power Management on Heterogeneous Systems
di: Zheng, Zhong, et al.
Pubblicazione: (2025)
di: Zheng, Zhong, et al.
Pubblicazione: (2025)
Mapping Large Memory-constrained Workflows onto Heterogeneous Platforms
di: Kulagina, Svetlana, et al.
Pubblicazione: (2024)
di: Kulagina, Svetlana, et al.
Pubblicazione: (2024)
Memory-aware Adaptive Scheduling of Scientific Workflows on Heterogeneous Architectures
di: Kulagina, Svetlana, et al.
Pubblicazione: (2025)
di: Kulagina, Svetlana, et al.
Pubblicazione: (2025)
Bridging Memory Gaps: Scaling Federated Learning for Heterogeneous Clients
di: Wu, Yebo, et al.
Pubblicazione: (2024)
di: Wu, Yebo, et al.
Pubblicazione: (2024)
Automatic Tracing in Task-Based Runtime Systems
di: Yadav, Rohan, et al.
Pubblicazione: (2024)
di: Yadav, Rohan, et al.
Pubblicazione: (2024)
An AI-Native Runtime for Multi-Wearable Environments
di: Min, Chulhong, et al.
Pubblicazione: (2024)
di: Min, Chulhong, et al.
Pubblicazione: (2024)
Memory Lower Bounds and Impossibility Results for Anonymous Dynamic Broadcast
di: Parzych, Garrett, et al.
Pubblicazione: (2024)
di: Parzych, Garrett, et al.
Pubblicazione: (2024)
Seer: Predictive Runtime Kernel Selection for Irregular Problems
di: Swann, Ryan, et al.
Pubblicazione: (2024)
di: Swann, Ryan, et al.
Pubblicazione: (2024)
Asynchronous Wait-Free Runtime Verification and Enforcement of Linearizability
di: Castañeda, Armando, et al.
Pubblicazione: (2023)
di: Castañeda, Armando, et al.
Pubblicazione: (2023)
Marionette: Data Structure Description and Management for Heterogeneous Computing
di: Fernandes, Nuno dos Santos, et al.
Pubblicazione: (2025)
di: Fernandes, Nuno dos Santos, et al.
Pubblicazione: (2025)
Accelerating Nonlinear Time-History Analysis with Complex Constitutive Laws via Heterogeneous Memory Management: From 3D Seismic Simulation to Neural Network Training
di: Ichimura, Tsuyoshi, et al.
Pubblicazione: (2026)
di: Ichimura, Tsuyoshi, et al.
Pubblicazione: (2026)
Heterogeneity-Aware Memory Efficient Federated Learning via Progressive Layer Freezing
di: Yebo, Wu, et al.
Pubblicazione: (2024)
di: Yebo, Wu, et al.
Pubblicazione: (2024)
Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services
di: Chen, Haoyu, et al.
Pubblicazione: (2025)
di: Chen, Haoyu, et al.
Pubblicazione: (2025)
TURNIP: A "Nondeterministic" GPU Runtime with CPU RAM Offload
di: Ding, Zhimin, et al.
Pubblicazione: (2024)
di: Ding, Zhimin, et al.
Pubblicazione: (2024)
Memory-Efficient Split Federated Learning for LLM Fine-Tuning on Heterogeneous Mobile Devices
di: Chen, Xiaopei, et al.
Pubblicazione: (2025)
di: Chen, Xiaopei, et al.
Pubblicazione: (2025)
Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters
di: Chang, Zihan, et al.
Pubblicazione: (2024)
di: Chang, Zihan, et al.
Pubblicazione: (2024)
Efficient and Portable Support for Overdecomposition on Distributed Memory GPGPU Platforms
di: Bhosale, Aditya, et al.
Pubblicazione: (2026)
di: Bhosale, Aditya, et al.
Pubblicazione: (2026)
Asynchronous Fault-Tolerant Language Decidability for Runtime Verification of Distributed Systems
di: Castañeda, Armando, et al.
Pubblicazione: (2025)
di: Castañeda, Armando, et al.
Pubblicazione: (2025)
Privacy-Preserving Sharing of Data Analytics Runtime Metrics for Performance Modeling
di: Will, Jonathan, et al.
Pubblicazione: (2024)
di: Will, Jonathan, et al.
Pubblicazione: (2024)
Integrating and Characterizing HPC Task Runtime Systems for hybrid AI-HPC workloads
di: Merzky, Andre, et al.
Pubblicazione: (2025)
di: Merzky, Andre, et al.
Pubblicazione: (2025)
Fail-Closed Lowering of Resident KV Claims onto LLM Serving Runtimes
di: Stepanek, Lukas
Pubblicazione: (2026)
di: Stepanek, Lukas
Pubblicazione: (2026)
WANify: Gauging and Balancing Runtime WAN Bandwidth for Geo-distributed Data Analytics
di: Mohapatra, Anshuman Das, et al.
Pubblicazione: (2025)
di: Mohapatra, Anshuman Das, et al.
Pubblicazione: (2025)
Squeezing Edge Performance: A Sensitivity-Aware Container Management for Heterogeneous Tasks
di: Zhang, Yongmin, et al.
Pubblicazione: (2025)
di: Zhang, Yongmin, et al.
Pubblicazione: (2025)
EcoShift: Performance-Aware Power Management for Power-Constrained Heterogeneous Systems
di: Zheng, Zhong, et al.
Pubblicazione: (2026)
di: Zheng, Zhong, et al.
Pubblicazione: (2026)
eLLM: Elastic Memory Management Framework for Efficient LLM Serving
di: Xu, Jiale, et al.
Pubblicazione: (2025)
di: Xu, Jiale, et al.
Pubblicazione: (2025)
Understanding Power Consumption Metric on Heterogeneous Memory Systems
di: Proaño, Andrès Rubio, et al.
Pubblicazione: (2024)
di: Proaño, Andrès Rubio, et al.
Pubblicazione: (2024)
Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
FlexiWalker: Extensible GPU Framework for Efficient Dynamic Random Walks with Runtime Adaptation
di: Park, Seongyeon, et al.
Pubblicazione: (2025)
di: Park, Seongyeon, et al.
Pubblicazione: (2025)
Lumos: Performance Characterization of WebAssembly as a Serverless Runtime in the Edge-Cloud Continuum
di: Marcelino, Cynthia, et al.
Pubblicazione: (2025)
di: Marcelino, Cynthia, et al.
Pubblicazione: (2025)
ARGO: An Auto-Tuning Runtime System for Scalable GNN Training on Multi-Core Processor
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
di: Sharma, Harsh, et al.
Pubblicazione: (2023) -
Efficient, VRAM-Constrained xLM Inference on Clients
di: Ukarande, Aditya, et al.
Pubblicazione: (2026) -
DUET: Disaggregated Hybrid Mamba-Transformer LLMs with Prefill and Decode-Specific Packages
di: Kanani, Alish, et al.
Pubblicazione: (2026) -
Towards an Adaptive Runtime System for Cloud-Native HPC
di: Bhosale, Aditya, et al.
Pubblicazione: (2026) -
Jenga: Effective Memory Management for Serving LLM with Heterogeneity
di: Zhang, Chen, et al.
Pubblicazione: (2025)