Asymmetric Virtual Memory Paging for Hybrid Mamba-Transformer Inference
Fuente:
arXiv
Guardado en:
| Autor principal: | Nguyen, An Xuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Predictive Multi-Tier Memory Management for KV Cache in Large-Scale GPU Inference
por: Ganjihal, Sanjeev Rao
Publicado: (2026)
por: Ganjihal, Sanjeev Rao
Publicado: (2026)
DDS: DPU-optimized Disaggregated Storage [Extended Report]
por: Zhang, Qizhen, et al.
Publicado: (2024)
por: Zhang, Qizhen, et al.
Publicado: (2024)
Sky$^ε$-Tree: Embracing the Batch Updates of B$^ε$-trees through Access Port Parallelism on Skyrmion Racetrack Memory
por: Tsai, Yu-Shiang, et al.
Publicado: (2024)
por: Tsai, Yu-Shiang, et al.
Publicado: (2024)
Reexamining Paradigms of End-to-End Data Movement
por: Fang, Chin, et al.
Publicado: (2025)
por: Fang, Chin, et al.
Publicado: (2025)
SLO-Guard: Crash-Aware, Budget-Consistent Autotuning for SLO-Constrained LLM Serving
por: Lysenstøen, Christian
Publicado: (2026)
por: Lysenstøen, Christian
Publicado: (2026)
Flexible Swapping for the Cloud
por: Pandurov, Milan, et al.
Publicado: (2024)
por: Pandurov, Milan, et al.
Publicado: (2024)
Vectorized Adaptive Histograms for Sparse Oblique Forests
por: Lubonja, Ariel, et al.
Publicado: (2026)
por: Lubonja, Ariel, et al.
Publicado: (2026)
Reproduction Research of FSA-Benchmark
por: Ludolf, Joshua, et al.
Publicado: (2024)
por: Ludolf, Joshua, et al.
Publicado: (2024)
Intelligent Cloud Orchestration: A Hybrid Predictive and Heuristic Framework for Cost Optimization
por: Nagoriya, Heet, et al.
Publicado: (2026)
por: Nagoriya, Heet, et al.
Publicado: (2026)
Cost-Aware Logging: Measuring the Financial Impact of Excessive Log Retention in Small-Scale Cloud Deployments
por: Putra, Jody Almaida
Publicado: (2026)
por: Putra, Jody Almaida
Publicado: (2026)
TokenCake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications
por: Bian, Zhuohang, et al.
Publicado: (2025)
por: Bian, Zhuohang, et al.
Publicado: (2025)
Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of vLLM and HuggingFace TGI
por: Kolluru, Saicharan
Publicado: (2025)
por: Kolluru, Saicharan
Publicado: (2025)
DF* PageRank: Improved Incrementally Expanding Approaches for Updating PageRank on Dynamic Graphs
por: Sahu, Subhajit
Publicado: (2024)
por: Sahu, Subhajit
Publicado: (2024)
Polynomial Histograms for Memory-Efficient Representation of Long-tailed System Distributions
por: Stokely, Murray, et al.
Publicado: (2026)
por: Stokely, Murray, et al.
Publicado: (2026)
Federated Fine-Tuning of LLMs on the Very Edge: The Good, the Bad, the Ugly
por: Woisetschläger, Herbert, et al.
Publicado: (2023)
por: Woisetschläger, Herbert, et al.
Publicado: (2023)
DNA sequence alignment: An assignment for OpenMP, MPI, and CUDA/OpenCL
por: Gonzalez-Escribano, Arturo, et al.
Publicado: (2024)
por: Gonzalez-Escribano, Arturo, et al.
Publicado: (2024)
Send: Objects, History, and Transactions in a Single-Verb Kernel
por: Goes, Christopher
Publicado: (2026)
por: Goes, Christopher
Publicado: (2026)
cfdSCOPE: A Fluid-Dynamics Proxy App for Teaching Performance Engineering
por: Arzt, Peter, et al.
Publicado: (2025)
por: Arzt, Peter, et al.
Publicado: (2025)
Lock-Free Computation of PageRank in Dynamic Graphs
por: Sahu, Subhajit
Publicado: (2024)
por: Sahu, Subhajit
Publicado: (2024)
Unlocking Python's Cores: Hardware Usage and Energy Implications of Removing the GIL
por: Salazar, José Daniel Montoya
Publicado: (2026)
por: Salazar, José Daniel Montoya
Publicado: (2026)
A Methodology to Assess Power Modeling in Energy-Aware Federated Learning on Heterogeneous Mobile Devices
por: Jallouli, Chaimae, et al.
Publicado: (2026)
por: Jallouli, Chaimae, et al.
Publicado: (2026)
Scheduling the Unschedulable: Taming Black-Box LLM Inference at Scale
por: Yuan, Renzhong, et al.
Publicado: (2026)
por: Yuan, Renzhong, et al.
Publicado: (2026)
An Incrementally Expanding Approach for Updating PageRank on Dynamic Graphs
por: Sahu, Subhajit
Publicado: (2024)
por: Sahu, Subhajit
Publicado: (2024)
TStore: Rethinking AI Model Hub with Tensor-Centric Compression
por: Lan, Tingfeng, et al.
Publicado: (2026)
por: Lan, Tingfeng, et al.
Publicado: (2026)
AutoChunk: Automated Activation Chunk for Memory-Efficient Long Sequence Inference
por: Zhao, Xuanlei, et al.
Publicado: (2024)
por: Zhao, Xuanlei, et al.
Publicado: (2024)
Token Arena: A Continuous Benchmark Unifying Energy and Cognition in AI Inference
por: Gao, Yuxuan, et al.
Publicado: (2026)
por: Gao, Yuxuan, et al.
Publicado: (2026)
CoFormer: Collaborating with Heterogeneous Edge Devices for Scalable Transformer Inference
por: Xu, Guanyu, et al.
Publicado: (2025)
por: Xu, Guanyu, et al.
Publicado: (2025)
PIM-STM: Software Transactional Memory for Processing-In-Memory Systems
por: Lopes, André, et al.
Publicado: (2024)
por: Lopes, André, et al.
Publicado: (2024)
SGDRC: Software-Defined Dynamic Resource Control for Concurrent DNN Inference on NVIDIA GPUs
por: Zhang, Yongkang, et al.
Publicado: (2024)
por: Zhang, Yongkang, et al.
Publicado: (2024)
Stream parallel skeleton optimization
por: Aldinucci, Marco, et al.
Publicado: (2024)
por: Aldinucci, Marco, et al.
Publicado: (2024)
StreamFlow: cross-breeding cloud with HPC
por: Colonnelli, Iacopo, et al.
Publicado: (2020)
por: Colonnelli, Iacopo, et al.
Publicado: (2020)
I/O in Machine Learning Applications on HPC Systems: A 360-degree Survey
por: Lewis, Noah, et al.
Publicado: (2024)
por: Lewis, Noah, et al.
Publicado: (2024)
KVDirect: Distributed Disaggregated LLM Inference
por: Chen, Shiyang, et al.
Publicado: (2024)
por: Chen, Shiyang, et al.
Publicado: (2024)
Multi-DNN Inference of Sparse Models on Edge SoCs
por: Luo, Jiawei, et al.
Publicado: (2026)
por: Luo, Jiawei, et al.
Publicado: (2026)
Glinthawk: A Two-Tiered Architecture for Offline LLM Inference
por: Hamadanian, Pouya, et al.
Publicado: (2025)
por: Hamadanian, Pouya, et al.
Publicado: (2025)
GVE-Louvain: Fast Louvain Algorithm for Community Detection in Shared Memory Setting
por: Sahu, Subhajit
Publicado: (2023)
por: Sahu, Subhajit
Publicado: (2023)
GVE-Leiden: Fast Leiden Algorithm for Community Detection in Shared Memory Setting
por: Sahu, Subhajit
Publicado: (2023)
por: Sahu, Subhajit
Publicado: (2023)
Libra: Unleashing GPU Heterogeneity for High-Performance Sparse Matrix Multiplication
por: Shi, Jinliang, et al.
Publicado: (2025)
por: Shi, Jinliang, et al.
Publicado: (2025)
IPA: Inference Pipeline Adaptation to Achieve High Accuracy and Cost-Efficiency
por: Ghafouri, Saeid, et al.
Publicado: (2023)
por: Ghafouri, Saeid, et al.
Publicado: (2023)
The Energy-Throughput Trade-off in Lossless-Compressed Source Code Storage
por: Ferragina, Paolo, et al.
Publicado: (2026)
por: Ferragina, Paolo, et al.
Publicado: (2026)
Ejemplares similares
-
Predictive Multi-Tier Memory Management for KV Cache in Large-Scale GPU Inference
por: Ganjihal, Sanjeev Rao
Publicado: (2026) -
DDS: DPU-optimized Disaggregated Storage [Extended Report]
por: Zhang, Qizhen, et al.
Publicado: (2024) -
Sky$^ε$-Tree: Embracing the Batch Updates of B$^ε$-trees through Access Port Parallelism on Skyrmion Racetrack Memory
por: Tsai, Yu-Shiang, et al.
Publicado: (2024) -
Reexamining Paradigms of End-to-End Data Movement
por: Fang, Chin, et al.
Publicado: (2025) -
SLO-Guard: Crash-Aware, Budget-Consistent Autotuning for SLO-Constrained LLM Serving
por: Lysenstøen, Christian
Publicado: (2026)