Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Skliar, Andrii, van Rozendaal, Ties, Lepert, Romain, Boinovski, Todor, van Baalen, Mart, Nagel, Markus, Whatmough, Paul, Bejnordi, Babak Ehteshami |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking
par: Federici, Marco, et autres
Publié: (2024)
par: Federici, Marco, et autres
Publié: (2024)
KaVa: Latent Reasoning via Compressed KV-Cache Distillation
par: Kuzina, Anna, et autres
Publié: (2025)
par: Kuzina, Anna, et autres
Publié: (2025)
Area-Efficient In-Memory Computing for Mixture-of-Experts via Multiplexing and Caching
par: Gao, Hanyuan, et autres
Publié: (2026)
par: Gao, Hanyuan, et autres
Publié: (2026)
Leech Lattice Vector Quantization for Efficient LLM Compression
par: van der Ouderaa, Tycho F. A., et autres
Publié: (2026)
par: van der Ouderaa, Tycho F. A., et autres
Publié: (2026)
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
par: Xu, Weikai, et autres
Publié: (2026)
par: Xu, Weikai, et autres
Publié: (2026)
Dirichlet-Prior Shaping: Guiding Expert Specialization in Upcycled MoEs
par: Mirvakhabova, Leyla, et autres
Publié: (2025)
par: Mirvakhabova, Leyla, et autres
Publié: (2025)
SliceMoE: Bit-Sliced Expert Caching under Miss-Rate Constraints for Efficient MoE Inference
par: Choi, Yuseon, et autres
Publié: (2025)
par: Choi, Yuseon, et autres
Publié: (2025)
Think Big, Generate Quick: LLM-to-SLM for Fast Autoregressive Decoding
par: Bergner, Benjamin, et autres
Publié: (2024)
par: Bergner, Benjamin, et autres
Publié: (2024)
PiKV: KV Cache Management System for Mixture of Experts
par: Liu, Dong, et autres
Publié: (2025)
par: Liu, Dong, et autres
Publié: (2025)
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
par: Bambhaniya, Abhimanyu, et autres
Publié: (2026)
par: Bambhaniya, Abhimanyu, et autres
Publié: (2026)
Rethinking LLM Inference Bottlenecks: Insights from Latent Attention and Mixture-of-Experts
par: Yun, Sungmin, et autres
Publié: (2025)
par: Yun, Sungmin, et autres
Publié: (2025)
Context-Aware Mixture-of-Experts Inference on CXL-Enabled GPU-NDP Systems
par: Fan, Zehao, et autres
Publié: (2025)
par: Fan, Zehao, et autres
Publié: (2025)
Sieve: Dynamic Expert-Aware PIM Acceleration for Evolving Mixture-of-Experts Models
par: Kim, Jungwoo, et autres
Publié: (2026)
par: Kim, Jungwoo, et autres
Publié: (2026)
Multi-Dimensional Vector ISA Extension for Mobile In-Cache Computing
par: Khadem, Alireza, et autres
Publié: (2025)
par: Khadem, Alireza, et autres
Publié: (2025)
Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
par: Yun, Sungmin, et autres
Publié: (2024)
par: Yun, Sungmin, et autres
Publié: (2024)
VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
par: Yao, Jiayi, et autres
Publié: (2026)
par: Yao, Jiayi, et autres
Publié: (2026)
Nemo: A Low-Write-Amplification Cache for Tiny Objects on Log-Structured Flash Devices
par: Yang, Xufeng, et autres
Publié: (2026)
par: Yang, Xufeng, et autres
Publié: (2026)
SSD Offloading for LLM Mixture-of-Experts Weights Considered Harmful in Energy Efficiency
par: Kyung, Kwanhee, et autres
Publié: (2025)
par: Kyung, Kwanhee, et autres
Publié: (2025)
Characterizing Soft-Error Resiliency in Arm's Ethos-U55 Embedded Machine Learning Accelerator
par: Tyagi, Abhishek, et autres
Publié: (2024)
par: Tyagi, Abhishek, et autres
Publié: (2024)
Comparative Characterization of KV Cache Management Strategies for LLM Inference
par: Mamo, Oteo, et autres
Publié: (2026)
par: Mamo, Oteo, et autres
Publié: (2026)
CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGA
par: Dong, Jiale, et autres
Publié: (2025)
par: Dong, Jiale, et autres
Publié: (2025)
DCI: A Coordinated Allocation and Filling Workload-Aware Dual-Cache Allocation GNN Inference Acceleration System
par: Luo, Yi, et autres
Publié: (2025)
par: Luo, Yi, et autres
Publié: (2025)
Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference
par: Hwang, Ranggi, et autres
Publié: (2023)
par: Hwang, Ranggi, et autres
Publié: (2023)
UbiMoE: A Ubiquitous Mixture-of-Experts Vision Transformer Accelerator With Hybrid Computation Pattern on FPGA
par: Dong, Jiale, et autres
Publié: (2025)
par: Dong, Jiale, et autres
Publié: (2025)
A3D-MoE: Acceleration of Large Language Models with Mixture of Experts via 3D Heterogeneous Integration
par: Huang, Wei-Hsing, et autres
Publié: (2025)
par: Huang, Wei-Hsing, et autres
Publié: (2025)
UniCAIM: A Unified CAM/CIM Architecture with Static-Dynamic KV Cache Pruning for Efficient Long-Context LLM Inference
par: Xu, Weikai, et autres
Publié: (2025)
par: Xu, Weikai, et autres
Publié: (2025)
I/O Transit Caching for PMem-based Block Device
par: Xu, Qing, et autres
Publié: (2024)
par: Xu, Qing, et autres
Publié: (2024)
Cambricon-LLM: A Chiplet-Based Hybrid Architecture for On-Device Inference of 70B LLM
par: Yu, Zhongkai, et autres
Publié: (2024)
par: Yu, Zhongkai, et autres
Publié: (2024)
VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices
par: Lin, Zi-Wei, et autres
Publié: (2026)
par: Lin, Zi-Wei, et autres
Publié: (2026)
NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference
par: Hao, Mingbo, et autres
Publié: (2026)
par: Hao, Mingbo, et autres
Publié: (2026)
AxMoE: Characterizing the Impact of Approximate Multipliers on Mixture-of-Experts DNN Architectures
par: Shende, Omkar B, et autres
Publié: (2026)
par: Shende, Omkar B, et autres
Publié: (2026)
Exploring DRAM Cache Prefetching for Pooled Memory
par: Tirumalasetty, Chandrahas, et autres
Publié: (2024)
par: Tirumalasetty, Chandrahas, et autres
Publié: (2024)
Potential and Limitation of High-Frequency Cores and Caches
par: Pai, Kunal, et autres
Publié: (2024)
par: Pai, Kunal, et autres
Publié: (2024)
TDRAM: Tag-enhanced DRAM for Efficient Caching
par: Babaie, Maryam, et autres
Publié: (2024)
par: Babaie, Maryam, et autres
Publié: (2024)
BackCache: Mitigating Contention-Based Cache Timing Attacks by Hiding Cache Line Evictions
par: Wang, Quancheng, et autres
Publié: (2023)
par: Wang, Quancheng, et autres
Publié: (2023)
Accelerating Boolean Constraint Propagation for Efficient SAT-Solving on FPGAs
par: Govindasamy, Hariprasadh, et autres
Publié: (2024)
par: Govindasamy, Hariprasadh, et autres
Publié: (2024)
ICGMM: CXL-enabled Memory Expansion with Intelligent Caching Using Gaussian Mixture Model
par: Chen, Hanqiu, et autres
Publié: (2024)
par: Chen, Hanqiu, et autres
Publié: (2024)
LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
par: He, Siyuan, et autres
Publié: (2025)
par: He, Siyuan, et autres
Publié: (2025)
GCC: A 3DGS Inference Architecture with Gaussian-Wise and Cross-Stage Conditional Processing
par: Pei, Minnan, et autres
Publié: (2025)
par: Pei, Minnan, et autres
Publié: (2025)
Hierarchical Mixture of Experts: Generalizable Learning for High-Level Synthesis
par: Li, Weikai, et autres
Publié: (2024)
par: Li, Weikai, et autres
Publié: (2024)
Documents similaires
-
Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking
par: Federici, Marco, et autres
Publié: (2024) -
KaVa: Latent Reasoning via Compressed KV-Cache Distillation
par: Kuzina, Anna, et autres
Publié: (2025) -
Area-Efficient In-Memory Computing for Mixture-of-Experts via Multiplexing and Caching
par: Gao, Hanyuan, et autres
Publié: (2026) -
Leech Lattice Vector Quantization for Efficient LLM Compression
par: van der Ouderaa, Tycho F. A., et autres
Publié: (2026) -
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
par: Xu, Weikai, et autres
Publié: (2026)