RadixMLP -- Intra-batch Deduplication for Causal Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Feil, Michael, Lipp, Julius |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap
di: Lin, Wenxiang, et al.
Pubblicazione: (2025)
di: Lin, Wenxiang, et al.
Pubblicazione: (2025)
Enhancing Physics-Informed Neural Networks with a Hybrid Parallel Kolmogorov-Arnold and MLP Architecture
di: Xu, Zuyu, et al.
Pubblicazione: (2025)
di: Xu, Zuyu, et al.
Pubblicazione: (2025)
Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving
di: Shi, Xiaoxiang, et al.
Pubblicazione: (2025)
di: Shi, Xiaoxiang, et al.
Pubblicazione: (2025)
RAPID-Serve: Resource-efficient and Accelerated P/D Intra-GPU Disaggregation
di: Masood, Amna, et al.
Pubblicazione: (2026)
di: Masood, Amna, et al.
Pubblicazione: (2026)
Vectorized Sequence-Based Chunking for Data Deduplication
di: Udayashankar, Sreeharsha, et al.
Pubblicazione: (2025)
di: Udayashankar, Sreeharsha, et al.
Pubblicazione: (2025)
Drift-Aware Federated Learning: A Causal Perspective
di: Fang, Yunjie, et al.
Pubblicazione: (2025)
di: Fang, Yunjie, et al.
Pubblicazione: (2025)
AcceleratedLiNGAM: Learning Causal DAGs at the speed of GPUs
di: Akinwande, Victor, et al.
Pubblicazione: (2024)
di: Akinwande, Victor, et al.
Pubblicazione: (2024)
A Distributed Framework for Causal Modeling of Performance Variability in GPU Traces
di: Lahiry, Ankur, et al.
Pubblicazione: (2025)
di: Lahiry, Ankur, et al.
Pubblicazione: (2025)
A Thorough Investigation of Content-Defined Chunking Algorithms for Data Deduplication
di: Gregoriadis, Marcel, et al.
Pubblicazione: (2024)
di: Gregoriadis, Marcel, et al.
Pubblicazione: (2024)
Context-Driven Performance Modeling for Causal Inference Operators on Neural Processing Units
di: Gupta, Neelesh, et al.
Pubblicazione: (2025)
di: Gupta, Neelesh, et al.
Pubblicazione: (2025)
DSP: Dynamic Sequence Parallelism for Multi-Dimensional Transformers
di: Zhao, Xuanlei, et al.
Pubblicazione: (2024)
di: Zhao, Xuanlei, et al.
Pubblicazione: (2024)
Communication-free Sampling and 4D Hybrid Parallelism for Scalable Mini-batch GNN Training
di: Wei, Cunyang, et al.
Pubblicazione: (2026)
di: Wei, Cunyang, et al.
Pubblicazione: (2026)
Causal Discovery over High-Dimensional Structured Hypothesis Spaces with Causal Graph Partitioning
di: Shah, Ashka, et al.
Pubblicazione: (2024)
di: Shah, Ashka, et al.
Pubblicazione: (2024)
Kraken: Inherently Parallel Transformers For Efficient Multi-Device Inference
di: Prabhakar, Rohan Baskar, et al.
Pubblicazione: (2024)
di: Prabhakar, Rohan Baskar, et al.
Pubblicazione: (2024)
Parallel Track Transformers: Enabling Fast GPU Inference with Reduced Synchronization
di: Wang, Chong, et al.
Pubblicazione: (2026)
di: Wang, Chong, et al.
Pubblicazione: (2026)
GPU-Accelerated Optimization of Transformer-Based Neural Networks for Real-Time Inference
di: Mukherjee, Soutrik, et al.
Pubblicazione: (2026)
di: Mukherjee, Soutrik, et al.
Pubblicazione: (2026)
Mitigating Catastrophic Forgetting with Adaptive Transformer Block Expansion in Federated Fine-Tuning
di: Huo, Yujia, et al.
Pubblicazione: (2025)
di: Huo, Yujia, et al.
Pubblicazione: (2025)
Fine-tuning Multimodal Transformers on Edge: A Parallel Split Learning Approach
di: Fudala, Timo, et al.
Pubblicazione: (2025)
di: Fudala, Timo, et al.
Pubblicazione: (2025)
BLaST: High Performance Inference and Pretraining using BLock Sparse Transformers
di: Okanovic, Patrik, et al.
Pubblicazione: (2025)
di: Okanovic, Patrik, et al.
Pubblicazione: (2025)
ToFU: Transforming How Federated Learning Systems Forget User Data
di: Tran, Van-Tuan, et al.
Pubblicazione: (2025)
di: Tran, Van-Tuan, et al.
Pubblicazione: (2025)
HydroGAT: Distributed Heterogeneous Graph Attention Transformer for Spatiotemporal Flood Prediction
di: Sarkar, Aishwarya, et al.
Pubblicazione: (2025)
di: Sarkar, Aishwarya, et al.
Pubblicazione: (2025)
Scalable Time-Series Causal Discovery with Approximate Causal Ordering
di: Jiao, Ziyang, et al.
Pubblicazione: (2024)
di: Jiao, Ziyang, et al.
Pubblicazione: (2024)
ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference
di: Meng, Han, et al.
Pubblicazione: (2026)
di: Meng, Han, et al.
Pubblicazione: (2026)
HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism
di: Zhang, Geng, et al.
Pubblicazione: (2025)
di: Zhang, Geng, et al.
Pubblicazione: (2025)
Hydraulis: Balancing Large Transformer Model Training via Co-designing Parallel Strategies and Data Assignment
di: Li, Haoyang, et al.
Pubblicazione: (2024)
di: Li, Haoyang, et al.
Pubblicazione: (2024)
FASTEN: Towards a FAult-tolerant and STorage EfficieNt Cloud: Balancing Between Replication and Deduplication
di: Ahmed, Sabbir, et al.
Pubblicazione: (2023)
di: Ahmed, Sabbir, et al.
Pubblicazione: (2023)
Bingo: Radix-based Bias Factorization for Random Walk on Dynamic Graphs
di: Wang, Pinhuan, et al.
Pubblicazione: (2025)
di: Wang, Pinhuan, et al.
Pubblicazione: (2025)
IntraShuffler: A Privacy Preserving Framework for Heterogeneous DP Federated Learning
di: Riya, Farhin Farhad, et al.
Pubblicazione: (2026)
di: Riya, Farhin Farhad, et al.
Pubblicazione: (2026)
FedECA: Federated External Control Arms for Causal Inference with Time-To-Event Data in Distributed Settings
di: Terrail, Jean Ogier du, et al.
Pubblicazione: (2023)
di: Terrail, Jean Ogier du, et al.
Pubblicazione: (2023)
Federated Learning under Periodic Client Participation and Heterogeneous Data: A New Communication-Efficient Algorithm and Analysis
di: Crawshaw, Michael, et al.
Pubblicazione: (2024)
di: Crawshaw, Michael, et al.
Pubblicazione: (2024)
SkipPredict: When to Invest in Predictions for Scheduling
di: Shahout, Rana, et al.
Pubblicazione: (2024)
di: Shahout, Rana, et al.
Pubblicazione: (2024)
UniAP: Unifying Inter- and Intra-Layer Automatic Parallelism by Mixed Integer Quadratic Programming
di: Lin, Hao, et al.
Pubblicazione: (2023)
di: Lin, Hao, et al.
Pubblicazione: (2023)
Communication-Efficient Federated Fine-Tuning
di: Theologitis, Michael, et al.
Pubblicazione: (2025)
di: Theologitis, Michael, et al.
Pubblicazione: (2025)
When GPUs Fail Quietly: Observability-Aware Early Warning Beyond Numeric Telemetry
di: Bidollahkhani, Michael, et al.
Pubblicazione: (2026)
di: Bidollahkhani, Michael, et al.
Pubblicazione: (2026)
Personalized Interpretation on Federated Learning: A Virtual Concepts approach
di: Yan, Peng, et al.
Pubblicazione: (2024)
di: Yan, Peng, et al.
Pubblicazione: (2024)
SyncFed: Time-Aware Federated Learning through Explicit Timestamping and Synchronization
di: Gül, Baran Can, et al.
Pubblicazione: (2025)
di: Gül, Baran Can, et al.
Pubblicazione: (2025)
KernelFoundry: Hardware-aware evolutionary GPU kernel optimization
di: Wiedemann, Nina, et al.
Pubblicazione: (2026)
di: Wiedemann, Nina, et al.
Pubblicazione: (2026)
Apodotiko: Enabling Efficient Serverless Federated Learning in Heterogeneous Environments
di: Chadha, Mohak, et al.
Pubblicazione: (2024)
di: Chadha, Mohak, et al.
Pubblicazione: (2024)
EcoLearn: Optimizing the Carbon Footprint of Federated Learning
di: Mehboob, Talha, et al.
Pubblicazione: (2023)
di: Mehboob, Talha, et al.
Pubblicazione: (2023)
HACK: Homomorphic Acceleration via Compression of the Key-Value Cache for Disaggregated LLM Inference
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap
di: Lin, Wenxiang, et al.
Pubblicazione: (2025) -
Enhancing Physics-Informed Neural Networks with a Hybrid Parallel Kolmogorov-Arnold and MLP Architecture
di: Xu, Zuyu, et al.
Pubblicazione: (2025) -
Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving
di: Shi, Xiaoxiang, et al.
Pubblicazione: (2025) -
RAPID-Serve: Resource-efficient and Accelerated P/D Intra-GPU Disaggregation
di: Masood, Amna, et al.
Pubblicazione: (2026) -
Vectorized Sequence-Based Chunking for Data Deduplication
di: Udayashankar, Sreeharsha, et al.
Pubblicazione: (2025)