RadixMLP -- Intra-batch Deduplication for Causal Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Feil, Michael, Lipp, Julius |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap
par: Lin, Wenxiang, et autres
Publié: (2025)
par: Lin, Wenxiang, et autres
Publié: (2025)
Enhancing Physics-Informed Neural Networks with a Hybrid Parallel Kolmogorov-Arnold and MLP Architecture
par: Xu, Zuyu, et autres
Publié: (2025)
par: Xu, Zuyu, et autres
Publié: (2025)
Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving
par: Shi, Xiaoxiang, et autres
Publié: (2025)
par: Shi, Xiaoxiang, et autres
Publié: (2025)
RAPID-Serve: Resource-efficient and Accelerated P/D Intra-GPU Disaggregation
par: Masood, Amna, et autres
Publié: (2026)
par: Masood, Amna, et autres
Publié: (2026)
Vectorized Sequence-Based Chunking for Data Deduplication
par: Udayashankar, Sreeharsha, et autres
Publié: (2025)
par: Udayashankar, Sreeharsha, et autres
Publié: (2025)
Drift-Aware Federated Learning: A Causal Perspective
par: Fang, Yunjie, et autres
Publié: (2025)
par: Fang, Yunjie, et autres
Publié: (2025)
AcceleratedLiNGAM: Learning Causal DAGs at the speed of GPUs
par: Akinwande, Victor, et autres
Publié: (2024)
par: Akinwande, Victor, et autres
Publié: (2024)
A Distributed Framework for Causal Modeling of Performance Variability in GPU Traces
par: Lahiry, Ankur, et autres
Publié: (2025)
par: Lahiry, Ankur, et autres
Publié: (2025)
A Thorough Investigation of Content-Defined Chunking Algorithms for Data Deduplication
par: Gregoriadis, Marcel, et autres
Publié: (2024)
par: Gregoriadis, Marcel, et autres
Publié: (2024)
Context-Driven Performance Modeling for Causal Inference Operators on Neural Processing Units
par: Gupta, Neelesh, et autres
Publié: (2025)
par: Gupta, Neelesh, et autres
Publié: (2025)
DSP: Dynamic Sequence Parallelism for Multi-Dimensional Transformers
par: Zhao, Xuanlei, et autres
Publié: (2024)
par: Zhao, Xuanlei, et autres
Publié: (2024)
Communication-free Sampling and 4D Hybrid Parallelism for Scalable Mini-batch GNN Training
par: Wei, Cunyang, et autres
Publié: (2026)
par: Wei, Cunyang, et autres
Publié: (2026)
Causal Discovery over High-Dimensional Structured Hypothesis Spaces with Causal Graph Partitioning
par: Shah, Ashka, et autres
Publié: (2024)
par: Shah, Ashka, et autres
Publié: (2024)
Kraken: Inherently Parallel Transformers For Efficient Multi-Device Inference
par: Prabhakar, Rohan Baskar, et autres
Publié: (2024)
par: Prabhakar, Rohan Baskar, et autres
Publié: (2024)
Parallel Track Transformers: Enabling Fast GPU Inference with Reduced Synchronization
par: Wang, Chong, et autres
Publié: (2026)
par: Wang, Chong, et autres
Publié: (2026)
GPU-Accelerated Optimization of Transformer-Based Neural Networks for Real-Time Inference
par: Mukherjee, Soutrik, et autres
Publié: (2026)
par: Mukherjee, Soutrik, et autres
Publié: (2026)
Mitigating Catastrophic Forgetting with Adaptive Transformer Block Expansion in Federated Fine-Tuning
par: Huo, Yujia, et autres
Publié: (2025)
par: Huo, Yujia, et autres
Publié: (2025)
Fine-tuning Multimodal Transformers on Edge: A Parallel Split Learning Approach
par: Fudala, Timo, et autres
Publié: (2025)
par: Fudala, Timo, et autres
Publié: (2025)
BLaST: High Performance Inference and Pretraining using BLock Sparse Transformers
par: Okanovic, Patrik, et autres
Publié: (2025)
par: Okanovic, Patrik, et autres
Publié: (2025)
ToFU: Transforming How Federated Learning Systems Forget User Data
par: Tran, Van-Tuan, et autres
Publié: (2025)
par: Tran, Van-Tuan, et autres
Publié: (2025)
HydroGAT: Distributed Heterogeneous Graph Attention Transformer for Spatiotemporal Flood Prediction
par: Sarkar, Aishwarya, et autres
Publié: (2025)
par: Sarkar, Aishwarya, et autres
Publié: (2025)
Scalable Time-Series Causal Discovery with Approximate Causal Ordering
par: Jiao, Ziyang, et autres
Publié: (2024)
par: Jiao, Ziyang, et autres
Publié: (2024)
ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference
par: Meng, Han, et autres
Publié: (2026)
par: Meng, Han, et autres
Publié: (2026)
HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism
par: Zhang, Geng, et autres
Publié: (2025)
par: Zhang, Geng, et autres
Publié: (2025)
Hydraulis: Balancing Large Transformer Model Training via Co-designing Parallel Strategies and Data Assignment
par: Li, Haoyang, et autres
Publié: (2024)
par: Li, Haoyang, et autres
Publié: (2024)
FASTEN: Towards a FAult-tolerant and STorage EfficieNt Cloud: Balancing Between Replication and Deduplication
par: Ahmed, Sabbir, et autres
Publié: (2023)
par: Ahmed, Sabbir, et autres
Publié: (2023)
Bingo: Radix-based Bias Factorization for Random Walk on Dynamic Graphs
par: Wang, Pinhuan, et autres
Publié: (2025)
par: Wang, Pinhuan, et autres
Publié: (2025)
IntraShuffler: A Privacy Preserving Framework for Heterogeneous DP Federated Learning
par: Riya, Farhin Farhad, et autres
Publié: (2026)
par: Riya, Farhin Farhad, et autres
Publié: (2026)
FedECA: Federated External Control Arms for Causal Inference with Time-To-Event Data in Distributed Settings
par: Terrail, Jean Ogier du, et autres
Publié: (2023)
par: Terrail, Jean Ogier du, et autres
Publié: (2023)
Federated Learning under Periodic Client Participation and Heterogeneous Data: A New Communication-Efficient Algorithm and Analysis
par: Crawshaw, Michael, et autres
Publié: (2024)
par: Crawshaw, Michael, et autres
Publié: (2024)
SkipPredict: When to Invest in Predictions for Scheduling
par: Shahout, Rana, et autres
Publié: (2024)
par: Shahout, Rana, et autres
Publié: (2024)
UniAP: Unifying Inter- and Intra-Layer Automatic Parallelism by Mixed Integer Quadratic Programming
par: Lin, Hao, et autres
Publié: (2023)
par: Lin, Hao, et autres
Publié: (2023)
Communication-Efficient Federated Fine-Tuning
par: Theologitis, Michael, et autres
Publié: (2025)
par: Theologitis, Michael, et autres
Publié: (2025)
When GPUs Fail Quietly: Observability-Aware Early Warning Beyond Numeric Telemetry
par: Bidollahkhani, Michael, et autres
Publié: (2026)
par: Bidollahkhani, Michael, et autres
Publié: (2026)
Personalized Interpretation on Federated Learning: A Virtual Concepts approach
par: Yan, Peng, et autres
Publié: (2024)
par: Yan, Peng, et autres
Publié: (2024)
SyncFed: Time-Aware Federated Learning through Explicit Timestamping and Synchronization
par: Gül, Baran Can, et autres
Publié: (2025)
par: Gül, Baran Can, et autres
Publié: (2025)
KernelFoundry: Hardware-aware evolutionary GPU kernel optimization
par: Wiedemann, Nina, et autres
Publié: (2026)
par: Wiedemann, Nina, et autres
Publié: (2026)
Apodotiko: Enabling Efficient Serverless Federated Learning in Heterogeneous Environments
par: Chadha, Mohak, et autres
Publié: (2024)
par: Chadha, Mohak, et autres
Publié: (2024)
EcoLearn: Optimizing the Carbon Footprint of Federated Learning
par: Mehboob, Talha, et autres
Publié: (2023)
par: Mehboob, Talha, et autres
Publié: (2023)
HACK: Homomorphic Acceleration via Compression of the Key-Value Cache for Disaggregated LLM Inference
par: Zhang, Zeyu, et autres
Publié: (2025)
par: Zhang, Zeyu, et autres
Publié: (2025)
Documents similaires
-
HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap
par: Lin, Wenxiang, et autres
Publié: (2025) -
Enhancing Physics-Informed Neural Networks with a Hybrid Parallel Kolmogorov-Arnold and MLP Architecture
par: Xu, Zuyu, et autres
Publié: (2025) -
Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving
par: Shi, Xiaoxiang, et autres
Publié: (2025) -
RAPID-Serve: Resource-efficient and Accelerated P/D Intra-GPU Disaggregation
par: Masood, Amna, et autres
Publié: (2026) -
Vectorized Sequence-Based Chunking for Data Deduplication
par: Udayashankar, Sreeharsha, et autres
Publié: (2025)