PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference
Fuente:
arXiv
Saved in:
| Main Authors: | Fang, Jiarui, Pan, Jinzhe, Li, Aoyu, Sun, Xibo, Wang, Jiannan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unveiling Redundancy in Diffusion Transformers (DiTs): A Systematic Study
by: Sun, Xibo, et al.
Published: (2024)
by: Sun, Xibo, et al.
Published: (2024)
xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism
by: Fang, Jiarui, et al.
Published: (2024)
by: Fang, Jiarui, et al.
Published: (2024)
FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation
by: Liu, Dong, et al.
Published: (2025)
by: Liu, Dong, et al.
Published: (2025)
SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
by: Zhang, Jintao, et al.
Published: (2025)
by: Zhang, Jintao, et al.
Published: (2025)
QuickGrasp: Responsive Video-Language Querying Service via Accelerated Tokenization and Edge-Augmented Inference
by: Zhang, Miao, et al.
Published: (2026)
by: Zhang, Miao, et al.
Published: (2026)
PipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling
by: Wang, Sijie, et al.
Published: (2025)
by: Wang, Sijie, et al.
Published: (2025)
A Closer Look at Data Augmentation Strategies for Finetuning-Based Low/Few-Shot Object Detection
by: Li, Vladislav, et al.
Published: (2024)
by: Li, Vladislav, et al.
Published: (2024)
SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training
by: Zhang, Jintao, et al.
Published: (2025)
by: Zhang, Jintao, et al.
Published: (2025)
SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device
by: Wu, Yushu, et al.
Published: (2024)
by: Wu, Yushu, et al.
Published: (2024)
Model Quantization and Hardware Acceleration for Vision Transformers: A Comprehensive Survey
by: Du, Dayou, et al.
Published: (2024)
by: Du, Dayou, et al.
Published: (2024)
Twill: Scheduling Compound AI Systems on Heterogeneous Mobile Edge Platforms
by: Taufique, Zain, et al.
Published: (2025)
by: Taufique, Zain, et al.
Published: (2025)
Revisiting 16-bit Neural Network Training: A Practical Approach for Resource-Limited Learning
by: Yun, Juyoung, et al.
Published: (2023)
by: Yun, Juyoung, et al.
Published: (2023)
Fast-SEnSeI: Lightweight Sensor-Independent Cloud Masking for On-board Multispectral Sensors
by: Kněžík, Jan, et al.
Published: (2025)
by: Kněžík, Jan, et al.
Published: (2025)
Zero-Shot, But at What Cost? Unveiling the Hidden Overhead of MILS's LLM-CLIP Framework for Image Captioning
by: Benhammou, Yassir, et al.
Published: (2025)
by: Benhammou, Yassir, et al.
Published: (2025)
Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models
by: Sai, Vishnu, et al.
Published: (2026)
by: Sai, Vishnu, et al.
Published: (2026)
Spatially-Aware Evaluation of Segmentation Uncertainty
by: Zeevi, Tal, et al.
Published: (2025)
by: Zeevi, Tal, et al.
Published: (2025)
Class Confidence Aware Reweighting for Long Tailed Learning
by: Jagati, Brainard Philemon, et al.
Published: (2026)
by: Jagati, Brainard Philemon, et al.
Published: (2026)
VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
by: Yang, Kichang, et al.
Published: (2025)
by: Yang, Kichang, et al.
Published: (2025)
Multi-domain performance analysis with scores tailored to user preferences
by: Piérard, Sébastien, et al.
Published: (2025)
by: Piérard, Sébastien, et al.
Published: (2025)
What Is the Optimal Ranking Score Between Precision and Recall? We Can Always Find It and It Is Rarely $F_1$
by: Piérard, Sébastien, et al.
Published: (2025)
by: Piérard, Sébastien, et al.
Published: (2025)
Metrics and evaluations for computational and sustainable AI efficiency
by: Liu, Hongyuan, et al.
Published: (2025)
by: Liu, Hongyuan, et al.
Published: (2025)
TinyFusion: Diffusion Transformers Learned Shallow
by: Fang, Gongfan, et al.
Published: (2024)
by: Fang, Gongfan, et al.
Published: (2024)
DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers
by: Kim, Dahye, et al.
Published: (2026)
by: Kim, Dahye, et al.
Published: (2026)
A Study on Inference Latency for Vision Transformers on Mobile Devices
by: Li, Zhuojin, et al.
Published: (2025)
by: Li, Zhuojin, et al.
Published: (2025)
PipeFlow: Pipelined Processing and Motion-Aware Frame Selection for Long-Form Video Editing
by: Munir, Mustafa, et al.
Published: (2025)
by: Munir, Mustafa, et al.
Published: (2025)
CPU Optimization of a Monocular 3D Biomechanics Pipeline for Low-Resource Deployment
by: Zhang, Yan, et al.
Published: (2026)
by: Zhang, Yan, et al.
Published: (2026)
Disentangling Visual Transformers: Patch-level Interpretability for Image Classification
by: Jeanneret, Guillaume, et al.
Published: (2025)
by: Jeanneret, Guillaume, et al.
Published: (2025)
Accelerating Video Generation Inference with Sequential-Parallel 3D Positional Encoding Using a Global Time Index
by: Yuan, Chao, et al.
Published: (2026)
by: Yuan, Chao, et al.
Published: (2026)
Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU
by: Ning, Zhenyu, et al.
Published: (2024)
by: Ning, Zhenyu, et al.
Published: (2024)
VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
by: Tu, Dezhan, et al.
Published: (2024)
by: Tu, Dezhan, et al.
Published: (2024)
DISTWAR: Fast Differentiable Rendering on Raster-based Rendering Pipelines
by: Durvasula, Sankeerth, et al.
Published: (2023)
by: Durvasula, Sankeerth, et al.
Published: (2023)
AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising
by: Chen, Zigeng, et al.
Published: (2024)
by: Chen, Zigeng, et al.
Published: (2024)
CREST: An Efficient Conjointly-trained Spike-driven Framework for Event-based Object Detection Exploiting Spatiotemporal Dynamics
by: Mao, Ruixin, et al.
Published: (2024)
by: Mao, Ruixin, et al.
Published: (2024)
Characterizing Accuracy Trade-offs of EEG Applications on Embedded HMPs
by: Taufique, Zain, et al.
Published: (2024)
by: Taufique, Zain, et al.
Published: (2024)
Cost-Effective Model Evaluation with Meta-Learning
by: Pham, Trinh, et al.
Published: (2026)
by: Pham, Trinh, et al.
Published: (2026)
Shedding the Bits: Pushing the Boundaries of Quantization with Minifloats on FPGAs
by: Aggarwal, Shivam, et al.
Published: (2023)
by: Aggarwal, Shivam, et al.
Published: (2023)
snnTrans-DHZ: A Lightweight Spiking Neural Network Architecture for Underwater Image Dehazing
by: Sudevan, Vidya, et al.
Published: (2025)
by: Sudevan, Vidya, et al.
Published: (2025)
ASI: Accuracy-Stability Index for Evaluating Deep Learning Models
by: Dai, Wei, et al.
Published: (2023)
by: Dai, Wei, et al.
Published: (2023)
BudgetFusion: Perceptually-Guided Adaptive Diffusion Models
by: Li, Qinchan, et al.
Published: (2024)
by: Li, Qinchan, et al.
Published: (2024)
Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach
by: Li, Jiayang, et al.
Published: (2025)
by: Li, Jiayang, et al.
Published: (2025)
Similar Items
-
Unveiling Redundancy in Diffusion Transformers (DiTs): A Systematic Study
by: Sun, Xibo, et al.
Published: (2024) -
xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism
by: Fang, Jiarui, et al.
Published: (2024) -
FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation
by: Liu, Dong, et al.
Published: (2025) -
SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
by: Zhang, Jintao, et al.
Published: (2025) -
QuickGrasp: Responsive Video-Language Querying Service via Accelerated Tokenization and Edge-Augmented Inference
by: Zhang, Miao, et al.
Published: (2026)