CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Zhuojin, Cheng, Hsin-Pai, Cai, Hong, Han, Shizhong, Porikli, Fatih |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FALO: Fast and Accurate LiDAR 3D Object Detection on Resource-Constrained Devices
di: Han, Shizhong, et al.
Pubblicazione: (2025)
di: Han, Shizhong, et al.
Pubblicazione: (2025)
DySS: Dynamic Queries and State-Space Learning for Efficient 3D Object Detection from Multi-Camera Videos
di: Yasarla, Rajeev, et al.
Pubblicazione: (2025)
di: Yasarla, Rajeev, et al.
Pubblicazione: (2025)
PADRe: A Unifying Polynomial Attention Drop-in Replacement for Efficient Vision Transformer
di: Letourneau, Pierre-David, et al.
Pubblicazione: (2024)
di: Letourneau, Pierre-David, et al.
Pubblicazione: (2024)
ToSA: Token Selective Attention for Efficient Vision Transformers
di: Singh, Manish Kumar, et al.
Pubblicazione: (2024)
di: Singh, Manish Kumar, et al.
Pubblicazione: (2024)
RoCA: Robust Cross-Domain End-to-End Autonomous Driving
di: Yasarla, Rajeev, et al.
Pubblicazione: (2025)
di: Yasarla, Rajeev, et al.
Pubblicazione: (2025)
BePo: Dual Representation for 3D Occupancy Prediction
di: Shi, Yunxiao, et al.
Pubblicazione: (2025)
di: Shi, Yunxiao, et al.
Pubblicazione: (2025)
ODG: Occupancy Prediction Using Dual Gaussians
di: Shi, Yunxiao, et al.
Pubblicazione: (2025)
di: Shi, Yunxiao, et al.
Pubblicazione: (2025)
MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving
di: Yasarla, Rajeev, et al.
Pubblicazione: (2026)
di: Yasarla, Rajeev, et al.
Pubblicazione: (2026)
ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs
di: Yu, An, et al.
Pubblicazione: (2026)
di: Yu, An, et al.
Pubblicazione: (2026)
H3O: Hyper-Efficient 3D Occupancy Prediction with Heterogeneous Supervision
di: Shi, Yunxiao, et al.
Pubblicazione: (2025)
di: Shi, Yunxiao, et al.
Pubblicazione: (2025)
DeCoTR: Enhancing Depth Completion with 2D and 3D Attentions
di: Shi, Yunxiao, et al.
Pubblicazione: (2024)
di: Shi, Yunxiao, et al.
Pubblicazione: (2024)
Generative Scenario Rollouts for End-to-End Autonomous Driving
di: Yasarla, Rajeev, et al.
Pubblicazione: (2026)
di: Yasarla, Rajeev, et al.
Pubblicazione: (2026)
SparseDiT: Token Sparsification for Efficient Diffusion Transformer
di: Chang, Shuning, et al.
Pubblicazione: (2024)
di: Chang, Shuning, et al.
Pubblicazione: (2024)
Token Pruning for In-Context Generation in Diffusion Transformers
di: Lin, Junqing, et al.
Pubblicazione: (2026)
di: Lin, Junqing, et al.
Pubblicazione: (2026)
FutureDepth: Learning to Predict the Future Improves Video Depth Estimation
di: Yasarla, Rajeev, et al.
Pubblicazione: (2024)
di: Yasarla, Rajeev, et al.
Pubblicazione: (2024)
Improving Optical Flow and Stereo Depth Estimation by Leveraging Uncertainty-Based Learning Difficulties
di: Jeong, Jisoo, et al.
Pubblicazione: (2025)
di: Jeong, Jisoo, et al.
Pubblicazione: (2025)
DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation
di: Zhao, Wangbo, et al.
Pubblicazione: (2025)
di: Zhao, Wangbo, et al.
Pubblicazione: (2025)
Segmentation-Free Guidance for Text-to-Image Diffusion Models
di: Azarian, Kambiz, et al.
Pubblicazione: (2024)
di: Azarian, Kambiz, et al.
Pubblicazione: (2024)
FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding
di: Cho, Janghoon, et al.
Pubblicazione: (2025)
di: Cho, Janghoon, et al.
Pubblicazione: (2025)
Distilling Multi-modal Large Language Models for Autonomous Driving
di: Hegde, Deepti, et al.
Pubblicazione: (2025)
di: Hegde, Deepti, et al.
Pubblicazione: (2025)
Attention Guided Alignment in Efficient Vision-Language Models
di: Mahajan, Shweta, et al.
Pubblicazione: (2025)
di: Mahajan, Shweta, et al.
Pubblicazione: (2025)
HEART-VIT: Hessian-Guided Efficient Dynamic Attention and Token Pruning in Vision Transformer
di: Uddin, Mohammad Helal, et al.
Pubblicazione: (2025)
di: Uddin, Mohammad Helal, et al.
Pubblicazione: (2025)
HexaGen3D: StableDiffusion is just one step away from Fast and Diverse Text-to-3D Generation
di: Mercier, Antoine, et al.
Pubblicazione: (2024)
di: Mercier, Antoine, et al.
Pubblicazione: (2024)
Clockwork Diffusion: Efficient Generation With Model-Step Distillation
di: Habibian, Amirhossein, et al.
Pubblicazione: (2023)
di: Habibian, Amirhossein, et al.
Pubblicazione: (2023)
Planar Gaussian Splatting
di: Zanjani, Farhad G., et al.
Pubblicazione: (2024)
di: Zanjani, Farhad G., et al.
Pubblicazione: (2024)
Neural Mesh Fusion: Unsupervised 3D Planar Surface Understanding
di: Zanjani, Farhad G., et al.
Pubblicazione: (2024)
di: Zanjani, Farhad G., et al.
Pubblicazione: (2024)
Object-Centric Diffusion for Efficient Video Editing
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
PPT: Token Pruning and Pooling for Efficient Vision Transformers
di: Wu, Xinjian, et al.
Pubblicazione: (2023)
di: Wu, Xinjian, et al.
Pubblicazione: (2023)
CAT Pruning: Cluster-Aware Token Pruning For Text-to-Image Diffusion Models
di: Cheng, Xinle, et al.
Pubblicazione: (2025)
di: Cheng, Xinle, et al.
Pubblicazione: (2025)
Learning Optical Flow Field via Neural Ordinary Differential Equation
di: Mirvakhabova, Leyla, et al.
Pubblicazione: (2025)
di: Mirvakhabova, Leyla, et al.
Pubblicazione: (2025)
MAMo: Leveraging Memory and Attention for Monocular Video Depth Estimation
di: Yasarla, Rajeev, et al.
Pubblicazione: (2023)
di: Yasarla, Rajeev, et al.
Pubblicazione: (2023)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
di: Tian, Yuchuan, et al.
Pubblicazione: (2024)
di: Tian, Yuchuan, et al.
Pubblicazione: (2024)
DDIL: Diversity Enhancing Diffusion Distillation With Imitation Learning
di: Garrepalli, Risheek, et al.
Pubblicazione: (2024)
di: Garrepalli, Risheek, et al.
Pubblicazione: (2024)
DiHuR: Diffusion-Guided Generalizable Human Reconstruction
di: Chen, Jinnan, et al.
Pubblicazione: (2024)
di: Chen, Jinnan, et al.
Pubblicazione: (2024)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping
di: Park, Sunghyun, et al.
Pubblicazione: (2026)
di: Park, Sunghyun, et al.
Pubblicazione: (2026)
EventPrune: Cascaded Event-Assisted Token Pruning for Efficient First-Person Dynamic Spatial Reasoning
di: Ma, Pengtao, et al.
Pubblicazione: (2026)
di: Ma, Pengtao, et al.
Pubblicazione: (2026)
Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing
di: Kumar, Yogesh
Pubblicazione: (2025)
di: Kumar, Yogesh
Pubblicazione: (2025)
SciFlow: Empowering Lightweight Optical Flow Models with Self-Cleaning Iterations
di: Lin, Jamie Menjay, et al.
Pubblicazione: (2024)
di: Lin, Jamie Menjay, et al.
Pubblicazione: (2024)
OCAI: Improving Optical Flow Estimation by Occlusion and Consistency Aware Interpolation
di: Jeong, Jisoo, et al.
Pubblicazione: (2024)
di: Jeong, Jisoo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FALO: Fast and Accurate LiDAR 3D Object Detection on Resource-Constrained Devices
di: Han, Shizhong, et al.
Pubblicazione: (2025) -
DySS: Dynamic Queries and State-Space Learning for Efficient 3D Object Detection from Multi-Camera Videos
di: Yasarla, Rajeev, et al.
Pubblicazione: (2025) -
PADRe: A Unifying Polynomial Attention Drop-in Replacement for Efficient Vision Transformer
di: Letourneau, Pierre-David, et al.
Pubblicazione: (2024) -
ToSA: Token Selective Attention for Efficient Vision Transformers
di: Singh, Manish Kumar, et al.
Pubblicazione: (2024) -
RoCA: Robust Cross-Domain End-to-End Autonomous Driving
di: Yasarla, Rajeev, et al.
Pubblicazione: (2025)