Clockwork Diffusion: Efficient Generation With Model-Step Distillation
Fuente:
arXiv
Guardado en:
| Autores principales: | Habibian, Amirhossein, Ghodrati, Amir, Fathima, Noor, Sautiere, Guillaume, Garrepalli, Risheek, Porikli, Fatih, Petersen, Jens |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MoViE: Mobile Diffusion for Video Editing
por: Karjauv, Adil, et al.
Publicado: (2024)
por: Karjauv, Adil, et al.
Publicado: (2024)
DDIL: Diversity Enhancing Diffusion Distillation With Imitation Learning
por: Garrepalli, Risheek, et al.
Publicado: (2024)
por: Garrepalli, Risheek, et al.
Publicado: (2024)
Multi-Scale Local Speculative Decoding for Image Generation
por: Peruzzo, Elia, et al.
Publicado: (2026)
por: Peruzzo, Elia, et al.
Publicado: (2026)
MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing
por: Kadambi, Shreya, et al.
Publicado: (2025)
por: Kadambi, Shreya, et al.
Publicado: (2025)
SciFlow: Empowering Lightweight Optical Flow Models with Self-Cleaning Iterations
por: Lin, Jamie Menjay, et al.
Publicado: (2024)
por: Lin, Jamie Menjay, et al.
Publicado: (2024)
MAMo: Leveraging Memory and Attention for Monocular Video Depth Estimation
por: Yasarla, Rajeev, et al.
Publicado: (2023)
por: Yasarla, Rajeev, et al.
Publicado: (2023)
Object-Centric Diffusion for Efficient Video Editing
por: Kahatapitiya, Kumara, et al.
Publicado: (2024)
por: Kahatapitiya, Kumara, et al.
Publicado: (2024)
OCAI: Improving Optical Flow Estimation by Occlusion and Consistency Aware Interpolation
por: Jeong, Jisoo, et al.
Publicado: (2024)
por: Jeong, Jisoo, et al.
Publicado: (2024)
Neodragon: Mobile Video Generation using Diffusion Transformer
por: Karnewar, Animesh, et al.
Publicado: (2025)
por: Karnewar, Animesh, et al.
Publicado: (2025)
Mobile Video Diffusion
por: Yahia, Haitam Ben, et al.
Publicado: (2024)
por: Yahia, Haitam Ben, et al.
Publicado: (2024)
Distilling Multi-modal Large Language Models for Autonomous Driving
por: Hegde, Deepti, et al.
Publicado: (2025)
por: Hegde, Deepti, et al.
Publicado: (2025)
Controllable 3D Placement of Objects with Scene-Aware Diffusion Models
por: Omran, Mohamed, et al.
Publicado: (2025)
por: Omran, Mohamed, et al.
Publicado: (2025)
Scene-Aware Location Modeling for Data Augmentation in Automotive Object Detection
por: Petersen, Jens, et al.
Publicado: (2025)
por: Petersen, Jens, et al.
Publicado: (2025)
MultiHuman-Testbench: Benchmarking Image Generation for Multiple Humans
por: Borse, Shubhankar, et al.
Publicado: (2025)
por: Borse, Shubhankar, et al.
Publicado: (2025)
ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers
por: Ghafoorian, Mohsen, et al.
Publicado: (2026)
por: Ghafoorian, Mohsen, et al.
Publicado: (2026)
Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer
por: Ghafoorian, Mohsen, et al.
Publicado: (2025)
por: Ghafoorian, Mohsen, et al.
Publicado: (2025)
FutureDepth: Learning to Predict the Future Improves Video Depth Estimation
por: Yasarla, Rajeev, et al.
Publicado: (2024)
por: Yasarla, Rajeev, et al.
Publicado: (2024)
Hybrid Gaussian Splatting for Novel Urban View Synthesis
por: Omran, Mohamed, et al.
Publicado: (2025)
por: Omran, Mohamed, et al.
Publicado: (2025)
RoCA: Robust Cross-Domain End-to-End Autonomous Driving
por: Yasarla, Rajeev, et al.
Publicado: (2025)
por: Yasarla, Rajeev, et al.
Publicado: (2025)
FouRA: Fourier Low Rank Adaptation
por: Borse, Shubhankar, et al.
Publicado: (2024)
por: Borse, Shubhankar, et al.
Publicado: (2024)
Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs
por: Chen, Yanlong, et al.
Publicado: (2026)
por: Chen, Yanlong, et al.
Publicado: (2026)
Generative Scenario Rollouts for End-to-End Autonomous Driving
por: Yasarla, Rajeev, et al.
Publicado: (2026)
por: Yasarla, Rajeev, et al.
Publicado: (2026)
Enhancing Novel View Synthesis via Geometry Grounded Set Diffusion
por: Zanjani, Farhad G., et al.
Publicado: (2026)
por: Zanjani, Farhad G., et al.
Publicado: (2026)
Gaussian Splatting is an Effective Data Generator for 3D Object Detection
por: Zanjani, Farhad G., et al.
Publicado: (2025)
por: Zanjani, Farhad G., et al.
Publicado: (2025)
Segmentation-Free Guidance for Text-to-Image Diffusion Models
por: Azarian, Kambiz, et al.
Publicado: (2024)
por: Azarian, Kambiz, et al.
Publicado: (2024)
PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inference
por: Korzhenkov, Denis, et al.
Publicado: (2026)
por: Korzhenkov, Denis, et al.
Publicado: (2026)
HexaGen3D: StableDiffusion is just one step away from Fast and Diverse Text-to-3D Generation
por: Mercier, Antoine, et al.
Publicado: (2024)
por: Mercier, Antoine, et al.
Publicado: (2024)
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
por: Bhowmik, Aritra, et al.
Publicado: (2025)
por: Bhowmik, Aritra, et al.
Publicado: (2025)
CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers
por: Li, Zhuojin, et al.
Publicado: (2026)
por: Li, Zhuojin, et al.
Publicado: (2026)
Low-Latency Neural Stereo Streaming
por: Hou, Qiqi, et al.
Publicado: (2024)
por: Hou, Qiqi, et al.
Publicado: (2024)
CustomKD: Customizing Large Vision Foundation for Edge Model Improvement via Knowledge Distillation
por: Lee, Jungsoo, et al.
Publicado: (2025)
por: Lee, Jungsoo, et al.
Publicado: (2025)
H3O: Hyper-Efficient 3D Occupancy Prediction with Heterogeneous Supervision
por: Shi, Yunxiao, et al.
Publicado: (2025)
por: Shi, Yunxiao, et al.
Publicado: (2025)
Resolving the Identity Crisis in Text-to-Image Generation
por: Borse, Shubhankar, et al.
Publicado: (2025)
por: Borse, Shubhankar, et al.
Publicado: (2025)
Imagining the Unseen: Generative Location Modeling for Object Placement
por: Yun, Jooyeol, et al.
Publicado: (2024)
por: Yun, Jooyeol, et al.
Publicado: (2024)
DySS: Dynamic Queries and State-Space Learning for Efficient 3D Object Detection from Multi-Camera Videos
por: Yasarla, Rajeev, et al.
Publicado: (2025)
por: Yasarla, Rajeev, et al.
Publicado: (2025)
LoRA-X: Bridging Foundation Models with Training-Free Cross-Model Adaptation
por: Farhadzadeh, Farzad, et al.
Publicado: (2025)
por: Farhadzadeh, Farzad, et al.
Publicado: (2025)
EdgeRelight360: Text-Conditioned 360-Degree HDR Image Generation for Real-Time On-Device Video Portrait Relighting
por: Lin, Min-Hui, et al.
Publicado: (2024)
por: Lin, Min-Hui, et al.
Publicado: (2024)
ReDiF: Reinforced Distillation for Few Step Diffusion
por: Tighkhorshid, Amirhossein, et al.
Publicado: (2025)
por: Tighkhorshid, Amirhossein, et al.
Publicado: (2025)
ToSA: Token Selective Attention for Efficient Vision Transformers
por: Singh, Manish Kumar, et al.
Publicado: (2024)
por: Singh, Manish Kumar, et al.
Publicado: (2024)
Attention Guided Alignment in Efficient Vision-Language Models
por: Mahajan, Shweta, et al.
Publicado: (2025)
por: Mahajan, Shweta, et al.
Publicado: (2025)
Ejemplares similares
-
MoViE: Mobile Diffusion for Video Editing
por: Karjauv, Adil, et al.
Publicado: (2024) -
DDIL: Diversity Enhancing Diffusion Distillation With Imitation Learning
por: Garrepalli, Risheek, et al.
Publicado: (2024) -
Multi-Scale Local Speculative Decoding for Image Generation
por: Peruzzo, Elia, et al.
Publicado: (2026) -
MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing
por: Kadambi, Shreya, et al.
Publicado: (2025) -
SciFlow: Empowering Lightweight Optical Flow Models with Self-Cleaning Iterations
por: Lin, Jamie Menjay, et al.
Publicado: (2024)