Foresight: Adaptive Layer Reuse for Accelerated and High-Quality Text-to-Video Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Adnan, Muhammad, Kurella, Nithesh, Arunkumar, Akhil, Nair, Prashant J. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hybrid Quantum-Classical Model for Image Classification
por: Shahzad, Muhammad Adnan
Publicado: (2025)
por: Shahzad, Muhammad Adnan
Publicado: (2025)
SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation
por: Yoon, Jaehong, et al.
Publicado: (2024)
por: Yoon, Jaehong, et al.
Publicado: (2024)
Skrr: Skip and Re-use Text Encoder Layers for Memory Efficient Text-to-Image Generation
por: Seo, Hoigi, et al.
Publicado: (2025)
por: Seo, Hoigi, et al.
Publicado: (2025)
Reduce, Reuse, Recycle: Compositional Generation with Energy-Based Diffusion Models and MCMC
por: Du, Yilun, et al.
Publicado: (2023)
por: Du, Yilun, et al.
Publicado: (2023)
DAUNet: A Lightweight UNet Variant with Deformable Convolutions and Parameter-Free Attention for Medical Image Segmentation
por: Munir, Adnan, et al.
Publicado: (2025)
por: Munir, Adnan, et al.
Publicado: (2025)
Beyond FVD: Enhanced Evaluation Metrics for Video Generation Quality
por: Luo, Ge Ya, et al.
Publicado: (2024)
por: Luo, Ge Ya, et al.
Publicado: (2024)
Contextualized Diffusion Models for Text-Guided Image and Video Generation
por: Yang, Ling, et al.
Publicado: (2024)
por: Yang, Ling, et al.
Publicado: (2024)
LayerT2V: A Unified Multi-Layer Video Generation Framework
por: Li, Guangzhao, et al.
Publicado: (2025)
por: Li, Guangzhao, et al.
Publicado: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
por: Bansal, Hritik, et al.
Publicado: (2024)
por: Bansal, Hritik, et al.
Publicado: (2024)
Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback
por: Furuta, Hiroki, et al.
Publicado: (2024)
por: Furuta, Hiroki, et al.
Publicado: (2024)
M4V: Multi-Modal Mamba for Text-to-Video Generation
por: Huang, Jiancheng, et al.
Publicado: (2025)
por: Huang, Jiancheng, et al.
Publicado: (2025)
Not All Layers Are Created Equal: Adaptive LoRA Ranks for Personalized Image Generation
por: Shenaj, Donald, et al.
Publicado: (2026)
por: Shenaj, Donald, et al.
Publicado: (2026)
Enhancing Diffusion Models for High-Quality Image Generation
por: Shah, Jaineet, et al.
Publicado: (2024)
por: Shah, Jaineet, et al.
Publicado: (2024)
TextCraftor: Your Text Encoder Can be Image Quality Controller
por: Li, Yanyu, et al.
Publicado: (2024)
por: Li, Yanyu, et al.
Publicado: (2024)
LayeredDoc: Domain Adaptive Document Restoration with a Layer Separation Approach
por: Pilligua, Maria, et al.
Publicado: (2024)
por: Pilligua, Maria, et al.
Publicado: (2024)
SADA: Stability-guided Adaptive Diffusion Acceleration
por: Jiang, Ting, et al.
Publicado: (2025)
por: Jiang, Ting, et al.
Publicado: (2025)
Accelerating Vision Transformers with Adaptive Patch Sizes
por: Choudhury, Rohan, et al.
Publicado: (2025)
por: Choudhury, Rohan, et al.
Publicado: (2025)
STIV: Scalable Text and Image Conditioned Video Generation
por: Lin, Zongyu, et al.
Publicado: (2024)
por: Lin, Zongyu, et al.
Publicado: (2024)
GalaxyDiT: Efficient Video Generation with Guidance Alignment and Adaptive Proxy in Diffusion Transformers
por: Song, Zhiye, et al.
Publicado: (2025)
por: Song, Zhiye, et al.
Publicado: (2025)
GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning
por: Mou, Zhun, et al.
Publicado: (2025)
por: Mou, Zhun, et al.
Publicado: (2025)
Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models
por: Kwon, Taesung, et al.
Publicado: (2026)
por: Kwon, Taesung, et al.
Publicado: (2026)
Adaptive Keyframe Sampling for Long Video Understanding
por: Tang, Xi, et al.
Publicado: (2025)
por: Tang, Xi, et al.
Publicado: (2025)
Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning
por: Girdhar, Rohit, et al.
Publicado: (2023)
por: Girdhar, Rohit, et al.
Publicado: (2023)
HiFA: High-fidelity Text-to-3D Generation with Advanced Diffusion Guidance
por: Zhu, Junzhe, et al.
Publicado: (2023)
por: Zhu, Junzhe, et al.
Publicado: (2023)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
por: Zhang, Jintao, et al.
Publicado: (2025)
por: Zhang, Jintao, et al.
Publicado: (2025)
From Text to Pose to Image: Improving Diffusion Model Control and Quality
por: Bonnet, Clément, et al.
Publicado: (2024)
por: Bonnet, Clément, et al.
Publicado: (2024)
TempoControl: Temporal Attention Guidance for Text-to-Video Models
por: Schiber, Shira, et al.
Publicado: (2025)
por: Schiber, Shira, et al.
Publicado: (2025)
IM-3D: Iterative Multiview Diffusion and Reconstruction for High-Quality 3D Generation
por: Melas-Kyriazi, Luke, et al.
Publicado: (2024)
por: Melas-Kyriazi, Luke, et al.
Publicado: (2024)
Denoising Score Distillation: From Noisy Diffusion Pretraining to One-Step High-Quality Generation
por: Chen, Tianyu, et al.
Publicado: (2025)
por: Chen, Tianyu, et al.
Publicado: (2025)
Identifying Bias in Deep Neural Networks Using Image Transforms
por: Erukude, Sai Teja, et al.
Publicado: (2024)
por: Erukude, Sai Teja, et al.
Publicado: (2024)
MVSA-Net: Multi-View State-Action Recognition for Robust and Deployable Trajectory Generation
por: Asali, Ehsan, et al.
Publicado: (2023)
por: Asali, Ehsan, et al.
Publicado: (2023)
Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image Diffusion Models
por: Jeong, Hyeonho, et al.
Publicado: (2023)
por: Jeong, Hyeonho, et al.
Publicado: (2023)
Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers
por: You, Haoran, et al.
Publicado: (2024)
por: You, Haoran, et al.
Publicado: (2024)
LARV: Data-Free Layer-wise Adaptive Rescaling Veneer for Model Merging
por: Wang, Xinyu, et al.
Publicado: (2026)
por: Wang, Xinyu, et al.
Publicado: (2026)
Budgeted Online Continual Learning by Adaptive Layer Freezing and Frequency-based Sampling
por: Seo, Minhyuk, et al.
Publicado: (2024)
por: Seo, Minhyuk, et al.
Publicado: (2024)
Accelerating Large-Scale Dataset Distillation via Exploration-Exploitation Optimization
por: Alahmadi, Muhammad J., et al.
Publicado: (2026)
por: Alahmadi, Muhammad J., et al.
Publicado: (2026)
TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization
por: Kim, Sumin, et al.
Publicado: (2026)
por: Kim, Sumin, et al.
Publicado: (2026)
EUGens: Efficient, Unified, and General Dense Layers
por: Kim, Sang Min, et al.
Publicado: (2024)
por: Kim, Sang Min, et al.
Publicado: (2024)
VideoPhy: Evaluating Physical Commonsense for Video Generation
por: Bansal, Hritik, et al.
Publicado: (2024)
por: Bansal, Hritik, et al.
Publicado: (2024)
MARVEL-40M+: Multi-Level Visual Elaboration for High-Fidelity Text-to-3D Content Creation
por: Sinha, Sankalp, et al.
Publicado: (2024)
por: Sinha, Sankalp, et al.
Publicado: (2024)
Ejemplares similares
-
Hybrid Quantum-Classical Model for Image Classification
por: Shahzad, Muhammad Adnan
Publicado: (2025) -
SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation
por: Yoon, Jaehong, et al.
Publicado: (2024) -
Skrr: Skip and Re-use Text Encoder Layers for Memory Efficient Text-to-Image Generation
por: Seo, Hoigi, et al.
Publicado: (2025) -
Reduce, Reuse, Recycle: Compositional Generation with Energy-Based Diffusion Models and MCMC
por: Du, Yilun, et al.
Publicado: (2023) -
DAUNet: A Lightweight UNet Variant with Deformable Convolutions and Parameter-Free Attention for Medical Image Segmentation
por: Munir, Adnan, et al.
Publicado: (2025)