From Image to Video: An Empirical Study of Diffusion Representations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Vélez, Pedro, Polanía, Luisa F., Yang, Yi, Zhang, Chuhan, Kabra, Rishabh, Arnab, Anurag, Sajjadi, Mehdi S. M. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Frozen Forecasting: A Unified Evaluation
par: Walker, Jacob C, et autres
Publié: (2025)
par: Walker, Jacob C, et autres
Publié: (2025)
Moving Off-the-Grid: Scene-Grounded Video Representations
par: van Steenkiste, Sjoerd, et autres
Publié: (2024)
par: van Steenkiste, Sjoerd, et autres
Publié: (2024)
Scaling 4D Representations
par: Carreira, João, et autres
Publié: (2024)
par: Carreira, João, et autres
Publié: (2024)
DORSal: Diffusion for Object-centric Representations of Scenes et al
par: Jabri, Allan, et autres
Publié: (2023)
par: Jabri, Allan, et autres
Publié: (2023)
DyST: Towards Dynamic Neural Scene Representations on Real-World Videos
par: Seitzer, Maximilian, et autres
Publié: (2023)
par: Seitzer, Maximilian, et autres
Publié: (2023)
VicTR: Video-conditioned Text Representations for Activity Recognition
par: Kahatapitiya, Kumara, et autres
Publié: (2023)
par: Kahatapitiya, Kumara, et autres
Publié: (2023)
Evaluating Text-to-Image Generative Models: An Empirical Study on Human Image Synthesis
par: Chen, Muxi, et autres
Publié: (2024)
par: Chen, Muxi, et autres
Publié: (2024)
Neural Assets: 3D-Aware Multi-Object Scene Synthesis with Image Diffusion Models
par: Wu, Ziyi, et autres
Publié: (2024)
par: Wu, Ziyi, et autres
Publié: (2024)
SINE: SINgle Image Editing with Text-to-Image Diffusion Models
par: Zhang, Zhixing, et autres
Publié: (2022)
par: Zhang, Zhixing, et autres
Publié: (2022)
VideoQA in the Era of LLMs: An Empirical Study
par: Xiao, Junbin, et autres
Publié: (2024)
par: Xiao, Junbin, et autres
Publié: (2024)
An Empirical Study of Autoregressive Pre-training from Videos
par: Rajasegaran, Jathushan, et autres
Publié: (2025)
par: Rajasegaran, Jathushan, et autres
Publié: (2025)
SecurePose: Automated Face Blurring and Human Movement Kinematics Extraction from Videos Recorded in Clinical Settings
par: Bajpai, Rishabh, et autres
Publié: (2024)
par: Bajpai, Rishabh, et autres
Publié: (2024)
Dense Video Object Captioning from Disjoint Supervision
par: Zhou, Xingyi, et autres
Publié: (2023)
par: Zhou, Xingyi, et autres
Publié: (2023)
An Interpretable Representation Learning Approach for Diffusion Tensor Imaging
par: Singh, Vishwa Mohan, et autres
Publié: (2025)
par: Singh, Vishwa Mohan, et autres
Publié: (2025)
OpenWorldSAM: Extending SAM2 for Universal Image Segmentation with Language Prompts
par: Xiao, Shiting, et autres
Publié: (2025)
par: Xiao, Shiting, et autres
Publié: (2025)
An Empirical Study of Sampling Hyperparameters in Diffusion-Based Super-Resolution
par: Wibowo, Yudhistira Arief
Publié: (2025)
par: Wibowo, Yudhistira Arief
Publié: (2025)
A Mixed Diet Makes DINO An Omnivorous Vision Encoder
par: Kabra, Rishabh, et autres
Publié: (2026)
par: Kabra, Rishabh, et autres
Publié: (2026)
Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling
par: Wu, Haoyu, et autres
Publié: (2025)
par: Wu, Haoyu, et autres
Publié: (2025)
Leveraging VLM-Based Pipelines to Annotate 3D Objects
par: Kabra, Rishabh, et autres
Publié: (2023)
par: Kabra, Rishabh, et autres
Publié: (2023)
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
par: Zhao, Min, et autres
Publié: (2024)
par: Zhao, Min, et autres
Publié: (2024)
Optical Flow Representation Alignment Mamba Diffusion Model for Medical Video Generation
par: Wang, Zhenbin, et autres
Publié: (2024)
par: Wang, Zhenbin, et autres
Publié: (2024)
On Large Visual Language Models for Medical Imaging Analysis: An Empirical Study
par: Van, Minh-Hao, et autres
Publié: (2024)
par: Van, Minh-Hao, et autres
Publié: (2024)
Representations of Text and Images Align From Layer One
par: Wybitul, Evžen, et autres
Publié: (2026)
par: Wybitul, Evžen, et autres
Publié: (2026)
KOALA: Empirical Lessons Toward Memory-Efficient and Fast Diffusion Models for Text-to-Image Synthesis
par: Lee, Youngwan, et autres
Publié: (2023)
par: Lee, Youngwan, et autres
Publié: (2023)
Upcycling Text-to-Image Diffusion Models for Multi-Task Capabilities
par: Chavhan, Ruchika, et autres
Publié: (2025)
par: Chavhan, Ruchika, et autres
Publié: (2025)
Multi-identity Human Image Animation with Structural Video Diffusion
par: Wang, Zhenzhi, et autres
Publié: (2025)
par: Wang, Zhenzhi, et autres
Publié: (2025)
MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model
par: Niu, Muyao, et autres
Publié: (2024)
par: Niu, Muyao, et autres
Publié: (2024)
Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model
par: Yang, Yang, et autres
Publié: (2025)
par: Yang, Yang, et autres
Publié: (2025)
Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
Hardware-Friendly Static Quantization Method for Video Diffusion Transformers
par: Yi, Sanghyun, et autres
Publié: (2025)
par: Yi, Sanghyun, et autres
Publié: (2025)
From Histopathology Images to Cell Clouds: Learning Slide Representations with Hierarchical Cell Transformer
par: Yang, Zijiang, et autres
Publié: (2024)
par: Yang, Zijiang, et autres
Publié: (2024)
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
par: Chen, Junsong, et autres
Publié: (2025)
par: Chen, Junsong, et autres
Publié: (2025)
What Are You Doing? A Closer Look at Controllable Human Video Generation
par: Bugliarello, Emanuele, et autres
Publié: (2025)
par: Bugliarello, Emanuele, et autres
Publié: (2025)
Enabling Versatile Controls for Video Diffusion Models
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations
par: Feng, Weixi, et autres
Publié: (2025)
par: Feng, Weixi, et autres
Publié: (2025)
ReLumix: Extending Image Relighting to Video via Video Diffusion Models
par: Wang, Lezhong, et autres
Publié: (2025)
par: Wang, Lezhong, et autres
Publié: (2025)
Towards Latent Masked Image Modeling for Self-Supervised Visual Representation Learning
par: Wei, Yibing, et autres
Publié: (2024)
par: Wei, Yibing, et autres
Publié: (2024)
NOVA3D: Normal Aligned Video Diffusion Model for Single Image to 3D Generation
par: Yang, Yuxiao, et autres
Publié: (2025)
par: Yang, Yuxiao, et autres
Publié: (2025)
Transcriptomics-guided Slide Representation Learning in Computational Pathology
par: Jaume, Guillaume, et autres
Publié: (2024)
par: Jaume, Guillaume, et autres
Publié: (2024)
FLNet: Flood-Induced Agriculture Damage Assessment using Super Resolution of Satellite Images
par: Ghosal, Sanidhya, et autres
Publié: (2026)
par: Ghosal, Sanidhya, et autres
Publié: (2026)
Documents similaires
-
Frozen Forecasting: A Unified Evaluation
par: Walker, Jacob C, et autres
Publié: (2025) -
Moving Off-the-Grid: Scene-Grounded Video Representations
par: van Steenkiste, Sjoerd, et autres
Publié: (2024) -
Scaling 4D Representations
par: Carreira, João, et autres
Publié: (2024) -
DORSal: Diffusion for Object-centric Representations of Scenes et al
par: Jabri, Allan, et autres
Publié: (2023) -
DyST: Towards Dynamic Neural Scene Representations on Real-World Videos
par: Seitzer, Maximilian, et autres
Publié: (2023)