Versatile Transition Generation with Image-to-Video Diffusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Zuhao, Zhang, Jiahui, Yu, Yingchen, Lu, Shijian, Bai, Song |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
di: Li, Duo, et al.
Pubblicazione: (2025)
di: Li, Duo, et al.
Pubblicazione: (2025)
Debiasing Text-to-Image Diffusion Models
di: He, Ruifei, et al.
Pubblicazione: (2024)
di: He, Ruifei, et al.
Pubblicazione: (2024)
Learning to Animate Images from A Few Videos to Portray Delicate Human Actions
di: Li, Haoxin, et al.
Pubblicazione: (2025)
di: Li, Haoxin, et al.
Pubblicazione: (2025)
ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
di: Li, Duo, et al.
Pubblicazione: (2025)
di: Li, Duo, et al.
Pubblicazione: (2025)
Novel View Extrapolation with Video Diffusion Priors
di: Liu, Kunhao, et al.
Pubblicazione: (2024)
di: Liu, Kunhao, et al.
Pubblicazione: (2024)
VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models
di: Zhang, Yabo, et al.
Pubblicazione: (2024)
di: Zhang, Yabo, et al.
Pubblicazione: (2024)
Weakly Supervised 3D Open-vocabulary Segmentation
di: Liu, Kunhao, et al.
Pubblicazione: (2023)
di: Liu, Kunhao, et al.
Pubblicazione: (2023)
ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning
di: Yang, Zuhao, et al.
Pubblicazione: (2026)
di: Yang, Zuhao, et al.
Pubblicazione: (2026)
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
PCR-GS: COLMAP-Free 3D Gaussian Splatting via Pose Co-Regularizations
di: Wei, Yu, et al.
Pubblicazione: (2025)
di: Wei, Yu, et al.
Pubblicazione: (2025)
SOGS: Second-Order Anchor for Advanced 3D Gaussian Splatting
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
PICD: Versatile Perceptual Image Compression with Diffusion Rendering
di: Xu, Tongda, et al.
Pubblicazione: (2025)
di: Xu, Tongda, et al.
Pubblicazione: (2025)
Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
di: Lan, Mengcheng, et al.
Pubblicazione: (2025)
di: Lan, Mengcheng, et al.
Pubblicazione: (2025)
Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
di: Liu, Kunhao, et al.
Pubblicazione: (2025)
di: Liu, Kunhao, et al.
Pubblicazione: (2025)
V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes
di: Zhang, Yanming, et al.
Pubblicazione: (2025)
di: Zhang, Yanming, et al.
Pubblicazione: (2025)
FDIM: A Feature-distance-based Generic Video Quality Metric for Versatile Codecs
di: Wang, Jiayi, et al.
Pubblicazione: (2026)
di: Wang, Jiayi, et al.
Pubblicazione: (2026)
Enabling Versatile Controls for Video Diffusion Models
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
di: Wang, Kai, et al.
Pubblicazione: (2024)
di: Wang, Kai, et al.
Pubblicazione: (2024)
Data-Efficient Generalization for Zero-shot Composed Image Retrieval
di: Chen, Zining, et al.
Pubblicazione: (2025)
di: Chen, Zining, et al.
Pubblicazione: (2025)
FreGS: 3D Gaussian Splatting with Progressive Frequency Regularization
di: Zhang, Jiahui, et al.
Pubblicazione: (2024)
di: Zhang, Jiahui, et al.
Pubblicazione: (2024)
Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control
di: Gu, Zekai, et al.
Pubblicazione: (2025)
di: Gu, Zekai, et al.
Pubblicazione: (2025)
Versatile Diffusion: Text, Images and Variations All in One Diffusion Model
di: Xu, Xingqian, et al.
Pubblicazione: (2022)
di: Xu, Xingqian, et al.
Pubblicazione: (2022)
AR-Diffusion: Asynchronous Video Generation with Auto-Regressive Diffusion
di: Sun, Mingzhen, et al.
Pubblicazione: (2025)
di: Sun, Mingzhen, et al.
Pubblicazione: (2025)
L3DR: 3D-aware LiDAR Diffusion and Rectification
di: Liu, Quan, et al.
Pubblicazione: (2026)
di: Liu, Quan, et al.
Pubblicazione: (2026)
MedDiff-FM: A Diffusion-based Foundation Model for Versatile Medical Image Applications
di: Yu, Yongrui, et al.
Pubblicazione: (2024)
di: Yu, Yongrui, et al.
Pubblicazione: (2024)
Controllable Generation with Text-to-Image Diffusion Models: A Survey
di: Cao, Pu, et al.
Pubblicazione: (2024)
di: Cao, Pu, et al.
Pubblicazione: (2024)
WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene Generation
di: Lu, Jiachen, et al.
Pubblicazione: (2023)
di: Lu, Jiachen, et al.
Pubblicazione: (2023)
VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models
di: Huang, Ziqi, et al.
Pubblicazione: (2024)
di: Huang, Ziqi, et al.
Pubblicazione: (2024)
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
di: Chen, Houyuan, et al.
Pubblicazione: (2026)
di: Chen, Houyuan, et al.
Pubblicazione: (2026)
MAVIN: Multi-Action Video Generation with Diffusion Models via Transition Video Infilling
di: Zhang, Bowen, et al.
Pubblicazione: (2024)
di: Zhang, Bowen, et al.
Pubblicazione: (2024)
ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors
di: Yu, Haodong, et al.
Pubblicazione: (2026)
di: Yu, Haodong, et al.
Pubblicazione: (2026)
Attributed Synthetic Data Generation for Zero-shot Domain-specific Image Classification
di: Wang, Shijian, et al.
Pubblicazione: (2025)
di: Wang, Shijian, et al.
Pubblicazione: (2025)
SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
di: Yang, Zhongyu, et al.
Pubblicazione: (2026)
di: Yang, Zhongyu, et al.
Pubblicazione: (2026)
V-Bridge: Bridging Video Generative Priors to Versatile Few-shot Image Restoration
di: Zheng, Shenghe, et al.
Pubblicazione: (2026)
di: Zheng, Shenghe, et al.
Pubblicazione: (2026)
On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection
di: Song, Xiufeng, et al.
Pubblicazione: (2024)
di: Song, Xiufeng, et al.
Pubblicazione: (2024)
Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
di: Liu, Xiaohong, et al.
Pubblicazione: (2025)
di: Liu, Xiaohong, et al.
Pubblicazione: (2025)
Weakly Supervised Monocular 3D Detection with a Single-View Image
di: Jiang, Xueying, et al.
Pubblicazione: (2024)
di: Jiang, Xueying, et al.
Pubblicazione: (2024)
CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models
di: Wu, Xiaoxue, et al.
Pubblicazione: (2025)
di: Wu, Xiaoxue, et al.
Pubblicazione: (2025)
In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
di: Zhang, Zechuan, et al.
Pubblicazione: (2025)
di: Zhang, Zechuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding
di: Yang, Zuhao, et al.
Pubblicazione: (2025) -
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
di: Li, Duo, et al.
Pubblicazione: (2025) -
Debiasing Text-to-Image Diffusion Models
di: He, Ruifei, et al.
Pubblicazione: (2024) -
Learning to Animate Images from A Few Videos to Portray Delicate Human Actions
di: Li, Haoxin, et al.
Pubblicazione: (2025) -
ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
di: Li, Duo, et al.
Pubblicazione: (2025)