Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Lingyu, Wang, Yaxiong, Zhu, Li, Zheng, Zhedong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Every Painting Awakened: A Training-free Framework for Painting-to-Animation Generation
di: Liu, Lingyu, et al.
Pubblicazione: (2025)
di: Liu, Lingyu, et al.
Pubblicazione: (2025)
Look, Compare and Draw: Differential Query Transformer for Automatic Oil Painting
di: Liu, Lingyu, et al.
Pubblicazione: (2026)
di: Liu, Lingyu, et al.
Pubblicazione: (2026)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
di: Yang, Shuyu, et al.
Pubblicazione: (2024)
di: Yang, Shuyu, et al.
Pubblicazione: (2024)
SEED: A Benchmark Dataset for Sequential Facial Attribute Editing with Diffusion Models
di: Zhu, Yule, et al.
Pubblicazione: (2025)
di: Zhu, Yule, et al.
Pubblicazione: (2025)
Consistency-aware Fake Videos Detection on Short Video Platforms
di: Wang, Junxi, et al.
Pubblicazione: (2025)
di: Wang, Junxi, et al.
Pubblicazione: (2025)
360VFI: A Dataset and Benchmark for Omnidirectional Video Frame Interpolation
di: Lu, Wenxuan, et al.
Pubblicazione: (2024)
di: Lu, Wenxuan, et al.
Pubblicazione: (2024)
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025)
di: Liu, Jingping, et al.
Pubblicazione: (2025)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
di: Yu, Hang, et al.
Pubblicazione: (2025)
di: Yu, Hang, et al.
Pubblicazione: (2025)
Deep Reversible Consistency Learning for Cross-modal Retrieval
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search
di: Sun, Jintao, et al.
Pubblicazione: (2024)
di: Sun, Jintao, et al.
Pubblicazione: (2024)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
di: Chu, Meng, et al.
Pubblicazione: (2023)
di: Chu, Meng, et al.
Pubblicazione: (2023)
Generative Frame Sampler for Long Video Understanding
di: Yao, Linli, et al.
Pubblicazione: (2025)
di: Yao, Linli, et al.
Pubblicazione: (2025)
EQ-TAA: Equivariant Traffic Accident Anticipation via Diffusion-Based Accident Video Synthesis
di: Fang, Jianwu, et al.
Pubblicazione: (2025)
di: Fang, Jianwu, et al.
Pubblicazione: (2025)
An Efficient Quality Metric for Video Frame Interpolation Based on Motion-Field Divergence
di: Daly, Conall, et al.
Pubblicazione: (2025)
di: Daly, Conall, et al.
Pubblicazione: (2025)
Face Consistency Benchmark for GenAI Video
di: Podstawski, Michal, et al.
Pubblicazione: (2025)
di: Podstawski, Michal, et al.
Pubblicazione: (2025)
Learning Event-guided Exposure-agnostic Video Frame Interpolation via Adaptive Feature Blending
di: Jung, Junsik, et al.
Pubblicazione: (2025)
di: Jung, Junsik, et al.
Pubblicazione: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
di: Liang, Feng, et al.
Pubblicazione: (2023)
di: Liang, Feng, et al.
Pubblicazione: (2023)
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2026)
di: Cong, Gaoxiang, et al.
Pubblicazione: (2026)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
di: Zhang, Deyu, et al.
Pubblicazione: (2025)
di: Zhang, Deyu, et al.
Pubblicazione: (2025)
Reversing the Damage: A QP-Aware Transformer-Diffusion Approach for 8K Video Restoration under Codec Compression
di: Dehaghi, Ali Mollaahmadi, et al.
Pubblicazione: (2024)
di: Dehaghi, Ali Mollaahmadi, et al.
Pubblicazione: (2024)
Viewport Prediction for Volumetric Video Streaming by Exploring Video Saliency and Trajectory Information
di: Li, Jie, et al.
Pubblicazione: (2023)
di: Li, Jie, et al.
Pubblicazione: (2023)
Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval
di: Kandhare, Mahesh, et al.
Pubblicazione: (2024)
di: Kandhare, Mahesh, et al.
Pubblicazione: (2024)
Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction
di: Li, Dong, et al.
Pubblicazione: (2025)
di: Li, Dong, et al.
Pubblicazione: (2025)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
Context-Enhanced Video Moment Retrieval with Large Language Models
di: Liu, Weijia, et al.
Pubblicazione: (2024)
di: Liu, Weijia, et al.
Pubblicazione: (2024)
Exposure Completing for Temporally Consistent Neural High Dynamic Range Video Rendering
di: Cui, Jiahao, et al.
Pubblicazione: (2024)
di: Cui, Jiahao, et al.
Pubblicazione: (2024)
Advancing Unsupervised Low-light Image Enhancement: Noise Estimation, Illumination Interpolation, and Self-Regulation
di: Liu, Xiaofeng, et al.
Pubblicazione: (2023)
di: Liu, Xiaofeng, et al.
Pubblicazione: (2023)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
Adaptive 3D Gaussian Splatting Video Streaming
di: Gong, Han, et al.
Pubblicazione: (2025)
di: Gong, Han, et al.
Pubblicazione: (2025)
Advanced Learning-Based Inter Prediction for Future Video Coding
di: Zhao, Yanchen, et al.
Pubblicazione: (2024)
di: Zhao, Yanchen, et al.
Pubblicazione: (2024)
MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models
di: Guo, Zile, et al.
Pubblicazione: (2026)
di: Guo, Zile, et al.
Pubblicazione: (2026)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
di: Wang, Xiang, et al.
Pubblicazione: (2025)
di: Wang, Xiang, et al.
Pubblicazione: (2025)
ReactDiff: Latent Diffusion for Facial Reaction Generation
di: Li, Jiaming, et al.
Pubblicazione: (2025)
di: Li, Jiaming, et al.
Pubblicazione: (2025)
Bridging the Gap: Sketch-Aware Interpolation Network for High-Quality Animation Sketch Inbetweening
di: Shen, Jiaming, et al.
Pubblicazione: (2023)
di: Shen, Jiaming, et al.
Pubblicazione: (2023)
AutoSSVH: Exploring Automated Frame Sampling for Efficient Self-Supervised Video Hashing
di: Lian, Niu, et al.
Pubblicazione: (2025)
di: Lian, Niu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Every Painting Awakened: A Training-free Framework for Painting-to-Animation Generation
di: Liu, Lingyu, et al.
Pubblicazione: (2025) -
Look, Compare and Draw: Differential Query Transformer for Automatic Oil Painting
di: Liu, Lingyu, et al.
Pubblicazione: (2026) -
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
di: Yang, Shuyu, et al.
Pubblicazione: (2024) -
SEED: A Benchmark Dataset for Sequential Facial Attribute Editing with Diffusion Models
di: Zhu, Yule, et al.
Pubblicazione: (2025) -
Consistency-aware Fake Videos Detection on Short Video Platforms
di: Wang, Junxi, et al.
Pubblicazione: (2025)