SyncVP: Joint Diffusion for Synchronous Multi-Modal Video Prediction
Fuente:
arXiv
Guardado en:
| Autores principales: | Pallotta, Enrico, Azar, Sina Mokhtarzadeh, Li, Shuai, Zatsarynna, Olga, Gall, Juergen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization
por: Azar, Sina Mokhtarzadeh, et al.
Publicado: (2025)
por: Azar, Sina Mokhtarzadeh, et al.
Publicado: (2025)
EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses
por: Pallotta, Enrico, et al.
Publicado: (2025)
por: Pallotta, Enrico, et al.
Publicado: (2025)
CamC2V: Context-aware Controllable Video Generation
por: Denninger, Luis, et al.
Publicado: (2025)
por: Denninger, Luis, et al.
Publicado: (2025)
Gated Temporal Diffusion for Stochastic Long-Term Dense Anticipation
por: Zatsarynna, Olga, et al.
Publicado: (2024)
por: Zatsarynna, Olga, et al.
Publicado: (2024)
MANTA: Diffusion Mamba for Efficient and Effective Stochastic Long-Term Dense Anticipation
por: Zatsarynna, Olga, et al.
Publicado: (2025)
por: Zatsarynna, Olga, et al.
Publicado: (2025)
STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering
por: Bahrami, Emad, et al.
Publicado: (2026)
por: Bahrami, Emad, et al.
Publicado: (2026)
Towards Generalizing Temporal Action Segmentation to Unseen Views
por: Bahrami, Emad, et al.
Publicado: (2025)
por: Bahrami, Emad, et al.
Publicado: (2025)
Privacy-Preserving Semantic Segmentation from Ultra-Low-Resolution RGB Inputs
por: Huang, Xuying, et al.
Publicado: (2025)
por: Huang, Xuying, et al.
Publicado: (2025)
MixANT: Observation-dependent Memory Propagation for Stochastic Dense Action Anticipation
por: Wasim, Syed Talal, et al.
Publicado: (2025)
por: Wasim, Syed Talal, et al.
Publicado: (2025)
Looking into the Unknown: Exploring Action Discovery for Segmentation of Known and Unknown Actions
por: Spurio, Federico, et al.
Publicado: (2025)
por: Spurio, Federico, et al.
Publicado: (2025)
SyncMV4D: Synchronized Multi-view Joint Diffusion of Appearance and Motion for Hand-Object Interaction Synthesis
por: Dang, Lingwei, et al.
Publicado: (2025)
por: Dang, Lingwei, et al.
Publicado: (2025)
SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning
por: Cheng, Xin, et al.
Publicado: (2026)
por: Cheng, Xin, et al.
Publicado: (2026)
SyncVIS: Synchronized Video Instance Segmentation
por: Zheng, Rongkun, et al.
Publicado: (2024)
por: Zheng, Rongkun, et al.
Publicado: (2024)
Learning a Neural Association Network for Self-supervised Multi-Object Tracking
por: Li, Shuai, et al.
Publicado: (2024)
por: Li, Shuai, et al.
Publicado: (2024)
DepthSync: Diffusion Guidance-Based Depth Synchronization for Scale- and Geometry-Consistent Video Depth Estimation
por: Dong, Yue-Jiang, et al.
Publicado: (2025)
por: Dong, Yue-Jiang, et al.
Publicado: (2025)
Video Panels for Long Video Understanding
por: Doorenbos, Lars, et al.
Publicado: (2025)
por: Doorenbos, Lars, et al.
Publicado: (2025)
OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers
por: Peng, Ziqiao, et al.
Publicado: (2025)
por: Peng, Ziqiao, et al.
Publicado: (2025)
SyncTweedies: A General Generative Framework Based on Synchronized Diffusions
por: Kim, Jaihoon, et al.
Publicado: (2024)
por: Kim, Jaihoon, et al.
Publicado: (2024)
SyncTrack4D: Cross-Video Motion Alignment and Video Synchronization for Multi-Video 4D Gaussian Splatting
por: Lee, Yonghan, et al.
Publicado: (2025)
por: Lee, Yonghan, et al.
Publicado: (2025)
SyncFix: Fixing 3D Reconstructions via Multi-View Synchronization
por: Li, Deming, et al.
Publicado: (2026)
por: Li, Deming, et al.
Publicado: (2026)
HighSync: High-Quality Lip Synchronization via Latent Diffusion Models
por: Daghigh, Saeed Firouzi, et al.
Publicado: (2026)
por: Daghigh, Saeed Firouzi, et al.
Publicado: (2026)
PhysioSync: Temporal and Cross-Modal Contrastive Learning Inspired by Physiological Synchronization for EEG-Based Emotion Recognition
por: Cui, Kai, et al.
Publicado: (2025)
por: Cui, Kai, et al.
Publicado: (2025)
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
por: Cong, Gaoxiang, et al.
Publicado: (2026)
por: Cong, Gaoxiang, et al.
Publicado: (2026)
SyncSDE: A Probabilistic Framework for Diffusion Synchronization
por: Lee, Hyunjun, et al.
Publicado: (2025)
por: Lee, Hyunjun, et al.
Publicado: (2025)
ADA-Track++: End-to-End Multi-Camera 3D Multi-Object Tracking with Alternating Detection and Association
por: Ding, Shuxiao, et al.
Publicado: (2024)
por: Ding, Shuxiao, et al.
Publicado: (2024)
SyncTalk: The Devil is in the Synchronization for Talking Head Synthesis
por: Peng, Ziqiao, et al.
Publicado: (2023)
por: Peng, Ziqiao, et al.
Publicado: (2023)
LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision
por: Li, Chunyu, et al.
Publicado: (2024)
por: Li, Chunyu, et al.
Publicado: (2024)
StochSync: Stochastic Diffusion Synchronization for Image Generation in Arbitrary Spaces
por: Yeo, Kyeongmin, et al.
Publicado: (2025)
por: Yeo, Kyeongmin, et al.
Publicado: (2025)
StableMamba: Distillation-free Scaling of Large SSMs for Images and Videos
por: Suleman, Hamid, et al.
Publicado: (2024)
por: Suleman, Hamid, et al.
Publicado: (2024)
FlowNar: Scalable Streaming Narration for Long-Form Videos
por: Zhong, Zeyun, et al.
Publicado: (2026)
por: Zhong, Zeyun, et al.
Publicado: (2026)
Video-Panda: Parameter-efficient Alignment for Encoder-free Video-Language Models
por: Yi, Jinhui, et al.
Publicado: (2024)
por: Yi, Jinhui, et al.
Publicado: (2024)
SyncDiff: Synchronized Motion Diffusion for Multi-Body Human-Object Interaction Synthesis
por: He, Wenkun, et al.
Publicado: (2024)
por: He, Wenkun, et al.
Publicado: (2024)
LC-SLab -- An Object-based Deep Learning Framework for Large-scale Land Cover Classification from Satellite Imagery and Sparse In-situ Labels
por: Leonhardt, Johannes, et al.
Publicado: (2025)
por: Leonhardt, Johannes, et al.
Publicado: (2025)
Identifying Spatio-Temporal Drivers of Extreme Events
por: Eddin, Mohamad Hakam Shams, et al.
Publicado: (2024)
por: Eddin, Mohamad Hakam Shams, et al.
Publicado: (2024)
Enhancing Video-Based Robot Failure Detection Using Task Knowledge
por: Thoduka, Santosh, et al.
Publicado: (2025)
por: Thoduka, Santosh, et al.
Publicado: (2025)
RocSync: Millisecond-Accurate Temporal Synchronization for Heterogeneous Camera Systems
por: Meyer, Jaro, et al.
Publicado: (2025)
por: Meyer, Jaro, et al.
Publicado: (2025)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
por: Li, Liyang, et al.
Publicado: (2026)
por: Li, Liyang, et al.
Publicado: (2026)
Global-Aware Monocular Semantic Scene Completion with State Space Models
por: Li, Shijie, et al.
Publicado: (2025)
por: Li, Shijie, et al.
Publicado: (2025)
UniSync: Towards Generalizable and High-Fidelity Lip Synchronization for Challenging Scenarios
por: Fan, Ruidi, et al.
Publicado: (2026)
por: Fan, Ruidi, et al.
Publicado: (2026)
MV-Match: Multi-View Matching for Domain-Adaptive Identification of Plant Nutrient Deficiencies
por: Yi, Jinhui, et al.
Publicado: (2024)
por: Yi, Jinhui, et al.
Publicado: (2024)
Ejemplares similares
-
Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization
por: Azar, Sina Mokhtarzadeh, et al.
Publicado: (2025) -
EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses
por: Pallotta, Enrico, et al.
Publicado: (2025) -
CamC2V: Context-aware Controllable Video Generation
por: Denninger, Luis, et al.
Publicado: (2025) -
Gated Temporal Diffusion for Stochastic Long-Term Dense Anticipation
por: Zatsarynna, Olga, et al.
Publicado: (2024) -
MANTA: Diffusion Mamba for Efficient and Effective Stochastic Long-Term Dense Anticipation
por: Zatsarynna, Olga, et al.
Publicado: (2025)