Beyond Audio and Pose: A General-Purpose Framework for Video Synchronization
Fuente:
arXiv
Salvato in:
| Autori principali: | Shin, Yosub, Molybog, Igor |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
m2sv: A Scalable Benchmark for Map-to-Street-View Spatial Reasoning
di: Shin, Yosub, et al.
Pubblicazione: (2026)
di: Shin, Yosub, et al.
Pubblicazione: (2026)
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
di: Ling, Jun, et al.
Pubblicazione: (2024)
di: Ling, Jun, et al.
Pubblicazione: (2024)
MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance
di: Zhang, Yuang, et al.
Pubblicazione: (2024)
di: Zhang, Yuang, et al.
Pubblicazione: (2024)
Diffusion Models for Joint Audio-Video Generation
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
Text-to-Audio Generation Synchronized with Videos
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation
di: Huang, Feizhen, et al.
Pubblicazione: (2025)
di: Huang, Feizhen, et al.
Pubblicazione: (2025)
OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation
di: Gan, Qijun, et al.
Pubblicazione: (2025)
di: Gan, Qijun, et al.
Pubblicazione: (2025)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
di: Wu, Haoning, et al.
Pubblicazione: (2023)
di: Wu, Haoning, et al.
Pubblicazione: (2023)
Apollo: Unified Multi-Task Audio-Video Joint Generation
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
Do Joint Audio-Video Generation Models Understand Physics?
di: Cui, Zijun, et al.
Pubblicazione: (2026)
di: Cui, Zijun, et al.
Pubblicazione: (2026)
Audio-visual Event Localization on Portrait Mode Short Videos
di: Liu, Wuyang, et al.
Pubblicazione: (2025)
di: Liu, Wuyang, et al.
Pubblicazione: (2025)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
di: Tan, Weiting, et al.
Pubblicazione: (2026)
di: Tan, Weiting, et al.
Pubblicazione: (2026)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
Moiré Video Authentication: A Physical Signature Against AI Video Generation
di: Qing, Yuan, et al.
Pubblicazione: (2026)
di: Qing, Yuan, et al.
Pubblicazione: (2026)
Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework
di: Arkhipkin, Vladimir, et al.
Pubblicazione: (2024)
di: Arkhipkin, Vladimir, et al.
Pubblicazione: (2024)
AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks
di: Ku, Max, et al.
Pubblicazione: (2024)
di: Ku, Max, et al.
Pubblicazione: (2024)
VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing
di: Gu, Jing, et al.
Pubblicazione: (2024)
di: Gu, Jing, et al.
Pubblicazione: (2024)
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
di: Zhou, Pengyuan, et al.
Pubblicazione: (2024)
di: Zhou, Pengyuan, et al.
Pubblicazione: (2024)
UBiSS: A Unified Framework for Bimodal Semantic Summarization of Videos
di: Mei, Yuting, et al.
Pubblicazione: (2024)
di: Mei, Yuting, et al.
Pubblicazione: (2024)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
EmotionGesture: Audio-Driven Diverse Emotional Co-Speech 3D Gesture Generation
di: Qi, Xingqun, et al.
Pubblicazione: (2023)
di: Qi, Xingqun, et al.
Pubblicazione: (2023)
Interactive Video Generation via Domain Adaptation
di: Rawal, Ishaan, et al.
Pubblicazione: (2025)
di: Rawal, Ishaan, et al.
Pubblicazione: (2025)
Decoupled Audio-Visual Dataset Distillation
di: Li, Wenyuan, et al.
Pubblicazione: (2025)
di: Li, Wenyuan, et al.
Pubblicazione: (2025)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
di: Yan, Xin, et al.
Pubblicazione: (2024)
di: Yan, Xin, et al.
Pubblicazione: (2024)
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2026)
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2026)
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
di: S, Sridhar, et al.
Pubblicazione: (2025)
di: S, Sridhar, et al.
Pubblicazione: (2025)
Unified Video-Language Pre-training with Synchronized Audio
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Audio Visual Segmentation Through Text Embeddings
di: Lee, Kyungbok, et al.
Pubblicazione: (2025)
di: Lee, Kyungbok, et al.
Pubblicazione: (2025)
Exploring Category-level Articulated Object Pose Tracking on SE(3) Manifolds
di: Meng, Xianhui, et al.
Pubblicazione: (2025)
di: Meng, Xianhui, et al.
Pubblicazione: (2025)
Taming Modality Entanglement in Continual Audio-Visual Segmentation
di: Hong, Yuyang, et al.
Pubblicazione: (2025)
di: Hong, Yuyang, et al.
Pubblicazione: (2025)
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation
di: Qu, Qiang, et al.
Pubblicazione: (2025)
di: Qu, Qiang, et al.
Pubblicazione: (2025)
UniVid: Pyramid Diffusion Model for High Quality Video Generation
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information
di: Kim, Bumsoo, et al.
Pubblicazione: (2024)
di: Kim, Bumsoo, et al.
Pubblicazione: (2024)
Audio-Guided Visual Perception for Audio-Visual Navigation
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
m2sv: A Scalable Benchmark for Map-to-Street-View Spatial Reasoning
di: Shin, Yosub, et al.
Pubblicazione: (2026) -
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
di: Ling, Jun, et al.
Pubblicazione: (2024) -
MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance
di: Zhang, Yuang, et al.
Pubblicazione: (2024) -
Diffusion Models for Joint Audio-Video Generation
di: La Torre, Alejandro Paredes
Pubblicazione: (2026) -
Text-to-Audio Generation Synchronized with Videos
di: Mo, Shentong, et al.
Pubblicazione: (2024)