Saved in:
| Main Authors: | Shi, Xiangwei, Dorta, Gara, de Jong, Ruud, Shirekar, Ojas, Raman, Chirag |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2603.23089 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Physics-driven Fire Modeling from Multi-view Images
by: Dorta, Gara, et al.
Published: (2018)
by: Dorta, Gara, et al.
Published: (2018)
MindForge: Empowering Embodied Agents with Theory of Mind for Lifelong Cultural Learning
by: Lică, Mircea, et al.
Published: (2024)
by: Lică, Mircea, et al.
Published: (2024)
Audio-Synchronized Visual Animation
by: Zhang, Lin, et al.
Published: (2024)
by: Zhang, Lin, et al.
Published: (2024)
The GAN that Warped: Semantic Attribute Editing with Unpaired Data
by: Dorta, Gara, et al.
Published: (2018)
by: Dorta, Gara, et al.
Published: (2018)
Training VAEs Under Structured Residuals
by: Dorta, Gara, et al.
Published: (2018)
by: Dorta, Gara, et al.
Published: (2018)
Multi-View Camera System for Variant-Aware Autonomous Vehicle Inspection and Defect Detection
by: Kulkarni, Yash, et al.
Published: (2025)
by: Kulkarni, Yash, et al.
Published: (2025)
Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm
by: Zhang, Lin, et al.
Published: (2025)
by: Zhang, Lin, et al.
Published: (2025)
Text-Guided Texturing by Synchronized Multi-View Diffusion
by: Liu, Yuxin, et al.
Published: (2023)
by: Liu, Yuxin, et al.
Published: (2023)
OmniEdit: A Training-free framework for Lip Synchronization and Audio-Visual Editing
by: Lin, Lixiang, et al.
Published: (2026)
by: Lin, Lixiang, et al.
Published: (2026)
KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
by: Wang, Xingrui, et al.
Published: (2025)
by: Wang, Xingrui, et al.
Published: (2025)
Controlled Face Manipulation and Synthesis for Data Augmentation
by: Kirchner, Joris, et al.
Published: (2026)
by: Kirchner, Joris, et al.
Published: (2026)
Multimodal Quantitative Measures for Multiparty Behaviour Evaluation
by: Shirekar, Ojas, et al.
Published: (2025)
by: Shirekar, Ojas, et al.
Published: (2025)
MVPaint: Synchronized Multi-View Diffusion for Painting Anything 3D
by: Cheng, Wei, et al.
Published: (2024)
by: Cheng, Wei, et al.
Published: (2024)
A Novel Method to Improve Quality Surface Coverage in Multi-View Capture
by: Huang, Wei-Lun, et al.
Published: (2024)
by: Huang, Wei-Lun, et al.
Published: (2024)
UniSync: A Unified Framework for Audio-Visual Synchronization
by: Feng, Tao, et al.
Published: (2025)
by: Feng, Tao, et al.
Published: (2025)
SyncFix: Fixing 3D Reconstructions via Multi-View Synchronization
by: Li, Deming, et al.
Published: (2026)
by: Li, Deming, et al.
Published: (2026)
Extend Your Horizon: A Device-Agnostic Surgical Tool Tracking Framework with Multi-View Optimization for Augmented Reality
by: Zhang, Jiaming, et al.
Published: (2026)
by: Zhang, Jiaming, et al.
Published: (2026)
Registration-Free Learnable Multi-View Capture of Faces in Dense Semantic Correspondence
by: Filntisis, Panagiotis P., et al.
Published: (2026)
by: Filntisis, Panagiotis P., et al.
Published: (2026)
GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures
by: Noras, Patrick, et al.
Published: (2025)
by: Noras, Patrick, et al.
Published: (2025)
Multimodal Transformer Distillation for Audio-Visual Synchronization
by: Chen, Xuanjun, et al.
Published: (2022)
by: Chen, Xuanjun, et al.
Published: (2022)
Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers
by: Song, Jibin, et al.
Published: (2025)
by: Song, Jibin, et al.
Published: (2025)
ToLL: Topological Layout Learning with Asymmetric Cross-View Structural Distillation for 3D Scene Graph Generation Pretraining
by: Huang, Yucheng, et al.
Published: (2026)
by: Huang, Yucheng, et al.
Published: (2026)
Visual Sync: Multi-Camera Synchronization via Cross-View Object Motion
by: Liu, Shaowei, et al.
Published: (2025)
by: Liu, Shaowei, et al.
Published: (2025)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
by: Wang, Kai, et al.
Published: (2024)
by: Wang, Kai, et al.
Published: (2024)
Audio-driven Talking Face Generation with Stabilized Synchronization Loss
by: Yaman, Dogucan, et al.
Published: (2023)
by: Yaman, Dogucan, et al.
Published: (2023)
Learning from Synchronization: Self-Supervised Uncalibrated Multi-View Person Association in Challenging Scenes
by: Chen, Keqi, et al.
Published: (2025)
by: Chen, Keqi, et al.
Published: (2025)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
by: OpenMOSS Team, et al.
Published: (2026)
by: OpenMOSS Team, et al.
Published: (2026)
SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion
by: Ma, Junxian, et al.
Published: (2025)
by: Ma, Junxian, et al.
Published: (2025)
IDD-X: A Multi-View Dataset for Ego-relative Important Object Localization and Explanation in Dense and Unstructured Traffic
by: Parikh, Chirag, et al.
Published: (2024)
by: Parikh, Chirag, et al.
Published: (2024)
Audio-Guided Visual Editing with Complex Multi-Modal Prompts
by: Kim, Hyeonyu, et al.
Published: (2025)
by: Kim, Hyeonyu, et al.
Published: (2025)
ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition
by: Huang, Ronggang, et al.
Published: (2025)
by: Huang, Ronggang, et al.
Published: (2025)
StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model
by: Yang, Yifan, et al.
Published: (2025)
by: Yang, Yifan, et al.
Published: (2025)
Fully automated landmarking and facial segmentation on 3D photographs
by: Berends, Bo, et al.
Published: (2023)
by: Berends, Bo, et al.
Published: (2023)
EgoAVU: Egocentric Audio-Visual Understanding
by: Seth, Ashish, et al.
Published: (2026)
by: Seth, Ashish, et al.
Published: (2026)
A Novel Audio-Visual Information Fusion System for Mental Disorders Detection
by: Li, Yichun, et al.
Published: (2024)
by: Li, Yichun, et al.
Published: (2024)
Energy-Based Constraint Networks: Learning Structural Coherence Across Modalities
by: Shinde, Chirag
Published: (2026)
by: Shinde, Chirag
Published: (2026)
DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding
by: Ahmadian, Mona, et al.
Published: (2025)
by: Ahmadian, Mona, et al.
Published: (2025)
SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token Synchronization
by: Ahn, Young Jin, et al.
Published: (2024)
by: Ahn, Young Jin, et al.
Published: (2024)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
by: Wang, Langyu, et al.
Published: (2025)
by: Wang, Langyu, et al.
Published: (2025)
MetaCap: Meta-learning Priors from Multi-View Imagery for Sparse-view Human Performance Capture and Rendering
by: Sun, Guoxing, et al.
Published: (2024)
by: Sun, Guoxing, et al.
Published: (2024)
Similar Items
-
Physics-driven Fire Modeling from Multi-view Images
by: Dorta, Gara, et al.
Published: (2018) -
MindForge: Empowering Embodied Agents with Theory of Mind for Lifelong Cultural Learning
by: Lică, Mircea, et al.
Published: (2024) -
Audio-Synchronized Visual Animation
by: Zhang, Lin, et al.
Published: (2024) -
The GAN that Warped: Semantic Attribute Editing with Unpaired Data
by: Dorta, Gara, et al.
Published: (2018) -
Training VAEs Under Structured Residuals
by: Dorta, Gara, et al.
Published: (2018)