SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ling, Zeyu, Gu, Xiaodong, Tang, Jiangnan, Zou, Changqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Style-Preserving Lip Sync via Audio-Aware Style Reference
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
di: Xie, Yifan, et al.
Pubblicazione: (2024)
di: Xie, Yifan, et al.
Pubblicazione: (2024)
From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection
di: Liu, Ke, et al.
Pubblicazione: (2026)
di: Liu, Ke, et al.
Pubblicazione: (2026)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
di: Araujo, Edson, et al.
Pubblicazione: (2025)
di: Araujo, Edson, et al.
Pubblicazione: (2025)
LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
di: Ling, Jun, et al.
Pubblicazione: (2024)
di: Ling, Jun, et al.
Pubblicazione: (2024)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
di: Li, Maomao, et al.
Pubblicazione: (2026)
di: Li, Maomao, et al.
Pubblicazione: (2026)
Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation
di: Shen, Nanhan, et al.
Pubblicazione: (2026)
di: Shen, Nanhan, et al.
Pubblicazione: (2026)
Open-Vocabulary Audio-Visual Semantic Segmentation
di: Guo, Ruohao, et al.
Pubblicazione: (2024)
di: Guo, Ruohao, et al.
Pubblicazione: (2024)
AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2023)
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2023)
AUREXA-SE: Audio-Visual Unified Representation Exchange Architecture with Cross-Attention and Squeezeformer for Speech Enhancement
di: Sajid, M., et al.
Pubblicazione: (2025)
di: Sajid, M., et al.
Pubblicazione: (2025)
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
di: Deng, Zeyu, et al.
Pubblicazione: (2025)
di: Deng, Zeyu, et al.
Pubblicazione: (2025)
Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning
di: Jin, Zeyu, et al.
Pubblicazione: (2026)
di: Jin, Zeyu, et al.
Pubblicazione: (2026)
Chinese-LiPS: A Chinese audio-visual speech recognition dataset with Lip-reading and Presentation Slides
di: Zhao, Jinghua, et al.
Pubblicazione: (2025)
di: Zhao, Jinghua, et al.
Pubblicazione: (2025)
Progressive Confident Masking Attention Network for Audio-Visual Segmentation
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
AxiomVision: Accuracy-Guaranteed Adaptive Visual Model Selection for Perspective-Aware Video Analytics
di: Dai, Xiangxiang, et al.
Pubblicazione: (2024)
di: Dai, Xiangxiang, et al.
Pubblicazione: (2024)
Iterative Residual Cross-Attention Mechanism: An Integrated Approach for Audio-Visual Navigation Tasks
di: Zhang, Hailong, et al.
Pubblicazione: (2025)
di: Zhang, Hailong, et al.
Pubblicazione: (2025)
Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
di: Choi, Jeongsoo, et al.
Pubblicazione: (2023)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2023)
Multi-Agent Game Generation and Evaluation via Audio-Visual Recordings
di: Jolicoeur-Martineau, Alexia
Pubblicazione: (2025)
di: Jolicoeur-Martineau, Alexia
Pubblicazione: (2025)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
Audio-Guided Visual Perception for Audio-Visual Navigation
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
SEER: Semantic Enhancement and Emotional Reasoning Network for Multimodal Fake News Detection
di: Zhu, Peican, et al.
Pubblicazione: (2025)
di: Zhu, Peican, et al.
Pubblicazione: (2025)
MotionBeat: Motion-Aligned Music Representation via Embodied Contrastive Learning and Bar-Equivariant Contact-Aware Encoding
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
di: Liu, Haohe, et al.
Pubblicazione: (2023)
di: Liu, Haohe, et al.
Pubblicazione: (2023)
Unveiling Visual Biases in Audio-Visual Localization Benchmarks
di: Chen, Liangyu, et al.
Pubblicazione: (2024)
di: Chen, Liangyu, et al.
Pubblicazione: (2024)
Variable-Length Audio Fingerprinting
di: Chen, Hongjie, et al.
Pubblicazione: (2026)
di: Chen, Hongjie, et al.
Pubblicazione: (2026)
QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models
di: Lin, Zixing, et al.
Pubblicazione: (2026)
di: Lin, Zixing, et al.
Pubblicazione: (2026)
Decoupled Audio-Visual Dataset Distillation
di: Li, Wenyuan, et al.
Pubblicazione: (2025)
di: Li, Wenyuan, et al.
Pubblicazione: (2025)
DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024)
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
di: Wu, Linzhi, et al.
Pubblicazione: (2026)
di: Wu, Linzhi, et al.
Pubblicazione: (2026)
SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models
di: Wen, Jinming, et al.
Pubblicazione: (2025)
di: Wen, Jinming, et al.
Pubblicazione: (2025)
Solving Copyright Infringement on Short Video Platforms: Novel Datasets and an Audio Restoration Deep Learning Pipeline
di: Oh, Minwoo, et al.
Pubblicazione: (2025)
di: Oh, Minwoo, et al.
Pubblicazione: (2025)
Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering
di: Wang, Xu, et al.
Pubblicazione: (2025)
di: Wang, Xu, et al.
Pubblicazione: (2025)
Audio Visual Segmentation Through Text Embeddings
di: Lee, Kyungbok, et al.
Pubblicazione: (2025)
di: Lee, Kyungbok, et al.
Pubblicazione: (2025)
MaskCD: Mitigating LVLM Hallucinations by Image Head Masked Contrastive Decoding
di: Deng, Jingyuan, et al.
Pubblicazione: (2025)
di: Deng, Jingyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Style-Preserving Lip Sync via Audio-Aware Style Reference
di: Zhong, Weizhi, et al.
Pubblicazione: (2024) -
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model
di: Zhong, Weizhi, et al.
Pubblicazione: (2024) -
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
di: Xie, Yifan, et al.
Pubblicazione: (2024) -
From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection
di: Liu, Ke, et al.
Pubblicazione: (2026) -
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
di: Araujo, Edson, et al.
Pubblicazione: (2025)