MuteSwap: Visual-informed Silent Video Identity Conversion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yifan, Fang, Yu, Lin, Zhouhan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And Intelligibility
par: Liu, Yifan, et autres
Publié: (2025)
par: Liu, Yifan, et autres
Publié: (2025)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
par: Rai, Aashish, et autres
Publié: (2024)
par: Rai, Aashish, et autres
Publié: (2024)
V2Meow: Meowing to the Visual Beat via Video-to-Music Generation
par: Su, Kun, et autres
Publié: (2023)
par: Su, Kun, et autres
Publié: (2023)
A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech Recognition
par: Dai, Yusheng, et autres
Publié: (2024)
par: Dai, Yusheng, et autres
Publié: (2024)
AMuSE: Adaptive Multimodal Analysis for Speaker Emotion Recognition in Group Conversations
par: Devulapally, Naresh Kumar, et autres
Publié: (2024)
par: Devulapally, Naresh Kumar, et autres
Publié: (2024)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
par: Lin, Yan-Bo, et autres
Publié: (2025)
par: Lin, Yan-Bo, et autres
Publié: (2025)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
par: Fang, Pengjun, et autres
Publié: (2026)
par: Fang, Pengjun, et autres
Publié: (2026)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
par: Cao, Yuqin, et autres
Publié: (2025)
par: Cao, Yuqin, et autres
Publié: (2025)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
par: Wang, Yaoting, et autres
Publié: (2023)
par: Wang, Yaoting, et autres
Publié: (2023)
From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation
par: Su, Kun, et autres
Publié: (2024)
par: Su, Kun, et autres
Publié: (2024)
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
par: Yang, Shiqi, et autres
Publié: (2024)
par: Yang, Shiqi, et autres
Publié: (2024)
Audio-Visual Instance Segmentation
par: Guo, Ruohao, et autres
Publié: (2023)
par: Guo, Ruohao, et autres
Publié: (2023)
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
par: Lee, Junwon, et autres
Publié: (2024)
par: Lee, Junwon, et autres
Publié: (2024)
Continual Audio-Visual Sound Separation
par: Pian, Weiguo, et autres
Publié: (2024)
par: Pian, Weiguo, et autres
Publié: (2024)
Sequential Contrastive Audio-Visual Learning
par: Tsiamas, Ioannis, et autres
Publié: (2024)
par: Tsiamas, Ioannis, et autres
Publié: (2024)
Self-Supervised Audio-Visual Soundscape Stylization
par: Li, Tingle, et autres
Publié: (2024)
par: Li, Tingle, et autres
Publié: (2024)
FilmComposer: LLM-Driven Music Production for Silent Film Clips
par: Xie, Zhifeng, et autres
Publié: (2025)
par: Xie, Zhifeng, et autres
Publié: (2025)
Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation
par: Li, Kexin, et autres
Publié: (2024)
par: Li, Kexin, et autres
Publié: (2024)
Multi-scale Multi-instance Visual Sound Localization and Segmentation
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling
par: Yang, Ruihan, et autres
Publié: (2023)
par: Yang, Ruihan, et autres
Publié: (2023)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
par: Lee, Junwon, et autres
Publié: (2025)
par: Lee, Junwon, et autres
Publié: (2025)
StereoSync: Spatially-Aware Stereo Audio Generation from Video
par: Marinoni, Christian, et autres
Publié: (2025)
par: Marinoni, Christian, et autres
Publié: (2025)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2025)
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2025)
Dual Mean-Teacher: An Unbiased Semi-Supervised Framework for Audio-Visual Source Localization
par: Guo, Yuxin, et autres
Publié: (2024)
par: Guo, Yuxin, et autres
Publié: (2024)
Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction
par: Mu, Zhaoxi, et autres
Publié: (2024)
par: Mu, Zhaoxi, et autres
Publié: (2024)
MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation
par: Hayakawa, Akio, et autres
Publié: (2024)
par: Hayakawa, Akio, et autres
Publié: (2024)
Getting More for Less: Using Weak Labels and AV-Mixup for Robust Audio-Visual Speaker Verification
par: Selvakumar, Anith, et autres
Publié: (2023)
par: Selvakumar, Anith, et autres
Publié: (2023)
AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection
par: Hashmi, Ammarah, et autres
Publié: (2023)
par: Hashmi, Ammarah, et autres
Publié: (2023)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
par: Oorloff, Trevine, et autres
Publié: (2024)
par: Oorloff, Trevine, et autres
Publié: (2024)
A Versatile Diffusion Transformer with Mixture of Noise Levels for Audiovisual Generation
par: Kim, Gwanghyun, et autres
Publié: (2024)
par: Kim, Gwanghyun, et autres
Publié: (2024)
Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning
par: Yu, RunLin, et autres
Publié: (2024)
par: Yu, RunLin, et autres
Publié: (2024)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
AudioX: A Unified Framework for Anything-to-Audio Generation
par: Tian, Zeyue, et autres
Publié: (2025)
par: Tian, Zeyue, et autres
Publié: (2025)
Video-to-Audio Generation with Hidden Alignment
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
par: Xu, Le, et autres
Publié: (2025)
par: Xu, Le, et autres
Publié: (2025)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
par: Chi, Xiaowei, et autres
Publié: (2024)
par: Chi, Xiaowei, et autres
Publié: (2024)
Documents similaires
-
DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And Intelligibility
par: Liu, Yifan, et autres
Publié: (2025) -
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
par: Rai, Aashish, et autres
Publié: (2024) -
V2Meow: Meowing to the Visual Beat via Video-to-Music Generation
par: Su, Kun, et autres
Publié: (2023) -
A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech Recognition
par: Dai, Yusheng, et autres
Publié: (2024) -
AMuSE: Adaptive Multimodal Analysis for Speaker Emotion Recognition in Group Conversations
par: Devulapally, Naresh Kumar, et autres
Publié: (2024)