Shushing! Let's Imagine an Authentic Speech from the Silent Video
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ye, Jiaxin, Shan, Hongming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Emotional Face-to-Speech
par: Ye, Jiaxin, et autres
Publié: (2025)
par: Ye, Jiaxin, et autres
Publié: (2025)
RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling
par: Pham, Long-Khanh, et autres
Publié: (2025)
par: Pham, Long-Khanh, et autres
Publié: (2025)
Synthesizing Audio from Silent Video using Sequence to Sequence Modeling
par: Belinchon, Hugo Garrido-Lestache, et autres
Publié: (2024)
par: Belinchon, Hugo Garrido-Lestache, et autres
Publié: (2024)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
par: Kim, Ji-Hoon, et autres
Publié: (2025)
par: Kim, Ji-Hoon, et autres
Publié: (2025)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
par: Kim, Ji-Hoon, et autres
Publié: (2023)
par: Kim, Ji-Hoon, et autres
Publié: (2023)
FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
par: Wang, Jinting, et autres
Publié: (2025)
par: Wang, Jinting, et autres
Publié: (2025)
ICASSP 2024 Speech Signal Improvement Challenge
par: Ristea, Nicolae Catalin, et autres
Publié: (2024)
par: Ristea, Nicolae Catalin, et autres
Publié: (2024)
See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement
par: Wang, Jinting, et autres
Publié: (2025)
par: Wang, Jinting, et autres
Publié: (2025)
Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios
par: Cheng, Yongkang, et autres
Publié: (2024)
par: Cheng, Yongkang, et autres
Publié: (2024)
Automated Classification of Phonetic Segments in Child Speech Using Raw Ultrasound Imaging
par: Ani, Saja Al, et autres
Publié: (2024)
par: Ani, Saja Al, et autres
Publié: (2024)
CleanUMamba: A Compact Mamba Network for Speech Denoising using Channel Pruning
par: Groot, Sjoerd, et autres
Publié: (2024)
par: Groot, Sjoerd, et autres
Publié: (2024)
Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos
par: Chen, Changan, et autres
Publié: (2024)
par: Chen, Changan, et autres
Publié: (2024)
Learning Separable Hidden Unit Contributions for Speaker-Adaptive Lip-Reading
par: Luo, Songtao, et autres
Publié: (2023)
par: Luo, Songtao, et autres
Publié: (2023)
Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion
par: Rong, Yan, et autres
Publié: (2024)
par: Rong, Yan, et autres
Publié: (2024)
Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity
par: Pascual, Santiago, et autres
Publié: (2024)
par: Pascual, Santiago, et autres
Publié: (2024)
VSSFlow: Unifying Video-conditioned Sound and Speech Generation via Joint Learning
par: Cheng, Xin, et autres
Publié: (2025)
par: Cheng, Xin, et autres
Publié: (2025)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
par: Rai, Aashish, et autres
Publié: (2024)
par: Rai, Aashish, et autres
Publié: (2024)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
GaussianSpeech: Audio-Driven Gaussian Avatars
par: Aneja, Shivangi, et autres
Publié: (2024)
par: Aneja, Shivangi, et autres
Publié: (2024)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
par: Choi, Jeongsoo, et autres
Publié: (2024)
par: Choi, Jeongsoo, et autres
Publié: (2024)
LenslessMic: Audio Encryption and Authentication via Lensless Computational Imaging
par: Grinberg, Petr, et autres
Publié: (2025)
par: Grinberg, Petr, et autres
Publié: (2025)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
par: Burchi, Maxime, et autres
Publié: (2024)
par: Burchi, Maxime, et autres
Publié: (2024)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
par: Qian, Xinyuan, et autres
Publié: (2024)
par: Qian, Xinyuan, et autres
Publié: (2024)
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
par: Li, Feng, et autres
Publié: (2024)
par: Li, Feng, et autres
Publié: (2024)
Multimodal Sentiment Analysis based on Video and Audio Inputs
par: Fernandez, Antonio, et autres
Publié: (2024)
par: Fernandez, Antonio, et autres
Publié: (2024)
DiffSHEG: A Diffusion-Based Approach for Real-Time Speech-driven Holistic 3D Expression and Gesture Generation
par: Chen, Junming, et autres
Publié: (2024)
par: Chen, Junming, et autres
Publié: (2024)
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
par: Liang, Yingshan, et autres
Publié: (2025)
par: Liang, Yingshan, et autres
Publié: (2025)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
par: Wang, Xuanchen, et autres
Publié: (2024)
par: Wang, Xuanchen, et autres
Publié: (2024)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
par: Choi, Hahyeon, et autres
Publié: (2025)
par: Choi, Hahyeon, et autres
Publié: (2025)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
par: Zhao, Lei, et autres
Publié: (2025)
par: Zhao, Lei, et autres
Publié: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
par: Joo, Seohyun, et autres
Publié: (2026)
par: Joo, Seohyun, et autres
Publié: (2026)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
par: Qiang, Chunyu, et autres
Publié: (2026)
par: Qiang, Chunyu, et autres
Publié: (2026)
Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping
par: Kang, Minki, et autres
Publié: (2023)
par: Kang, Minki, et autres
Publié: (2023)
CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation
par: Lee, Gyubin, et autres
Publié: (2026)
par: Lee, Gyubin, et autres
Publié: (2026)
Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
Bayesian Example Selection Improves In-Context Learning for Speech, Text, and Visual Modalities
par: Wang, Siyin, et autres
Publié: (2024)
par: Wang, Siyin, et autres
Publié: (2024)
Faces that Speak: Jointly Synthesising Talking Face and Speech from Text
par: Jang, Youngjoon, et autres
Publié: (2024)
par: Jang, Youngjoon, et autres
Publié: (2024)
Documents similaires
-
Emotional Face-to-Speech
par: Ye, Jiaxin, et autres
Publié: (2025) -
RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling
par: Pham, Long-Khanh, et autres
Publié: (2025) -
Synthesizing Audio from Silent Video using Sequence to Sequence Modeling
par: Belinchon, Hugo Garrido-Lestache, et autres
Publié: (2024) -
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
par: Kim, Ji-Hoon, et autres
Publié: (2025) -
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
par: Kim, Ji-Hoon, et autres
Publié: (2023)