Shushing! Let's Imagine an Authentic Speech from the Silent Video
Fuente:
arXiv
Salvato in:
| Autori principali: | Ye, Jiaxin, Shan, Hongming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Emotional Face-to-Speech
di: Ye, Jiaxin, et al.
Pubblicazione: (2025)
di: Ye, Jiaxin, et al.
Pubblicazione: (2025)
RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025)
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025)
Synthesizing Audio from Silent Video using Sequence to Sequence Modeling
di: Belinchon, Hugo Garrido-Lestache, et al.
Pubblicazione: (2024)
di: Belinchon, Hugo Garrido-Lestache, et al.
Pubblicazione: (2024)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2025)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2025)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2023)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2023)
FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
di: Wang, Jinting, et al.
Pubblicazione: (2025)
di: Wang, Jinting, et al.
Pubblicazione: (2025)
ICASSP 2024 Speech Signal Improvement Challenge
di: Ristea, Nicolae Catalin, et al.
Pubblicazione: (2024)
di: Ristea, Nicolae Catalin, et al.
Pubblicazione: (2024)
See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement
di: Wang, Jinting, et al.
Pubblicazione: (2025)
di: Wang, Jinting, et al.
Pubblicazione: (2025)
Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios
di: Cheng, Yongkang, et al.
Pubblicazione: (2024)
di: Cheng, Yongkang, et al.
Pubblicazione: (2024)
Automated Classification of Phonetic Segments in Child Speech Using Raw Ultrasound Imaging
di: Ani, Saja Al, et al.
Pubblicazione: (2024)
di: Ani, Saja Al, et al.
Pubblicazione: (2024)
CleanUMamba: A Compact Mamba Network for Speech Denoising using Channel Pruning
di: Groot, Sjoerd, et al.
Pubblicazione: (2024)
di: Groot, Sjoerd, et al.
Pubblicazione: (2024)
Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos
di: Chen, Changan, et al.
Pubblicazione: (2024)
di: Chen, Changan, et al.
Pubblicazione: (2024)
Learning Separable Hidden Unit Contributions for Speaker-Adaptive Lip-Reading
di: Luo, Songtao, et al.
Pubblicazione: (2023)
di: Luo, Songtao, et al.
Pubblicazione: (2023)
Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion
di: Rong, Yan, et al.
Pubblicazione: (2024)
di: Rong, Yan, et al.
Pubblicazione: (2024)
Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity
di: Pascual, Santiago, et al.
Pubblicazione: (2024)
di: Pascual, Santiago, et al.
Pubblicazione: (2024)
VSSFlow: Unifying Video-conditioned Sound and Speech Generation via Joint Learning
di: Cheng, Xin, et al.
Pubblicazione: (2025)
di: Cheng, Xin, et al.
Pubblicazione: (2025)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
di: Rai, Aashish, et al.
Pubblicazione: (2024)
di: Rai, Aashish, et al.
Pubblicazione: (2024)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
di: Liu, Kai, et al.
Pubblicazione: (2025)
di: Liu, Kai, et al.
Pubblicazione: (2025)
LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
GaussianSpeech: Audio-Driven Gaussian Avatars
di: Aneja, Shivangi, et al.
Pubblicazione: (2024)
di: Aneja, Shivangi, et al.
Pubblicazione: (2024)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
di: Choi, Jeongsoo, et al.
Pubblicazione: (2024)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2024)
LenslessMic: Audio Encryption and Authentication via Lensless Computational Imaging
di: Grinberg, Petr, et al.
Pubblicazione: (2025)
di: Grinberg, Petr, et al.
Pubblicazione: (2025)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
di: Burchi, Maxime, et al.
Pubblicazione: (2024)
di: Burchi, Maxime, et al.
Pubblicazione: (2024)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
di: Li, Feng, et al.
Pubblicazione: (2024)
di: Li, Feng, et al.
Pubblicazione: (2024)
Multimodal Sentiment Analysis based on Video and Audio Inputs
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
DiffSHEG: A Diffusion-Based Approach for Real-Time Speech-driven Holistic 3D Expression and Gesture Generation
di: Chen, Junming, et al.
Pubblicazione: (2024)
di: Chen, Junming, et al.
Pubblicazione: (2024)
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
di: Wang, Xuanchen, et al.
Pubblicazione: (2024)
di: Wang, Xuanchen, et al.
Pubblicazione: (2024)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping
di: Kang, Minki, et al.
Pubblicazione: (2023)
di: Kang, Minki, et al.
Pubblicazione: (2023)
CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation
di: Lee, Gyubin, et al.
Pubblicazione: (2026)
di: Lee, Gyubin, et al.
Pubblicazione: (2026)
Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model
di: Zhang, Shaolei, et al.
Pubblicazione: (2025)
di: Zhang, Shaolei, et al.
Pubblicazione: (2025)
Bayesian Example Selection Improves In-Context Learning for Speech, Text, and Visual Modalities
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
Faces that Speak: Jointly Synthesising Talking Face and Speech from Text
di: Jang, Youngjoon, et al.
Pubblicazione: (2024)
di: Jang, Youngjoon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Emotional Face-to-Speech
di: Ye, Jiaxin, et al.
Pubblicazione: (2025) -
RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025) -
Synthesizing Audio from Silent Video using Sequence to Sequence Modeling
di: Belinchon, Hugo Garrido-Lestache, et al.
Pubblicazione: (2024) -
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2025) -
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2023)