Emotional Face-to-Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Ye, Jiaxin, Cao, Boyuan, Shan, Hongming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Shushing! Let's Imagine an Authentic Speech from the Silent Video
di: Ye, Jiaxin, et al.
Pubblicazione: (2025)
di: Ye, Jiaxin, et al.
Pubblicazione: (2025)
EmoTalker: Emotionally Editable Talking Face Generation via Diffusion Model
di: Zhang, Bingyuan, et al.
Pubblicazione: (2024)
di: Zhang, Bingyuan, et al.
Pubblicazione: (2024)
Emotional Vietnamese Speech-Based Depression Diagnosis Using Dynamic Attention Mechanism
di: D., Quang-Anh N., et al.
Pubblicazione: (2024)
di: D., Quang-Anh N., et al.
Pubblicazione: (2024)
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
di: Wang, Jinting, et al.
Pubblicazione: (2025)
di: Wang, Jinting, et al.
Pubblicazione: (2025)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
di: Kang, Fang, et al.
Pubblicazione: (2025)
di: Kang, Fang, et al.
Pubblicazione: (2025)
ESARM: 3D Emotional Speech-to-Animation via Reward Model from Automatically-Ranked Demonstrations
di: Zhang, Xulong, et al.
Pubblicazione: (2024)
di: Zhang, Xulong, et al.
Pubblicazione: (2024)
Hear Your Face: Face-based voice conversion with F0 estimation
di: Lee, Jaejun, et al.
Pubblicazione: (2024)
di: Lee, Jaejun, et al.
Pubblicazione: (2024)
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
di: Fu, Chaoyou, et al.
Pubblicazione: (2025)
di: Fu, Chaoyou, et al.
Pubblicazione: (2025)
A Low-rank Matching Attention based Cross-modal Feature Fusion Method for Conversational Emotion Recognition
di: Shou, Yuntao, et al.
Pubblicazione: (2023)
di: Shou, Yuntao, et al.
Pubblicazione: (2023)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
di: Choi, Jeongsoo, et al.
Pubblicazione: (2024)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2024)
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
di: Kim, Minsu, et al.
Pubblicazione: (2024)
di: Kim, Minsu, et al.
Pubblicazione: (2024)
Face-voice Association in Multilingual Environments (FAME) Challenge 2024 Evaluation Plan
di: Saeed, Muhammad Saad, et al.
Pubblicazione: (2024)
di: Saeed, Muhammad Saad, et al.
Pubblicazione: (2024)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
Enhancing CTC-Based Visual Speech Recognition
di: Laux, Hendrik, et al.
Pubblicazione: (2024)
di: Laux, Hendrik, et al.
Pubblicazione: (2024)
Multimodal Emotion Recognition and Sentiment Analysis in Multi-Party Conversation Contexts
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
Input Conditioned Layer Dropping in Speech Foundation Models
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
Decoding Emotions: Unveiling Facial Expressions through Acoustic Sensing with Contrastive Attention
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
Spiking Structured State Space Model for Monaural Speech Enhancement
di: Du, Yu, et al.
Pubblicazione: (2023)
di: Du, Yu, et al.
Pubblicazione: (2023)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2025)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge
di: Liu, Zehua, et al.
Pubblicazione: (2025)
di: Liu, Zehua, et al.
Pubblicazione: (2025)
From Detection to Correction: Backdoor-Resilient Face Recognition via Vision-Language Trigger Detection and Noise-Based Neutralization
di: Wahida, Farah, et al.
Pubblicazione: (2025)
di: Wahida, Farah, et al.
Pubblicazione: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
di: Anand, et al.
Pubblicazione: (2025)
di: Anand, et al.
Pubblicazione: (2025)
Computation and Parameter Efficient Multi-Modal Fusion Transformer for Cued Speech Recognition
di: Liu, Lei, et al.
Pubblicazione: (2024)
di: Liu, Lei, et al.
Pubblicazione: (2024)
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
di: Park, Young-Hu, et al.
Pubblicazione: (2025)
di: Park, Young-Hu, et al.
Pubblicazione: (2025)
RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025)
di: Pham, Long-Khanh, et al.
Pubblicazione: (2025)
RTFS-Net: Recurrent Time-Frequency Modelling for Efficient Audio-Visual Speech Separation
di: Pegg, Samuel, et al.
Pubblicazione: (2023)
di: Pegg, Samuel, et al.
Pubblicazione: (2023)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)
VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
di: Liu, Zehua, et al.
Pubblicazione: (2025)
di: Liu, Zehua, et al.
Pubblicazione: (2025)
Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2026)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2026)
United we stand, Divided we fall: Handling Weak Complementary Relationships for Audio-Visual Emotion Recognition in Valence-Arousal Space
di: Praveen, R. Gnana, et al.
Pubblicazione: (2025)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2025)
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
di: Liang, Yifan, et al.
Pubblicazione: (2025)
di: Liang, Yifan, et al.
Pubblicazione: (2025)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Shushing! Let's Imagine an Authentic Speech from the Silent Video
di: Ye, Jiaxin, et al.
Pubblicazione: (2025) -
EmoTalker: Emotionally Editable Talking Face Generation via Diffusion Model
di: Zhang, Bingyuan, et al.
Pubblicazione: (2024) -
Emotional Vietnamese Speech-Based Depression Diagnosis Using Dynamic Attention Mechanism
di: D., Quang-Anh N., et al.
Pubblicazione: (2024) -
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
di: Wang, Jinting, et al.
Pubblicazione: (2025) -
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
di: Kang, Fang, et al.
Pubblicazione: (2025)