Joint Multi-scale Cross-lingual Speaking Style Transfer with Bidirectional Attention Mechanism for Automatic Dubbing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jingbei, Li, Sipan, Chen, Ping, Zhang, Luwen, Meng, Yi, Wu, Zhiyong, Meng, Helen, Tian, Qiao, Wang, Yuping, Wang, Yuxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Zero-shot Cross-lingual Voice Transfer for TTS
par: Biadsy, Fadi, et autres
Publié: (2024)
par: Biadsy, Fadi, et autres
Publié: (2024)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
par: Sha, Binzhu, et autres
Publié: (2023)
par: Sha, Binzhu, et autres
Publié: (2023)
StyleFusion TTS: Multimodal Style-control and Enhanced Feature Fusion for Zero-shot Text-to-speech Synthesis
par: Chen, Zhiyong, et autres
Publié: (2024)
par: Chen, Zhiyong, et autres
Publié: (2024)
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
par: Guo, Haohan, et autres
Publié: (2024)
par: Guo, Haohan, et autres
Publié: (2024)
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
par: Sahipjohn, Neha, et autres
Publié: (2024)
par: Sahipjohn, Neha, et autres
Publié: (2024)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024)
par: Chen, Xueyuan, et autres
Publié: (2024)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
par: Huang, Qiaochu, et autres
Publié: (2024)
par: Huang, Qiaochu, et autres
Publié: (2024)
Serial-Parallel Dual-Path Architecture for Speaking Style Recognition
par: Li, Guojian, et autres
Publié: (2025)
par: Li, Guojian, et autres
Publié: (2025)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
par: Tian, Wenjie, et autres
Publié: (2025)
par: Tian, Wenjie, et autres
Publié: (2025)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024)
par: Li, Guinan, et autres
Publié: (2024)
UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
par: Wang, Yuanyuan, et autres
Publié: (2026)
par: Wang, Yuanyuan, et autres
Publié: (2026)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
par: Li, Fengjin, et autres
Publié: (2025)
par: Li, Fengjin, et autres
Publié: (2025)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
par: Guan, Wenhao, et autres
Publié: (2023)
par: Guan, Wenhao, et autres
Publié: (2023)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
par: Wei, Linye, et autres
Publié: (2025)
par: Wei, Linye, et autres
Publié: (2025)
JIS: A Speech Corpus of Japanese Idol Speakers with Various Speaking Styles
par: Kondo, Yuto, et autres
Publié: (2025)
par: Kondo, Yuto, et autres
Publié: (2025)
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
par: Sun, Haoqin, et autres
Publié: (2025)
par: Sun, Haoqin, et autres
Publié: (2025)
UniSep: Universal Target Audio Separation with Language Models at Scale
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
Music Style Transfer with Time-Varying Inversion of Diffusion Models
par: Li, Sifei, et autres
Publié: (2024)
par: Li, Sifei, et autres
Publié: (2024)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
Automatic Melody Reduction via Shortest Path Finding
par: Wang, Ziyu, et autres
Publié: (2025)
par: Wang, Ziyu, et autres
Publié: (2025)
Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models
par: Li, Weiqin, et autres
Publié: (2024)
par: Li, Weiqin, et autres
Publié: (2024)
Factor-Conditioned Speaking-Style Captioning
par: Ando, Atsushi, et autres
Publié: (2024)
par: Ando, Atsushi, et autres
Publié: (2024)
Music2Fail: Transfer Music to Failed Recorder Style
par: Leong, Chon In, et autres
Publié: (2024)
par: Leong, Chon In, et autres
Publié: (2024)
DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation
par: Meng, Ming, et autres
Publié: (2025)
par: Meng, Ming, et autres
Publié: (2025)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
ConPCO: Preserving Phoneme Characteristics for Automatic Pronunciation Assessment Leveraging Contrastive Ordinal Regularization
par: Yan, Bi-Cheng, et autres
Publié: (2024)
par: Yan, Bi-Cheng, et autres
Publié: (2024)
Diff-MST: Differentiable Mixing Style Transfer
par: Vanka, Soumya Sai, et autres
Publié: (2024)
par: Vanka, Soumya Sai, et autres
Publié: (2024)
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
par: Cong, Gaoxiang, et autres
Publié: (2024)
par: Cong, Gaoxiang, et autres
Publié: (2024)
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
par: Wu, Wenxuan, et autres
Publié: (2024)
par: Wu, Wenxuan, et autres
Publié: (2024)
DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
par: Chen, Xueyuan, et autres
Publié: (2025)
par: Chen, Xueyuan, et autres
Publié: (2025)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
par: Jiang, Yuepeng, et autres
Publié: (2024)
par: Jiang, Yuepeng, et autres
Publié: (2024)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
par: wu, Weihao, et autres
Publié: (2025)
par: wu, Weihao, et autres
Publié: (2025)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2023)
par: Wang, Zhichao, et autres
Publié: (2023)
Diff-MSTC: A Mixing Style Transfer Prototype for Cubase
par: Vanka, Soumya Sai, et autres
Publié: (2024)
par: Vanka, Soumya Sai, et autres
Publié: (2024)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
par: Dutta, Soumya, et autres
Publié: (2025)
par: Dutta, Soumya, et autres
Publié: (2025)
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
par: Li, Haowen, et autres
Publié: (2026)
par: Li, Haowen, et autres
Publié: (2026)
learning discriminative features from spectrograms using center loss for speech emotion recognition
par: Dai, Dongyang, et autres
Publié: (2025)
par: Dai, Dongyang, et autres
Publié: (2025)
A New Perspective on Speaker Verification: Joint Modeling with DFSMN and Transformer
par: Wang, Hongyu, et autres
Publié: (2023)
par: Wang, Hongyu, et autres
Publié: (2023)
The ICASSP 2026 Automatic Song Aesthetics Evaluation Challenge
par: Ma, Guobin, et autres
Publié: (2026)
par: Ma, Guobin, et autres
Publié: (2026)
Documents similaires
-
Zero-shot Cross-lingual Voice Transfer for TTS
par: Biadsy, Fadi, et autres
Publié: (2024) -
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
par: Sha, Binzhu, et autres
Publié: (2023) -
StyleFusion TTS: Multimodal Style-control and Enhanced Feature Fusion for Zero-shot Text-to-speech Synthesis
par: Chen, Zhiyong, et autres
Publié: (2024) -
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
par: Guo, Haohan, et autres
Publié: (2024) -
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
par: Sahipjohn, Neha, et autres
Publié: (2024)