Perturbation Self-Supervised Representations for Cross-Lingual Emotion TTS: Stage-Wise Modeling of Emotion and Speaker
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gong, Cheng, Qiang, Chunyu, Wang, Tianrui, Jiang, Yu, Lu, Yuheng, Jing, Ruihao, Miao, Xiaoxiao, Zhang, Xiaolei, Wang, Longbiao, Dang, Jianwu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
par: Wang, Haoyu, et autres
Publié: (2024)
par: Wang, Haoyu, et autres
Publié: (2024)
Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning
par: Wang, Tianrui, et autres
Publié: (2025)
par: Wang, Tianrui, et autres
Publié: (2025)
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
par: Gong, Cheng, et autres
Publié: (2023)
par: Gong, Cheng, et autres
Publié: (2023)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
par: Wang, Tianrui, et autres
Publié: (2025)
par: Wang, Tianrui, et autres
Publié: (2025)
POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
par: Li, Xuanchen, et autres
Publié: (2025)
par: Li, Xuanchen, et autres
Publié: (2025)
DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
MSR-HuBERT: Self-supervised Pre-training for Adaptation to Multiple Sampling Rates
par: Huang, Zikang, et autres
Publié: (2026)
par: Huang, Zikang, et autres
Publié: (2026)
Enriching Multimodal Sentiment Analysis through Textual Emotional Descriptions of Visual-Audio Content
par: Wu, Sheng, et autres
Publié: (2024)
par: Wu, Sheng, et autres
Publié: (2024)
Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought
par: Li, Xuanchen, et autres
Publié: (2026)
par: Li, Xuanchen, et autres
Publié: (2026)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement
par: Wang, Junyu, et autres
Publié: (2024)
par: Wang, Junyu, et autres
Publié: (2024)
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
par: Zhao, Ya, et autres
Publié: (2026)
par: Zhao, Ya, et autres
Publié: (2026)
VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing
par: Qiang, Chunyu, et autres
Publié: (2024)
par: Qiang, Chunyu, et autres
Publié: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
par: Qiang, Chunyu, et autres
Publié: (2025)
par: Qiang, Chunyu, et autres
Publié: (2025)
InstructAudio: Unified speech and music generation with natural language instruction
par: Qiang, Chunyu, et autres
Publié: (2025)
par: Qiang, Chunyu, et autres
Publié: (2025)
Adapting General Disentanglement-Based Speaker Anonymization for Enhanced Emotion Preservation
par: Miao, Xiaoxiao, et autres
Publié: (2024)
par: Miao, Xiaoxiao, et autres
Publié: (2024)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
par: Tang, Haobin, et autres
Publié: (2024)
par: Tang, Haobin, et autres
Publié: (2024)
Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
par: Cui, Zhongjian, et autres
Publié: (2025)
par: Cui, Zhongjian, et autres
Publié: (2025)
Emotion-Aware Quantization for Discrete Speech Representations: An Analysis of Emotion Preservation
par: Zhou, Haoguang, et autres
Publié: (2026)
par: Zhou, Haoguang, et autres
Publié: (2026)
Progressive Residual Extraction based Pre-training for Speech Representation Learning
par: Wang, Tianrui, et autres
Publié: (2024)
par: Wang, Tianrui, et autres
Publié: (2024)
Learning Emotion-Invariant Speaker Representations for Speaker Verification
par: Tian, Jingguang, et autres
Publié: (2025)
par: Tian, Jingguang, et autres
Publié: (2025)
Cross-Lingual Speech Emotion Recognition: Humans vs. Self-Supervised Models
par: Han, Zhichen, et autres
Publié: (2024)
par: Han, Zhichen, et autres
Publié: (2024)
Speaker-agnostic Emotion Vector for Cross-speaker Emotion Intensity Control
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
CoCoEmo: Composable and Controllable Human-Like Emotional TTS via Activation Steering
par: Wang, Siyi, et autres
Publié: (2026)
par: Wang, Siyi, et autres
Publié: (2026)
EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS
par: Li, Haoxun, et autres
Publié: (2025)
par: Li, Haoxun, et autres
Publié: (2025)
UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
par: Qiang, Chunyu, et autres
Publié: (2026)
par: Qiang, Chunyu, et autres
Publié: (2026)
PFluxTTS: Hybrid Flow-Matching TTS with Robust Cross-Lingual Voice Cloning and Inference-Time Model Fusion
par: Pankov, Vikentii, et autres
Publié: (2026)
par: Pankov, Vikentii, et autres
Publié: (2026)
Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis
par: Liu, Qingyu, et autres
Publié: (2025)
par: Liu, Qingyu, et autres
Publié: (2025)
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition
par: Shu, Yuchun, et autres
Publié: (2024)
par: Shu, Yuchun, et autres
Publié: (2024)
Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis
par: Feng, Pengchao, et autres
Publié: (2025)
par: Feng, Pengchao, et autres
Publié: (2025)
TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis
par: Liang, Qifan, et autres
Publié: (2026)
par: Liang, Qifan, et autres
Publié: (2026)
Layer-Wise Analysis of Self-Supervised Acoustic Word Embeddings: A Study on Speech Emotion Recognition
par: Saliba, Alexandra, et autres
Publié: (2024)
par: Saliba, Alexandra, et autres
Publié: (2024)
Speech Emotion Recognition via Entropy-Aware Score Selection
par: Chua, ChenYi, et autres
Publié: (2025)
par: Chua, ChenYi, et autres
Publié: (2025)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
par: Chen, Yafeng, et autres
Publié: (2024)
par: Chen, Yafeng, et autres
Publié: (2024)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
par: Chen, Yafeng, et autres
Publié: (2023)
par: Chen, Yafeng, et autres
Publié: (2023)
Documents similaires
-
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
par: Wang, Haoyu, et autres
Publié: (2024) -
Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning
par: Wang, Tianrui, et autres
Publié: (2025) -
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
par: Wang, Junyu, et autres
Publié: (2025) -
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
par: Gong, Cheng, et autres
Publié: (2023) -
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
par: Wang, Tianrui, et autres
Publié: (2025)