Laugh Now Cry Later: Controlling Time-Varying Emotional States of Flow-Matching-Based Zero-Shot Text-to-Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Haibin, Wang, Xiaofei, Eskimez, Sefik Emre, Thakker, Manthan, Tompkins, Daniel, Tsai, Chung-Hsien, Li, Canrun, Xiao, Zhen, Zhao, Sheng, Li, Jinyu, Kanda, Naoyuki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like
di: Kanda, Naoyuki, et al.
Pubblicazione: (2024)
di: Kanda, Naoyuki, et al.
Pubblicazione: (2024)
TS3-Codec: Transformer-Based Simple Streaming Single Codec
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
Total-Duration-Aware Duration Modeling for Text-to-Speech Systems
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS
di: Wang, Xiaofei, et al.
Pubblicazione: (2024)
di: Wang, Xiaofei, et al.
Pubblicazione: (2024)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
di: Wang, Xiaofei, et al.
Pubblicazione: (2023)
di: Wang, Xiaofei, et al.
Pubblicazione: (2023)
CoVoMix2: Advancing Zero-Shot Dialogue Generation with Fully Non-Autoregressive Flow Matching
di: Zhang, Leying, et al.
Pubblicazione: (2025)
di: Zhang, Leying, et al.
Pubblicazione: (2025)
Neural Speech Extraction with Human Feedback
di: Itani, Malek, et al.
Pubblicazione: (2025)
di: Itani, Malek, et al.
Pubblicazione: (2025)
Knowledge boosting during low-latency inference
di: Srinivas, Vidya, et al.
Pubblicazione: (2024)
di: Srinivas, Vidya, et al.
Pubblicazione: (2024)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
di: Subramanian, Aswin Shanmugam, et al.
Pubblicazione: (2025)
di: Subramanian, Aswin Shanmugam, et al.
Pubblicazione: (2025)
Target conversation extraction: Source separation using turn-taking dynamics
di: Chen, Tuochao, et al.
Pubblicazione: (2024)
di: Chen, Tuochao, et al.
Pubblicazione: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
DiariST: Streaming Speech Translation with Speaker Diarization
di: Yang, Mu, et al.
Pubblicazione: (2023)
di: Yang, Mu, et al.
Pubblicazione: (2023)
SLM-S2ST: A multimodal language model for direct speech-to-speech translation
di: Hu, Yuxuan, et al.
Pubblicazione: (2025)
di: Hu, Yuxuan, et al.
Pubblicazione: (2025)
Long-term usage of the off-grid photovoltaic system with lithium-ion battery-based energy storage system on high mountains: A case study in Payiun Lodge on Mt. Jade in Taiwan
di: Chung, Hsien-Ching
Pubblicazione: (2024)
di: Chung, Hsien-Ching
Pubblicazione: (2024)
Infant Cry Emotion Recognition Using Improved ECAPA-TDNN with Multiscale Feature Fusion and Attention Enhancement
di: Zhou, Junyu, et al.
Pubblicazione: (2025)
di: Zhou, Junyu, et al.
Pubblicazione: (2025)
Streaming Speaker Change Detection and Gender Classification for Transducer-Based Multi-Talker Speech Translation
di: Wang, Peidong, et al.
Pubblicazione: (2025)
di: Wang, Peidong, et al.
Pubblicazione: (2025)
Summary of the NOTSOFAR-1 Challenge: Highlights and Learnings
di: Abramovski, Igor, et al.
Pubblicazione: (2025)
di: Abramovski, Igor, et al.
Pubblicazione: (2025)
Enhancing Infant Crying Detection with Gradient Boosting for Improved Emotional and Mental Health Diagnostics
di: Lee, Kyunghun, et al.
Pubblicazione: (2024)
di: Lee, Kyunghun, et al.
Pubblicazione: (2024)
Rec-RIR: Monaural Blind Room Impulse Response Identification via DNN-based Reverberant Speech Reconstruction in STFT Domain
di: Wang, Pengyu, et al.
Pubblicazione: (2025)
di: Wang, Pengyu, et al.
Pubblicazione: (2025)
Profile-Error-Tolerant Target-Speaker Voice Activity Detection
di: Wang, Dongmei, et al.
Pubblicazione: (2023)
di: Wang, Dongmei, et al.
Pubblicazione: (2023)
Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio
di: Shi, Mohan, et al.
Pubblicazione: (2025)
di: Shi, Mohan, et al.
Pubblicazione: (2025)
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
di: Chou, Huang-Cheng, et al.
Pubblicazione: (2024)
di: Chou, Huang-Cheng, et al.
Pubblicazione: (2024)
Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech Enhancement
di: Yang, Yujie, et al.
Pubblicazione: (2025)
di: Yang, Yujie, et al.
Pubblicazione: (2025)
AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
di: Wu, Haibin, et al.
Pubblicazione: (2025)
di: Wu, Haibin, et al.
Pubblicazione: (2025)
Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
di: Yang, Yifan, et al.
Pubblicazione: (2025)
di: Yang, Yifan, et al.
Pubblicazione: (2025)
Time-Layer Adaptive Alignment for Speaker Similarity in Flow-Matching Based Zero-Shot TTS
di: Li, Haoyu, et al.
Pubblicazione: (2025)
di: Li, Haoyu, et al.
Pubblicazione: (2025)
FullSubNet: A Full-Band and Sub-Band Fusion Model for Real-Time Single-Channel Speech Enhancement
di: Hao, Xiang, et al.
Pubblicazione: (2020)
di: Hao, Xiang, et al.
Pubblicazione: (2020)
T-Mimi: A Transformer-based Mimi Decoder for Real-Time On-Phone TTS
di: Wu, Haibin, et al.
Pubblicazione: (2026)
di: Wu, Haibin, et al.
Pubblicazione: (2026)
CryCeleb: A Speaker Verification Dataset Based on Infant Cry Sounds
di: Budaghyan, David, et al.
Pubblicazione: (2023)
di: Budaghyan, David, et al.
Pubblicazione: (2023)
Conversational Speech Naturalness Predictor
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
ICSD: An Open-source Dataset for Infant Cry and Snoring Detection
di: Liu, Qingyu, et al.
Pubblicazione: (2024)
di: Liu, Qingyu, et al.
Pubblicazione: (2024)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
di: Choi, Ha-Yeong, et al.
Pubblicazione: (2025)
di: Choi, Ha-Yeong, et al.
Pubblicazione: (2025)
Emo-bias: A Large Scale Evaluation of Social Bias on Speech Emotion Recognition
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
di: Qi, Tianhua, et al.
Pubblicazione: (2026)
di: Qi, Tianhua, et al.
Pubblicazione: (2026)
LS-EEND: Long-Form Streaming End-to-End Neural Diarization with Online Attractor Extraction
di: Liang, Di, et al.
Pubblicazione: (2024)
di: Liang, Di, et al.
Pubblicazione: (2024)
Self-Supervised Learning of Spatial Acoustic Representation with Cross-Channel Signal Reconstruction and Multi-Channel Conformer
di: Yang, Bing, et al.
Pubblicazione: (2023)
di: Yang, Bing, et al.
Pubblicazione: (2023)
Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like
di: Kanda, Naoyuki, et al.
Pubblicazione: (2024) -
TS3-Codec: Transformer-Based Simple Streaming Single Codec
di: Wu, Haibin, et al.
Pubblicazione: (2024) -
Total-Duration-Aware Duration Modeling for Text-to-Speech Systems
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024) -
An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS
di: Wang, Xiaofei, et al.
Pubblicazione: (2024) -
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)