TTSlow: Slow Down Text-to-Speech with Efficiency Robustness Evaluations
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Xiaoxue, Chen, Yiming, Yue, Xianghu, Tsao, Yu, Chen, Nancy F. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
Confidence-Based Self-Training for EMG-to-Speech: Leveraging Synthetic EMG for Robust Modeling
di: Chen, Xiaodan, et al.
Pubblicazione: (2025)
di: Chen, Xiaodan, et al.
Pubblicazione: (2025)
Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
MultiGen: Child-Friendly Multilingual Speech Generator with LLMs
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
Text-guided HuBERT: Self-Supervised Speech Pre-training via Generative Adversarial Networks
di: Ma, Duo, et al.
Pubblicazione: (2024)
di: Ma, Duo, et al.
Pubblicazione: (2024)
Unsupervised Face-Masked Speech Enhancement Using Generative Adversarial Networks With Human-in-the-Loop Assessment Metrics
di: Wang, Syu-Siang, et al.
Pubblicazione: (2024)
di: Wang, Syu-Siang, et al.
Pubblicazione: (2024)
Transferable Adversarial Attacks against ASR
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
A Study on Speech Assessment with Visual Cues
di: Ahmed, Shafique, et al.
Pubblicazione: (2025)
di: Ahmed, Shafique, et al.
Pubblicazione: (2025)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
Prompt-driven Target Speech Diarization
di: Jiang, Yidi, et al.
Pubblicazione: (2023)
di: Jiang, Yidi, et al.
Pubblicazione: (2023)
A Speech Production Model for Radar: Connecting Speech Acoustics with Radar-Measured Vibrations
di: Lenz, Isabella, et al.
Pubblicazione: (2025)
di: Lenz, Isabella, et al.
Pubblicazione: (2025)
ERes2NetV2: Boosting Short-Duration Speaker Verification Performance with Computational Efficiency
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
Ultrasensitive Textile Strain Sensors Redefine Wearable Silent Speech Interfaces with High Machine Learning Efficiency
di: Tang, Chenyu, et al.
Pubblicazione: (2023)
di: Tang, Chenyu, et al.
Pubblicazione: (2023)
SuperM2M: Supervised and Mixture-to-Mixture Co-Learning for Speech Enhancement and Noise-Robust ASR
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
SpeechMLC: Speech Multi-label Classification
di: Kim, Miseul, et al.
Pubblicazione: (2025)
di: Kim, Miseul, et al.
Pubblicazione: (2025)
From Evaluation to Optimization: Neural Speech Assessment for Downstream Applications
di: Tsao, Yu
Pubblicazione: (2025)
di: Tsao, Yu
Pubblicazione: (2025)
Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech Codec
di: Ren, Yanzhou, et al.
Pubblicazione: (2026)
di: Ren, Yanzhou, et al.
Pubblicazione: (2026)
FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners
di: Yuan, Ze, et al.
Pubblicazione: (2024)
di: Yuan, Ze, et al.
Pubblicazione: (2024)
Binaural Localization Model for Speech in Noise
di: Tokala, Vikas, et al.
Pubblicazione: (2025)
di: Tokala, Vikas, et al.
Pubblicazione: (2025)
Speech-Based Prioritization for Schizophrenia Intervention
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
Brain-Informed Speech Separation for Cochlear Implants
di: Gajecki, Tom, et al.
Pubblicazione: (2026)
di: Gajecki, Tom, et al.
Pubblicazione: (2026)
Speech Enhancement based on cascaded two flows
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
FlowSE: Flow Matching-based Speech Enhancement
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
USDnet: Unsupervised Speech Dereverberation via Neural Forward Filtering
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
Harmonics to the Rescue: Why Voiced Speech is Not a Wss Process
di: Bologni, Giovanni, et al.
Pubblicazione: (2025)
di: Bologni, Giovanni, et al.
Pubblicazione: (2025)
SELM: Speech Enhancement Using Discrete Tokens and Language Models
di: Wang, Ziqian, et al.
Pubblicazione: (2023)
di: Wang, Ziqian, et al.
Pubblicazione: (2023)
Binaural Speech Enhancement Using Complex Convolutional Recurrent Networks
di: Tokala, Vikas, et al.
Pubblicazione: (2025)
di: Tokala, Vikas, et al.
Pubblicazione: (2025)
Analyzing the Impact of Accent on English Speech: Acoustic and Articulatory Perspectives
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
The Overview of Segmental Durations Modification Algorithms on Speech Signal Characteristics
di: Jang, Kyeomeun, et al.
Pubblicazione: (2025)
di: Jang, Kyeomeun, et al.
Pubblicazione: (2025)
Robust Detection of Underwater Target Against Non-Uniform Noise With Optical Fiber DAS Array
di: Cang, Siyuan, et al.
Pubblicazione: (2025)
di: Cang, Siyuan, et al.
Pubblicazione: (2025)
Parameter-Efficient Fine-Tuning of Foundation Models for CLP Speech Classification
di: Bhattacharjee, Susmita, et al.
Pubblicazione: (2025)
di: Bhattacharjee, Susmita, et al.
Pubblicazione: (2025)
Exploring Disentangled Neural Speech Codecs from Self-Supervised Representations
di: Aihara, Ryo, et al.
Pubblicazione: (2025)
di: Aihara, Ryo, et al.
Pubblicazione: (2025)
Impact of Microphone Array Mismatches to Learning-based Replay Speech Detection
di: Neri, Michael, et al.
Pubblicazione: (2025)
di: Neri, Michael, et al.
Pubblicazione: (2025)
DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing
di: Lee, Dongheon, et al.
Pubblicazione: (2023)
di: Lee, Dongheon, et al.
Pubblicazione: (2023)
Multi-channel Replay Speech Detection using an Adaptive Learnable Beamformer
di: Neri, Michael, et al.
Pubblicazione: (2025)
di: Neri, Michael, et al.
Pubblicazione: (2025)
BanglaNum -- A Public Dataset for Bengali Digit Recognition from Speech
di: Mohammad, Mir Sayeed, et al.
Pubblicazione: (2024)
di: Mohammad, Mir Sayeed, et al.
Pubblicazione: (2024)
Mixture to Mixture: Leveraging Close-talk Mixtures as Weak-supervision for Speech Separation
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
Documenti analoghi
-
Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024) -
Confidence-Based Self-Training for EMG-to-Speech: Leveraging Synthetic EMG for Robust Modeling
di: Chen, Xiaodan, et al.
Pubblicazione: (2025) -
Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025) -
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024) -
MultiGen: Child-Friendly Multilingual Speech Generator with LLMs
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)