SlimSpeech: Lightweight and Efficient Text-to-Speech with Slim Rectified Flow
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Kaidi, Guan, Wenhao, Lu, Shenghui, Yao, Jianglong, Li, Lin, Hong, Qingyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
por: Lu, Shenghui, et al.
Publicado: (2025)
por: Lu, Shenghui, et al.
Publicado: (2025)
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
VoiceFlow: Efficient Text-to-Speech with Rectified Flow Matching
por: Guo, Yiwei, et al.
Publicado: (2023)
por: Guo, Yiwei, et al.
Publicado: (2023)
MeanFlowSE: one-step generative speech enhancement via conditional mean flow
por: Li, Duojia, et al.
Publicado: (2025)
por: Li, Duojia, et al.
Publicado: (2025)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
por: Ren, Pengyu, et al.
Publicado: (2025)
por: Ren, Pengyu, et al.
Publicado: (2025)
Adaptive Slimming for Scalable and Efficient Speech Enhancement
por: Miccini, Riccardo, et al.
Publicado: (2025)
por: Miccini, Riccardo, et al.
Publicado: (2025)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
por: Wang, Kaidi, et al.
Publicado: (2025)
por: Wang, Kaidi, et al.
Publicado: (2025)
SyncSpeech: Efficient and Low-Latency Text-to-Speech based on Temporal Masked Transformer
por: Sheng, Zhengyan, et al.
Publicado: (2025)
por: Sheng, Zhengyan, et al.
Publicado: (2025)
RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
por: Gao, Liting, et al.
Publicado: (2025)
por: Gao, Liting, et al.
Publicado: (2025)
Enhancing Code-Switching Speech Recognition with LID-Based Collaborative Mixture of Experts Model
por: Huang, Hukai, et al.
Publicado: (2024)
por: Huang, Hukai, et al.
Publicado: (2024)
Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge
por: Luo, Longjie, et al.
Publicado: (2025)
por: Luo, Longjie, et al.
Publicado: (2025)
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
por: Chen, Peijie, et al.
Publicado: (2025)
por: Chen, Peijie, et al.
Publicado: (2025)
Flamed-TTS: Flow Matching Attention-Free Models for Efficient Generating and Dynamic Pacing Zero-shot Text-to-Speech
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)
Sample-Efficient Diffusion for Text-To-Speech Synthesis
por: Lovelace, Justin, et al.
Publicado: (2024)
por: Lovelace, Justin, et al.
Publicado: (2024)
AlphaFlowTSE: One-Step Generative Target Speaker Extraction via Conditional AlphaFlow
por: Li, Duojia, et al.
Publicado: (2026)
por: Li, Duojia, et al.
Publicado: (2026)
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
por: Li, Xiang, et al.
Publicado: (2026)
por: Li, Xiang, et al.
Publicado: (2026)
Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
por: Yang, Dong, et al.
Publicado: (2025)
por: Yang, Dong, et al.
Publicado: (2025)
LSZone: A Lightweight Spatial Information Modeling Architecture for Real-time In-car Multi-zone Speech Separation
por: Chen, Jun, et al.
Publicado: (2025)
por: Chen, Jun, et al.
Publicado: (2025)
SLM-SS: Speech Language Model for Generative Speech Separation
por: Li, Tianhua, et al.
Publicado: (2026)
por: Li, Tianhua, et al.
Publicado: (2026)
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
por: Deng, Wei, et al.
Publicado: (2025)
por: Deng, Wei, et al.
Publicado: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
por: Wu, Weijie, et al.
Publicado: (2025)
por: Wu, Weijie, et al.
Publicado: (2025)
A Lightweight Pipeline for Noisy Speech Voice Cloning and Accurate Lip Sync Synthesis
por: Amir, Javeria, et al.
Publicado: (2025)
por: Amir, Javeria, et al.
Publicado: (2025)
ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis
por: Li, Haitao, et al.
Publicado: (2026)
por: Li, Haitao, et al.
Publicado: (2026)
DDSP-QbE++: Improving Speech Quality for Speech Anonymisation for Atypical Speech
por: Ghosh, Suhita, et al.
Publicado: (2026)
por: Ghosh, Suhita, et al.
Publicado: (2026)
GSRM: Generative Speech Reward Model for Speech RLHF
por: Shen, Maohao, et al.
Publicado: (2026)
por: Shen, Maohao, et al.
Publicado: (2026)
Soundwave: Less is More for Speech-Text Alignment in LLMs
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
Emotion Detection in Speech Using Lightweight and Transformer-Based Models: A Comparative and Ablation Study
por: Onyekwelu-Udoka, Lucky, et al.
Publicado: (2025)
por: Onyekwelu-Udoka, Lucky, et al.
Publicado: (2025)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
por: Lou, Haowei, et al.
Publicado: (2024)
por: Lou, Haowei, et al.
Publicado: (2024)
SepPrune: Structured Pruning for Efficient Deep Speech Separation
por: Li, Yuqi, et al.
Publicado: (2025)
por: Li, Yuqi, et al.
Publicado: (2025)
Efficient Training for Cross-lingual Speech Language Models
por: Zhou, Yan, et al.
Publicado: (2026)
por: Zhou, Yan, et al.
Publicado: (2026)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
por: Luo, Dan, et al.
Publicado: (2025)
por: Luo, Dan, et al.
Publicado: (2025)
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
por: Wang, Helin, et al.
Publicado: (2025)
por: Wang, Helin, et al.
Publicado: (2025)
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
por: Cheng, Sitong, et al.
Publicado: (2025)
por: Cheng, Sitong, et al.
Publicado: (2025)
LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation
por: Guan, Wenhao, et al.
Publicado: (2024)
por: Guan, Wenhao, et al.
Publicado: (2024)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
por: Wang, Yongqi, et al.
Publicado: (2023)
por: Wang, Yongqi, et al.
Publicado: (2023)
Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment
por: Huang, Pu, et al.
Publicado: (2025)
por: Huang, Pu, et al.
Publicado: (2025)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
Understanding Frechet Speech Distance for Synthetic Speech Quality Evaluation
por: Kim, June-Woo, et al.
Publicado: (2026)
por: Kim, June-Woo, et al.
Publicado: (2026)
Ejemplares similares
-
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
por: Lu, Shenghui, et al.
Publicado: (2025) -
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
por: Guan, Wenhao, et al.
Publicado: (2023) -
VoiceFlow: Efficient Text-to-Speech with Rectified Flow Matching
por: Guo, Yiwei, et al.
Publicado: (2023) -
MeanFlowSE: one-step generative speech enhancement via conditional mean flow
por: Li, Duojia, et al.
Publicado: (2025) -
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
por: Ren, Pengyu, et al.
Publicado: (2025)