HiFiTTS-2: A Large-Scale High Bandwidth Speech Dataset
Fuente:
arXiv
Guardado en:
| Autores principales: | Langman, Ryan, Yang, Xuesong, Neekhara, Paarth, Hussain, Shehzeen, Casanova, Edresson, Bakhturina, Evelina, Li, Jason |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference
por: Casanova, Edresson, et al.
Publicado: (2025)
por: Casanova, Edresson, et al.
Publicado: (2025)
Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference
por: Casanova, Edresson, et al.
Publicado: (2024)
por: Casanova, Edresson, et al.
Publicado: (2024)
Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization
por: Hussain, Shehzeen, et al.
Publicado: (2025)
por: Hussain, Shehzeen, et al.
Publicado: (2025)
Frame-Stacked Local Transformers For Efficient Multi-Codebook Speech Generation
por: Fejgin, Roy, et al.
Publicado: (2025)
por: Fejgin, Roy, et al.
Publicado: (2025)
Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance
por: Hussain, Shehzeen, et al.
Publicado: (2025)
por: Hussain, Shehzeen, et al.
Publicado: (2025)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
por: Neekhara, Paarth, et al.
Publicado: (2024)
por: Neekhara, Paarth, et al.
Publicado: (2024)
SelfVC: Voice Conversion With Iterative Refinement using Self Transformations
por: Neekhara, Paarth, et al.
Publicado: (2023)
por: Neekhara, Paarth, et al.
Publicado: (2023)
Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs
por: Langman, Ryan, et al.
Publicado: (2024)
por: Langman, Ryan, et al.
Publicado: (2024)
Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
por: Li, Zirui, et al.
Publicado: (2025)
por: Li, Zirui, et al.
Publicado: (2025)
WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark
por: Ma, Linhan, et al.
Publicado: (2024)
por: Ma, Linhan, et al.
Publicado: (2024)
KazEmoTTS: A Dataset for Kazakh Emotional Text-to-Speech Synthesis
por: Abilbekov, Adal, et al.
Publicado: (2024)
por: Abilbekov, Adal, et al.
Publicado: (2024)
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
por: Zhao, Shengkui, et al.
Publicado: (2025)
por: Zhao, Shengkui, et al.
Publicado: (2025)
MusicHiFi: Fast High-Fidelity Stereo Vocoding
por: Zhu, Ge, et al.
Publicado: (2024)
por: Zhu, Ge, et al.
Publicado: (2024)
HiFi-Stream: Streaming Speech Enhancement with Generative Adversarial Networks
por: Dmitrieva, Ekaterina, et al.
Publicado: (2025)
por: Dmitrieva, Ekaterina, et al.
Publicado: (2025)
HiFi-Glot: High-Fidelity Neural Formant Synthesis with Differentiable Resonant Filters
por: Gu, Yicheng, et al.
Publicado: (2024)
por: Gu, Yicheng, et al.
Publicado: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
por: Hu, Ke, et al.
Publicado: (2025)
por: Hu, Ke, et al.
Publicado: (2025)
MLAAD: The Multi-Language Audio Anti-Spoofing Dataset
por: Müller, Nicolas M., et al.
Publicado: (2024)
por: Müller, Nicolas M., et al.
Publicado: (2024)
STSM-FiLM: A FiLM-Conditioned Neural Architecture for Time-Scale Modification of Speech
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)
Seed-TTS: A Family of High-Quality Versatile Speech Generation Models
por: Anastassiou, Philip, et al.
Publicado: (2024)
por: Anastassiou, Philip, et al.
Publicado: (2024)
Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech
por: Kim, Semin, et al.
Publicado: (2026)
por: Kim, Semin, et al.
Publicado: (2026)
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
por: Garg, Ashi, et al.
Publicado: (2025)
por: Garg, Ashi, et al.
Publicado: (2025)
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
por: Meng, Qingliang, et al.
Publicado: (2025)
por: Meng, Qingliang, et al.
Publicado: (2025)
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
por: Guo, Yinlin, et al.
Publicado: (2024)
por: Guo, Yinlin, et al.
Publicado: (2024)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
por: Liu, Sen, et al.
Publicado: (2024)
por: Liu, Sen, et al.
Publicado: (2024)
Traceable TTS: Toward Watermark-Free TTS with Strong Traceability
por: Zhao, Yuxiang, et al.
Publicado: (2025)
por: Zhao, Yuxiang, et al.
Publicado: (2025)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
por: Liu, Huadai, et al.
Publicado: (2023)
por: Liu, Huadai, et al.
Publicado: (2023)
EME-TTS: Unlocking the Emphasis and Emotion Link in Speech Synthesis
por: Li, Haoxun, et al.
Publicado: (2025)
por: Li, Haoxun, et al.
Publicado: (2025)
HAM-TTS: Hierarchical Acoustic Modeling for Token-Based Zero-Shot Text-to-Speech with Model and Data Scaling
por: Wang, Chunhui, et al.
Publicado: (2024)
por: Wang, Chunhui, et al.
Publicado: (2024)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
por: Tang, Haobin, et al.
Publicado: (2024)
por: Tang, Haobin, et al.
Publicado: (2024)
A Dataset for Automatic Assessment of TTS Quality in Spanish
por: Welford, Alejandro Sosa, et al.
Publicado: (2025)
por: Welford, Alejandro Sosa, et al.
Publicado: (2025)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
por: Dhawan, Kunal, et al.
Publicado: (2024)
por: Dhawan, Kunal, et al.
Publicado: (2024)
Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation
por: He, Haorui, et al.
Publicado: (2024)
por: He, Haorui, et al.
Publicado: (2024)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
por: Huang, Wen, et al.
Publicado: (2025)
por: Huang, Wen, et al.
Publicado: (2025)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
por: Ren, Yong, et al.
Publicado: (2026)
por: Ren, Yong, et al.
Publicado: (2026)
Prosodic Parameter Manipulation in TTS generated speech for Controlled Speech Generation
por: Chary, Podakanti Satyajith
Publicado: (2024)
por: Chary, Podakanti Satyajith
Publicado: (2024)
UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
por: Gupta, Kishan, et al.
Publicado: (2025)
por: Gupta, Kishan, et al.
Publicado: (2025)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
por: Fang, Yuan, et al.
Publicado: (2024)
por: Fang, Yuan, et al.
Publicado: (2024)
How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools
por: Răgman, Teodora, et al.
Publicado: (2026)
por: Răgman, Teodora, et al.
Publicado: (2026)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
por: Guo, Hao-Han, et al.
Publicado: (2024)
por: Guo, Hao-Han, et al.
Publicado: (2024)
Ejemplares similares
-
NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference
por: Casanova, Edresson, et al.
Publicado: (2025) -
Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference
por: Casanova, Edresson, et al.
Publicado: (2024) -
Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization
por: Hussain, Shehzeen, et al.
Publicado: (2025) -
Frame-Stacked Local Transformers For Efficient Multi-Codebook Speech Generation
por: Fejgin, Roy, et al.
Publicado: (2025) -
Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance
por: Hussain, Shehzeen, et al.
Publicado: (2025)