UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations
Fuente:
arXiv
Salvato in:
| Autori principali: | Haq, Attia Nafees ul, Zhu, Zeyu, Hu, Jingbin, He, ChunJiang, Xie, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cross-Corpus Validation of Speech Emotion Recognition in Urdu using Domain-Knowledge Acoustic Features
di: Talpur, Unzela, et al.
Pubblicazione: (2025)
di: Talpur, Unzela, et al.
Pubblicazione: (2025)
Rethinking Cross-Corpus Speech Emotion Recognition Benchmarking: Are Paralinguistic Pre-Trained Representations Sufficient?
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
FleSpeech: Flexibly Controllable Speech Generation with Various Prompts
di: Li, Hanzhao, et al.
Pubblicazione: (2025)
di: Li, Hanzhao, et al.
Pubblicazione: (2025)
Towards Machine Unlearning for Paralinguistic Speech Processing
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark
di: Ma, Linhan, et al.
Pubblicazione: (2024)
di: Ma, Linhan, et al.
Pubblicazione: (2024)
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
di: Jiang, Feng, et al.
Pubblicazione: (2025)
di: Jiang, Feng, et al.
Pubblicazione: (2025)
From Statistical Methods to Pre-Trained Models; A Survey on Automatic Speech Recognition for Resource Scarce Urdu Language
di: Sharif, Muhammad, et al.
Pubblicazione: (2024)
di: Sharif, Muhammad, et al.
Pubblicazione: (2024)
Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
WER We Stand: Benchmarking Urdu ASR Models
di: Arif, Samee, et al.
Pubblicazione: (2024)
di: Arif, Samee, et al.
Pubblicazione: (2024)
WenetSpeech-Wu: Datasets, Benchmarks, and Models for a Unified Chinese Wu Dialect Speech Processing Ecosystem
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Source Tracing of Synthetic Speech Systems Through Paralinguistic Pre-Trained Representations
di: Girish, et al.
Pubblicazione: (2025)
di: Girish, et al.
Pubblicazione: (2025)
ParaStyleTTS: Toward Efficient and Robust Paralinguistic Style Control for Expressive Text-to-Speech Generation
di: Lou, Haowei, et al.
Pubblicazione: (2025)
di: Lou, Haowei, et al.
Pubblicazione: (2025)
A Neural Speech Codec for Noise Robust Speech Coding
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model
di: Li, Guojian, et al.
Pubblicazione: (2026)
di: Li, Guojian, et al.
Pubblicazione: (2026)
EmoSpeech: A Corpus of Emotionally Rich and Contextually Detailed Speech Annotations
di: Bian, Weizhen, et al.
Pubblicazione: (2024)
di: Bian, Weizhen, et al.
Pubblicazione: (2024)
FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech
di: Ma, Linhan, et al.
Pubblicazione: (2025)
di: Ma, Linhan, et al.
Pubblicazione: (2025)
ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations from Speech
di: Lou, Haowei, et al.
Pubblicazione: (2026)
di: Lou, Haowei, et al.
Pubblicazione: (2026)
MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech
di: Chen, Huakang, et al.
Pubblicazione: (2026)
di: Chen, Huakang, et al.
Pubblicazione: (2026)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
di: Kang, Wonjune, et al.
Pubblicazione: (2024)
di: Kang, Wonjune, et al.
Pubblicazione: (2024)
Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and Understanding
di: Bai, Bingsong, et al.
Pubblicazione: (2025)
di: Bai, Bingsong, et al.
Pubblicazione: (2025)
Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
BENYO-S2ST-Corpus-1: A Bilingual English-to-Yoruba Direct Speech-to-Speech Translation Corpus
di: Adetiba, Emmanuel, et al.
Pubblicazione: (2025)
di: Adetiba, Emmanuel, et al.
Pubblicazione: (2025)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
Revisiting Modeling and Evaluation Approaches in Speech Emotion Recognition: Considering Subjectivity of Annotators and Ambiguity of Emotions
di: Chou, Huang-Cheng, et al.
Pubblicazione: (2025)
di: Chou, Huang-Cheng, et al.
Pubblicazione: (2025)
Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets
di: Pešán, Jan, et al.
Pubblicazione: (2024)
di: Pešán, Jan, et al.
Pubblicazione: (2024)
A Literature Review of Keyword Spotting Technologies for Urdu
di: Rizvi, Syed Muhammad Aqdas
Pubblicazione: (2024)
di: Rizvi, Syed Muhammad Aqdas
Pubblicazione: (2024)
MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling
di: Cheng, Yifan, et al.
Pubblicazione: (2025)
di: Cheng, Yifan, et al.
Pubblicazione: (2025)
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026)
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
More Similar than Dissimilar: Modeling Annotators for Cross-Corpus Speech Emotion Recognition
di: Tavernor, James, et al.
Pubblicazione: (2025)
di: Tavernor, James, et al.
Pubblicazione: (2025)
JVNV: A Corpus of Japanese Emotional Speech with Verbal Content and Nonverbal Expressions
di: Xin, Detai, et al.
Pubblicazione: (2023)
di: Xin, Detai, et al.
Pubblicazione: (2023)
SaSLaW: Dialogue Speech Corpus with Audio-visual Egocentric Information Toward Environment-adaptive Dialogue Speech Synthesis
di: Take, Osamu, et al.
Pubblicazione: (2024)
di: Take, Osamu, et al.
Pubblicazione: (2024)
ÌròyìnSpeech: A multi-purpose Yorùbá Speech Corpus
di: Ogunremi, Tolulope, et al.
Pubblicazione: (2023)
di: Ogunremi, Tolulope, et al.
Pubblicazione: (2023)
SoulX-Podcast: Towards Realistic Long-form Podcasts with Dialectal and Paralinguistic Diversity
di: Xie, Hanke, et al.
Pubblicazione: (2025)
di: Xie, Hanke, et al.
Pubblicazione: (2025)
FeruzaSpeech: A 60 Hour Uzbek Read Speech Corpus with Punctuation, Casing, and Context
di: Povey, Anna, et al.
Pubblicazione: (2024)
di: Povey, Anna, et al.
Pubblicazione: (2024)
Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens
di: Zhao, Jinzheng, et al.
Pubblicazione: (2024)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2024)
Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation
di: Li, Hanzhao, et al.
Pubblicazione: (2024)
di: Li, Hanzhao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cross-Corpus Validation of Speech Emotion Recognition in Urdu using Domain-Knowledge Acoustic Features
di: Talpur, Unzela, et al.
Pubblicazione: (2025) -
Rethinking Cross-Corpus Speech Emotion Recognition Benchmarking: Are Paralinguistic Pre-Trained Representations Sufficient?
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025) -
FleSpeech: Flexibly Controllable Speech Generation with Various Prompts
di: Li, Hanzhao, et al.
Pubblicazione: (2025) -
Towards Machine Unlearning for Paralinguistic Speech Processing
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025) -
WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark
di: Ma, Linhan, et al.
Pubblicazione: (2024)