WenetSpeech-Yue: A Large-scale Cantonese Speech Corpus with Multi-dimensional Annotation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Longhao, Guo, Zhao, Chen, Hongjie, Dai, Yuhang, Zhang, Ziyu, Xue, Hongfei, Zuo, Tianlun, Wang, Chengyou, Wang, Shuiyuan, Li, Jie, Kang, Jian, Xu, Xin, Bu, Hui, Zhang, Binbin, Yuan, Ruibin, Zhou, Ziya, Xue, Wei, Xie, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
WenetSpeech-Wu: Datasets, Benchmarks, and Models for a Unified Chinese Wu Dialect Speech Processing Ecosystem
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark
di: Ma, Linhan, et al.
Pubblicazione: (2024)
di: Ma, Linhan, et al.
Pubblicazione: (2024)
OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs
di: Liao, Yujie, et al.
Pubblicazione: (2026)
di: Liao, Yujie, et al.
Pubblicazione: (2026)
HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models
di: Wang, Shuiyuan, et al.
Pubblicazione: (2026)
di: Wang, Shuiyuan, et al.
Pubblicazione: (2026)
Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
OSUM-EChat: Enhancing End-to-End Empathetic Spoken Chatbot via Understanding-Driven Spoken Dialogue
di: Geng, Xuelong, et al.
Pubblicazione: (2025)
di: Geng, Xuelong, et al.
Pubblicazione: (2025)
Syllable based DNN-HMM Cantonese Speech to Text System
di: Wong, Timothy, et al.
Pubblicazione: (2024)
di: Wong, Timothy, et al.
Pubblicazione: (2024)
Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems
di: Li, Guojian, et al.
Pubblicazione: (2025)
di: Li, Guojian, et al.
Pubblicazione: (2025)
EmoSpeech: A Corpus of Emotionally Rich and Contextually Detailed Speech Annotations
di: Bian, Weizhen, et al.
Pubblicazione: (2024)
di: Bian, Weizhen, et al.
Pubblicazione: (2024)
Ideal-LLM: Integrating Dual Encoders and Language-Adapted LLM for Multilingual Speech-to-Text
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
di: Cheng, Sitong, et al.
Pubblicazione: (2025)
di: Cheng, Sitong, et al.
Pubblicazione: (2025)
OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia
di: Geng, Xuelong, et al.
Pubblicazione: (2025)
di: Geng, Xuelong, et al.
Pubblicazione: (2025)
An Annotated Corpus of Arabic Tweets for Hate Speech Analysis
di: Zaghouani, Wajdi, et al.
Pubblicazione: (2025)
di: Zaghouani, Wajdi, et al.
Pubblicazione: (2025)
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
The ICASSP 2026 HumDial Challenge: Benchmarking Human-like Spoken Dialogue Systems in the LLM Era
di: Zhao, Zhixian, et al.
Pubblicazione: (2026)
di: Zhao, Zhixian, et al.
Pubblicazione: (2026)
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
di: Jiang, Feng, et al.
Pubblicazione: (2025)
di: Jiang, Feng, et al.
Pubblicazione: (2025)
Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR
di: Li, Longhao, et al.
Pubblicazione: (2025)
di: Li, Longhao, et al.
Pubblicazione: (2025)
UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations
di: Haq, Attia Nafees ul, et al.
Pubblicazione: (2026)
di: Haq, Attia Nafees ul, et al.
Pubblicazione: (2026)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
FalAR: A Large-scale Speaker-Annotated European Portuguese Speech Corpus of Parliamentary Sessions
di: Teixeira, Francisco, et al.
Pubblicazione: (2026)
di: Teixeira, Francisco, et al.
Pubblicazione: (2026)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
di: Wang, Xinsheng, et al.
Pubblicazione: (2025)
di: Wang, Xinsheng, et al.
Pubblicazione: (2025)
EuroSpeech: A Multilingual Speech Corpus
di: Pfisterer, Samuel, et al.
Pubblicazione: (2025)
di: Pfisterer, Samuel, et al.
Pubblicazione: (2025)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
di: Zhou, Ziya, et al.
Pubblicazione: (2024)
di: Zhou, Ziya, et al.
Pubblicazione: (2024)
Soundwave: Less is More for Speech-Text Alignment in LLMs
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
How Well Do LLMs Handle Cantonese? Benchmarking Cantonese Capabilities of Large Language Models
di: Jiang, Jiyue, et al.
Pubblicazione: (2024)
di: Jiang, Jiyue, et al.
Pubblicazione: (2024)
Latent-Domain Predictive Neural Speech Coding
di: Jiang, Xue, et al.
Pubblicazione: (2022)
di: Jiang, Xue, et al.
Pubblicazione: (2022)
WEST: LLM based Speech Toolkit for Speech Understanding, Generation, and Interaction
di: Zhang, Binbin, et al.
Pubblicazione: (2025)
di: Zhang, Binbin, et al.
Pubblicazione: (2025)
Enhancing Non-Core Language Instruction-Following in Speech LLMs via Semi-Implicit Cross-Lingual CoT Reasoning
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
LiveGesture Streamable Co-Speech Gesture Generation Model
di: Saleem, Muhammad Usama, et al.
Pubblicazione: (2026)
di: Saleem, Muhammad Usama, et al.
Pubblicazione: (2026)
SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion Model
di: Li, Yan, et al.
Pubblicazione: (2024)
di: Li, Yan, et al.
Pubblicazione: (2024)
Annotations to Geoffrey Hill's Speech! Speech!
di: Hassan, Ann
Pubblicazione: (2019)
di: Hassan, Ann
Pubblicazione: (2019)
Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
More Similar than Dissimilar: Modeling Annotators for Cross-Corpus Speech Emotion Recognition
di: Tavernor, James, et al.
Pubblicazione: (2025)
di: Tavernor, James, et al.
Pubblicazione: (2025)
Roadmap towards Superhuman Speech Understanding using Large Language Models
di: Bu, Fan, et al.
Pubblicazione: (2024)
di: Bu, Fan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
di: Dai, Yuhang, et al.
Pubblicazione: (2025) -
WenetSpeech-Wu: Datasets, Benchmarks, and Models for a Unified Chinese Wu Dialect Speech Processing Ecosystem
di: Wang, Chengyou, et al.
Pubblicazione: (2026) -
WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark
di: Ma, Linhan, et al.
Pubblicazione: (2024) -
OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs
di: Liao, Yujie, et al.
Pubblicazione: (2026) -
HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models
di: Wang, Shuiyuan, et al.
Pubblicazione: (2026)