GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Yifan, Song, Zheshu, Zhuo, Jianheng, Cui, Mingyu, Li, Jinpeng, Yang, Bo, Du, Yexing, Ma, Ziyang, Liu, Xunying, Wang, Ziyuan, Li, Ke, Fan, Shuai, Yu, Kai, Zhang, Wei-Qiang, Chen, Guoguo, Chen, Xie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio
par: Chen, Guoguo, et autres
Publié: (2021)
par: Chen, Guoguo, et autres
Publié: (2021)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
par: Song, Zheshu, et autres
Publié: (2024)
par: Song, Zheshu, et autres
Publié: (2024)
LoRA-Whisper: Parameter-Efficient and Extensible Multilingual ASR
par: Song, Zheshu, et autres
Publié: (2024)
par: Song, Zheshu, et autres
Publié: (2024)
VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
par: Zhuo, Jianheng, et autres
Publié: (2025)
par: Zhuo, Jianheng, et autres
Publié: (2025)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
SpeechColab Leaderboard: An Open-Source Platform for Automatic Speech Recognition Evaluation
par: Du, Jiayu, et autres
Publié: (2024)
par: Du, Jiayu, et autres
Publié: (2024)
Exploring SSL Discrete Tokens for Multilingual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Index-ASR Technical Report
par: Song, Zheshu, et autres
Publié: (2025)
par: Song, Zheshu, et autres
Publié: (2025)
The THUEE System Description for the IARPA OpenASR21 Challenge
par: Zhao, Jing, et autres
Publié: (2022)
par: Zhao, Jing, et autres
Publié: (2022)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum Learning
par: Du, Yexing, et autres
Publié: (2024)
par: Du, Yexing, et autres
Publié: (2024)
Quantifying Geospatial in the Common Crawl Corpus
par: Ilyankou, Ilya, et autres
Publié: (2024)
par: Ilyankou, Ilya, et autres
Publié: (2024)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
par: Li, Jiahong, et autres
Publié: (2025)
par: Li, Jiahong, et autres
Publié: (2025)
k2SSL: A Faster and Better Framework for Self-Supervised Speech Representation Learning
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
par: Wang, Hsuan-Yu, et autres
Publié: (2025)
par: Wang, Hsuan-Yu, et autres
Publié: (2025)
An Untethered Soft Crawling Robot Driven by Wireless Power Transfer Technology
par: Lei Han, et autres
Publié: (2024)
par: Lei Han, et autres
Publié: (2024)
Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision
par: Li, Zhaoqing, et autres
Publié: (2025)
par: Li, Zhaoqing, et autres
Publié: (2025)
MaLa-ASR: Multimedia-Assisted LLM-Based ASR
par: Yang, Guanrou, et autres
Publié: (2024)
par: Yang, Guanrou, et autres
Publié: (2024)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
par: Wang, Huimeng, et autres
Publié: (2024)
par: Wang, Huimeng, et autres
Publié: (2024)
Refining Transcripts With TV Subtitles by Prompt-Based Weakly Supervised Training of ASR
par: Zhao, Xinnian, et autres
Publié: (2025)
par: Zhao, Xinnian, et autres
Publié: (2025)
Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems
par: Cui, Mingyu, et autres
Publié: (2025)
par: Cui, Mingyu, et autres
Publié: (2025)
Speech Emotion Recognition with ASR Transcripts: A Comprehensive Study on Word Error Rate and Fusion Techniques
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
CTC-Assisted LLM-Based Contextual ASR
par: Yang, Guanrou, et autres
Publié: (2024)
par: Yang, Guanrou, et autres
Publié: (2024)
Topic mining based on fine-tuning Sentence-BERT and LDA
par: Li, Jianheng, et autres
Publié: (2025)
par: Li, Jianheng, et autres
Publié: (2025)
GigaWorld-Policy: An Efficient Action-Centered World--Action Model
par: Ye, Angen, et autres
Publié: (2026)
par: Ye, Angen, et autres
Publié: (2026)
Invariance under Structure Translation as the Origin of Host Immune Capacity Conservation from Noether's Theorem
par: Chen, Yexing, et autres
Publié: (2025)
par: Chen, Yexing, et autres
Publié: (2025)
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2026)
par: Chen, Youjun, et autres
Publié: (2026)
The X-LANCE Technical Report for Interspeech 2024 Speech Processing Using Discrete Speech Unit Challenge
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
Crossmodal ASR Error Correction with Discrete Speech Units
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Distinguishing Repetition Disfluency from Morphological Reduplication in Bangla ASR Transcripts: A Novel Corpus and Benchmarking Analysis
par: Arpa, Zaara Zabeen, et autres
Publié: (2025)
par: Arpa, Zaara Zabeen, et autres
Publié: (2025)
SpeechRefiner: Towards Perceptual Quality Refinement for Front-End Algorithms
par: Li, Sirui, et autres
Publié: (2025)
par: Li, Sirui, et autres
Publié: (2025)
TacoLM: GaTed Attention Equipped Codec Language Model are Efficient Zero-Shot Text to Speech Synthesizers
par: Song, Yakun, et autres
Publié: (2024)
par: Song, Yakun, et autres
Publié: (2024)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Ramsa: A Large Sociolinguistically Rich Emirati Arabic Speech Corpus for ASR and TTS
par: Al-Sabbagh, Rania
Publié: (2026)
par: Al-Sabbagh, Rania
Publié: (2026)
Arabic ASR on the SADA Large-Scale Arabic Speech Corpus with Transformer-Based Models
par: Gerazov, Branislav, et autres
Publié: (2025)
par: Gerazov, Branislav, et autres
Publié: (2025)
GigaAM: Efficient Self-Supervised Learner for Speech Recognition
par: Kutsakov, Aleksandr, et autres
Publié: (2025)
par: Kutsakov, Aleksandr, et autres
Publié: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Documents similaires
-
GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio
par: Chen, Guoguo, et autres
Publié: (2021) -
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
par: Song, Zheshu, et autres
Publié: (2024) -
LoRA-Whisper: Parameter-Efficient and Extensible Multilingual ASR
par: Song, Zheshu, et autres
Publié: (2024) -
VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
par: Zhuo, Jianheng, et autres
Publié: (2025) -
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
par: Cui, Mingyu, et autres
Publié: (2024)