The THUEE System Description for the IARPA OpenASR21 Challenge
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Jing, Wang, Haoyu, Li, Jinpeng, Chai, Shuzhou, Wang, Guan-Bo, Chen, Guoguo, Zhang, Wei-Qiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio
por: Chen, Guoguo, et al.
Publicado: (2021)
por: Chen, Guoguo, et al.
Publicado: (2021)
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
por: Wu, Minghui, et al.
Publicado: (2024)
por: Wu, Minghui, et al.
Publicado: (2024)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
Index-ASR Technical Report
por: Song, Zheshu, et al.
Publicado: (2025)
por: Song, Zheshu, et al.
Publicado: (2025)
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
por: Huang, Shangkun, et al.
Publicado: (2025)
por: Huang, Shangkun, et al.
Publicado: (2025)
XMUspeech Systems for the ASVspoof 5 Challenge
por: Li, Wangjie, et al.
Publicado: (2025)
por: Li, Wangjie, et al.
Publicado: (2025)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
por: Guan, Wenhao, et al.
Publicado: (2025)
por: Guan, Wenhao, et al.
Publicado: (2025)
EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization
por: Wang, Jianzong, et al.
Publicado: (2024)
por: Wang, Jianzong, et al.
Publicado: (2024)
EffectiveASR: A Single-Step Non-Autoregressive Mandarin Speech Recognition Architecture with High Accuracy and Inference Speed
por: Zhuang, Ziyang, et al.
Publicado: (2024)
por: Zhuang, Ziyang, et al.
Publicado: (2024)
Mitigating Category Imbalance: Fosafer System for the Multimodal Emotion and Intent Joint Understanding Challenge
por: Wang, Honghong, et al.
Publicado: (2025)
por: Wang, Honghong, et al.
Publicado: (2025)
Efficient Scaling for LLM-based ASR
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
por: Wang, Huimeng, et al.
Publicado: (2024)
por: Wang, Huimeng, et al.
Publicado: (2024)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
por: Wei, Linye, et al.
Publicado: (2025)
por: Wei, Linye, et al.
Publicado: (2025)
USTC-KXDIGIT System Description for ASVspoof5 Challenge
por: Chen, Yihao, et al.
Publicado: (2024)
por: Chen, Yihao, et al.
Publicado: (2024)
Complexity boosted adaptive training for better low resource ASR performance
por: Lu, Hongxuan, et al.
Publicado: (2024)
por: Lu, Hongxuan, et al.
Publicado: (2024)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
por: Liu, Wei, et al.
Publicado: (2024)
por: Liu, Wei, et al.
Publicado: (2024)
Speaker Adaptation for Quantised End-to-End ASR Models
por: Zhao, Qiuming, et al.
Publicado: (2024)
por: Zhao, Qiuming, et al.
Publicado: (2024)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
por: Yang, Yufeng, et al.
Publicado: (2024)
por: Yang, Yufeng, et al.
Publicado: (2024)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
por: Wang, Weiqing, et al.
Publicado: (2025)
por: Wang, Weiqing, et al.
Publicado: (2025)
Target Speaker ASR with Whisper
por: Polok, Alexander, et al.
Publicado: (2024)
por: Polok, Alexander, et al.
Publicado: (2024)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
por: Zhao, Wenbo, et al.
Publicado: (2024)
por: Zhao, Wenbo, et al.
Publicado: (2024)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
por: Wei, Victor Junqiu, et al.
Publicado: (2024)
por: Wei, Victor Junqiu, et al.
Publicado: (2024)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
por: Yang, Yufeng, et al.
Publicado: (2025)
por: Yang, Yufeng, et al.
Publicado: (2025)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
PB-LRDWWS System for the SLT 2024 Low-Resource Dysarthria Wake-Up Word Spotting Challenge
por: Wang, Shiyao, et al.
Publicado: (2024)
por: Wang, Shiyao, et al.
Publicado: (2024)
Low-Resource Audio Codec (LRAC): 2025 Challenge Description
por: Wojcicki, Kamil, et al.
Publicado: (2025)
por: Wojcicki, Kamil, et al.
Publicado: (2025)
Speech Emotion Recognition with ASR Integration
por: Li, Yuanchao
Publicado: (2026)
por: Li, Yuanchao
Publicado: (2026)
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
por: Xu, Kai-Tuo, et al.
Publicado: (2025)
por: Xu, Kai-Tuo, et al.
Publicado: (2025)
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
por: Geng, Xuelong, et al.
Publicado: (2024)
por: Geng, Xuelong, et al.
Publicado: (2024)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
por: Wang, Weiqing, et al.
Publicado: (2024)
por: Wang, Weiqing, et al.
Publicado: (2024)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
por: Gong, Xun, et al.
Publicado: (2025)
por: Gong, Xun, et al.
Publicado: (2025)
SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR
por: Zhao, Qiuming, et al.
Publicado: (2024)
por: Zhao, Qiuming, et al.
Publicado: (2024)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
por: Zhou, Jiaming, et al.
Publicado: (2023)
por: Zhou, Jiaming, et al.
Publicado: (2023)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
por: Li, Shaojun, et al.
Publicado: (2024)
por: Li, Shaojun, et al.
Publicado: (2024)
Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR
por: Li, Longhao, et al.
Publicado: (2025)
por: Li, Longhao, et al.
Publicado: (2025)
Libriheavy: a 50,000 hours ASR corpus with punctuation casing and context
por: Kang, Wei, et al.
Publicado: (2023)
por: Kang, Wei, et al.
Publicado: (2023)
META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR
por: Wang, Jinhan, et al.
Publicado: (2024)
por: Wang, Jinhan, et al.
Publicado: (2024)
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision
por: Li, Zhaoqing, et al.
Publicado: (2025)
por: Li, Zhaoqing, et al.
Publicado: (2025)
SSCFormer: Push the Limit of Chunk-wise Conformer for Streaming ASR Using Sequentially Sampled Chunks and Chunked Causal Convolution
por: Wang, Fangyuan, et al.
Publicado: (2022)
por: Wang, Fangyuan, et al.
Publicado: (2022)
Ejemplares similares
-
GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio
por: Chen, Guoguo, et al.
Publicado: (2021) -
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
por: Wu, Minghui, et al.
Publicado: (2024) -
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
por: Yang, Yifan, et al.
Publicado: (2024) -
Index-ASR Technical Report
por: Song, Zheshu, et al.
Publicado: (2025) -
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
por: Huang, Shangkun, et al.
Publicado: (2025)