The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, He, Guo, Pengcheng, Chen, Wei, Zhou, Pan, Xie, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
por: Xue, Hongfei, et al.
Publicado: (2025)
por: Xue, Hongfei, et al.
Publicado: (2025)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge
por: Liu, Zehua, et al.
Publicado: (2025)
por: Liu, Zehua, et al.
Publicado: (2025)
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
Variational Auto-Encoder Based Variability Encoding for Dysarthric Speech Recognition
por: Xie, Xurong, et al.
Publicado: (2022)
por: Xie, Xurong, et al.
Publicado: (2022)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
por: Dai, Yuhang, et al.
Publicado: (2025)
por: Dai, Yuhang, et al.
Publicado: (2025)
The NPU-HWC System for the ISCSLP 2024 Inspirational and Convincing Audio Generation Challenge
por: Guo, Dake, et al.
Publicado: (2024)
por: Guo, Dake, et al.
Publicado: (2024)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
por: Chen, Peikun, et al.
Publicado: (2024)
por: Chen, Peikun, et al.
Publicado: (2024)
CAMEL: Cross-Attention Enhanced Mixture-of-Experts and Language Bias for Code-Switching Speech Recognition
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
por: Lin, Zhaofeng, et al.
Publicado: (2024)
por: Lin, Zhaofeng, et al.
Publicado: (2024)
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
An audio-quality-based multi-strategy approach for target speaker extraction in the MISP 2023 Challenge
por: Han, Runduo, et al.
Publicado: (2024)
por: Han, Runduo, et al.
Publicado: (2024)
MMGER: Multi-modal and Multi-granularity Generative Error Correction with LLM for Joint Accent and Speech Recognition
por: Mu, Bingshen, et al.
Publicado: (2024)
por: Mu, Bingshen, et al.
Publicado: (2024)
A Domain Adaptation Framework for Speech Recognition Systems with Only Synthetic data
por: Tran, Minh, et al.
Publicado: (2025)
por: Tran, Minh, et al.
Publicado: (2025)
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
por: Li, Pengcheng, et al.
Publicado: (2025)
por: Li, Pengcheng, et al.
Publicado: (2025)
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
por: Tian, Jingguang, et al.
Publicado: (2024)
por: Tian, Jingguang, et al.
Publicado: (2024)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
por: Guo, Dake, et al.
Publicado: (2025)
por: Guo, Dake, et al.
Publicado: (2025)
Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
por: Xue, Hongfei, et al.
Publicado: (2025)
por: Xue, Hongfei, et al.
Publicado: (2025)
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
por: Huang, Mengcheng, et al.
Publicado: (2026)
por: Huang, Mengcheng, et al.
Publicado: (2026)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
por: Li, Yangze, et al.
Publicado: (2024)
por: Li, Yangze, et al.
Publicado: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
por: Liu, Qianhui, et al.
Publicado: (2024)
por: Liu, Qianhui, et al.
Publicado: (2024)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
por: Guo, Pengcheng, et al.
Publicado: (2024)
por: Guo, Pengcheng, et al.
Publicado: (2024)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
por: Gong, Xun, et al.
Publicado: (2024)
por: Gong, Xun, et al.
Publicado: (2024)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
por: Xue, Hongfei, et al.
Publicado: (2024)
por: Xue, Hongfei, et al.
Publicado: (2024)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
por: Liu, Huadai, et al.
Publicado: (2023)
por: Liu, Huadai, et al.
Publicado: (2023)
Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition
por: Chen, Shuangyuan, et al.
Publicado: (2025)
por: Chen, Shuangyuan, et al.
Publicado: (2025)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
Two-pass Endpoint Detection for Speech Recognition
por: Raju, Anirudh, et al.
Publicado: (2024)
por: Raju, Anirudh, et al.
Publicado: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
por: Wang, Huimeng, et al.
Publicado: (2025)
por: Wang, Huimeng, et al.
Publicado: (2025)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
por: Wang, He, et al.
Publicado: (2025)
por: Wang, He, et al.
Publicado: (2025)
FireRedTTS-1S: An Upgraded Streamable Foundation Text-to-Speech System
por: Guo, Hao-Han, et al.
Publicado: (2025)
por: Guo, Hao-Han, et al.
Publicado: (2025)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
por: Gao, Xiaoxue, et al.
Publicado: (2024)
por: Gao, Xiaoxue, et al.
Publicado: (2024)
Augmenting Polish Automatic Speech Recognition System With Synthetic Data
por: Bondaruk, Łukasz, et al.
Publicado: (2024)
por: Bondaruk, Łukasz, et al.
Publicado: (2024)
Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis
por: Tian, Wenjie, et al.
Publicado: (2025)
por: Tian, Wenjie, et al.
Publicado: (2025)
Ejemplares similares
-
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
por: Xue, Hongfei, et al.
Publicado: (2025) -
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
por: Wang, He, et al.
Publicado: (2024) -
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge
por: Liu, Zehua, et al.
Publicado: (2025) -
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
por: Mu, Bingshen, et al.
Publicado: (2025) -
Variational Auto-Encoder Based Variability Encoding for Dysarthric Speech Recognition
por: Xie, Xurong, et al.
Publicado: (2022)