An End-To-End Stuttering Detection Method Based On Conformer And BILSTM
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Xiaokang, Xu, Changqing, Yang, Yudong, Wang, Lan, Yan, Nan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StutterZero and StutterFormer: End-to-End Speech Conversion for Stuttering Transcription and Correction
par: Xu, Qianheng
Publié: (2025)
par: Xu, Qianheng
Publié: (2025)
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)
par: Zhou, Xuanru, et autres
Publié: (2024)
An Audio-textual Diffusion Model For Converting Speech Signals Into Ultrasound Tongue Imaging Data
par: Yang, Yudong, et autres
Publié: (2024)
par: Yang, Yudong, et autres
Publié: (2024)
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)
par: Zhou, Xuanru, et autres
Publié: (2024)
Magnitude and Phase-based Feature Fusion Using Co-attention Mechanism for Speaker recognition
par: Su, Rongfeng, et autres
Publié: (2025)
par: Su, Rongfeng, et autres
Publié: (2025)
Automatic Assessment of Dysarthria Using Audio-visual Vowel Graph Attention Network
par: Liu, Xiaokang, et autres
Publié: (2024)
par: Liu, Xiaokang, et autres
Publié: (2024)
End-to-End Direction-Aware Keyword Spotting with Spatial Priors in Noisy Environments
par: Wang, Rui, et autres
Publié: (2026)
par: Wang, Rui, et autres
Publié: (2026)
Transformer-based End-to-End Control Filter Generation for Active Noise Control
par: Yang, Ziyi, et autres
Publié: (2026)
par: Yang, Ziyi, et autres
Publié: (2026)
FGCL: Fine-grained Contrastive Learning For Mandarin Stuttering Event Detection
par: Jiang, Han, et autres
Publié: (2024)
par: Jiang, Han, et autres
Publié: (2024)
VBx for End-to-End Neural and Clustering-based Diarization
par: Pálka, Petr, et autres
Publié: (2025)
par: Pálka, Petr, et autres
Publié: (2025)
DNCASR: End-to-End Training for Speaker-Attributed ASR
par: Zheng, Xianrui, et autres
Publié: (2025)
par: Zheng, Xianrui, et autres
Publié: (2025)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
par: Chen, Yujie, et autres
Publié: (2024)
par: Chen, Yujie, et autres
Publié: (2024)
CSSinger: End-to-End Chunkwise Streaming Singing Voice Synthesis System Based on Conditional Variational Autoencoder
par: Cui, Jianwei, et autres
Publié: (2024)
par: Cui, Jianwei, et autres
Publié: (2024)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
par: Guo, Yinlin, et autres
Publié: (2024)
par: Guo, Yinlin, et autres
Publié: (2024)
Speaker Adaptation for Quantised End-to-End ASR Models
par: Zhao, Qiuming, et autres
Publié: (2024)
par: Zhao, Qiuming, et autres
Publié: (2024)
DiaPer: End-to-End Neural Diarization with Perceiver-Based Attractors
par: Landini, Federico, et autres
Publié: (2023)
par: Landini, Federico, et autres
Publié: (2023)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
par: Xue, Hongfei, et autres
Publié: (2024)
par: Xue, Hongfei, et autres
Publié: (2024)
Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement
par: Dai, Wang, et autres
Publié: (2024)
par: Dai, Wang, et autres
Publié: (2024)
End-to-End Speech Recognition with Pre-trained Masked Language Model
par: Higuchi, Yosuke, et autres
Publié: (2024)
par: Higuchi, Yosuke, et autres
Publié: (2024)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
par: You, Zhenghai, et autres
Publié: (2025)
par: You, Zhenghai, et autres
Publié: (2025)
Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation
par: Wang, Pu, et autres
Publié: (2024)
par: Wang, Pu, et autres
Publié: (2024)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
End-to-End DOA-Guided Speech Extraction in Noisy Multi-Talker Scenarios
par: Jing, Kangqi, et autres
Publié: (2025)
par: Jing, Kangqi, et autres
Publié: (2025)
Using Adapters to Overcome Catastrophic Forgetting in End-to-End Automatic Speech Recognition
par: Eeckt, Steven Vander, et autres
Publié: (2022)
par: Eeckt, Steven Vander, et autres
Publié: (2022)
SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription
par: Dai, Yuhang, et autres
Publié: (2026)
par: Dai, Yuhang, et autres
Publié: (2026)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
par: Xu, Anfeng, et autres
Publié: (2026)
par: Xu, Anfeng, et autres
Publié: (2026)
Lightweight and Robust Multi-Channel End-to-End Speech Recognition with Spherical Harmonic Transform
par: Kong, Xiangzhu, et autres
Publié: (2025)
par: Kong, Xiangzhu, et autres
Publié: (2025)
SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR
par: Zhao, Qiuming, et autres
Publié: (2024)
par: Zhao, Qiuming, et autres
Publié: (2024)
DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion
par: Ning, Ziqian, et autres
Publié: (2025)
par: Ning, Ziqian, et autres
Publié: (2025)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
Breaking Walls: Pioneering Automatic Speech Recognition for Central Kurdish: End-to-End Transformer Paradigm
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
Exploring an Inter-Pausal Unit (IPU) based Approach for Indic End-to-End TTS Systems
par: Prakash, Anusha, et autres
Publié: (2024)
par: Prakash, Anusha, et autres
Publié: (2024)
End-to-End Diarization utilizing Attractor Deep Clustering
par: Palzer, David, et autres
Publié: (2025)
par: Palzer, David, et autres
Publié: (2025)
VoxCog: Towards End-to-End Multilingual Cognitive Impairment Classification through Dialectal Knowledge
par: Feng, Tiantian, et autres
Publié: (2026)
par: Feng, Tiantian, et autres
Publié: (2026)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)
par: Yamashita, Natsuo, et autres
Publié: (2024)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
par: Lin, Wan, et autres
Publié: (2024)
par: Lin, Wan, et autres
Publié: (2024)
CUSIDE-array: A Streaming Multi-Channel End-to-End Speech Recognition System with Realistic Evaluations
par: Kong, Xiangzhu, et autres
Publié: (2024)
par: Kong, Xiangzhu, et autres
Publié: (2024)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
par: Zhou, Junzuo, et autres
Publié: (2024)
par: Zhou, Junzuo, et autres
Publié: (2024)
URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models
par: Yan, Ruiqi, et autres
Publié: (2025)
par: Yan, Ruiqi, et autres
Publié: (2025)
SAFE-QAQ: End-to-End Slow-Thinking Audio-Text Fraud Detection via Reinforcement Learning
par: Wang, Peidong, et autres
Publié: (2026)
par: Wang, Peidong, et autres
Publié: (2026)
Documents similaires
-
StutterZero and StutterFormer: End-to-End Speech Conversion for Stuttering Transcription and Correction
par: Xu, Qianheng
Publié: (2025) -
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024) -
An Audio-textual Diffusion Model For Converting Speech Signals Into Ultrasound Tongue Imaging Data
par: Yang, Yudong, et autres
Publié: (2024) -
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024) -
Magnitude and Phase-based Feature Fusion Using Co-attention Mechanism for Speaker recognition
par: Su, Rongfeng, et autres
Publié: (2025)