Enhancing and Exploring Mild Cognitive Impairment Detection with W2V-BERT-2.0
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yueguan, Matsushima, Tatsunari, Matsushima, Soichiro, Sakai, Toshimitsu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Iterative refinement, not training objective, makes HuBERT behave differently from wav2vec 2.0
par: Huo, Robin, et autres
Publié: (2025)
par: Huo, Robin, et autres
Publié: (2025)
Analyzing Multimodal Features of Spontaneous Voice Assistant Commands for Mild Cognitive Impairment Detection
par: Lin, Nana, et autres
Publié: (2024)
par: Lin, Nana, et autres
Publié: (2024)
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
par: Bayerl, Sebastian P., et autres
Publié: (2022)
par: Bayerl, Sebastian P., et autres
Publié: (2022)
The Voice of Equity: A Systematic Evaluation of Bias Mitigation Techniques for Speech-Based Cognitive Impairment Detection Across Architectures and Demographics
par: Haghbin, Yasaman, et autres
Publié: (2026)
par: Haghbin, Yasaman, et autres
Publié: (2026)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
par: Nie, Yuting, et autres
Publié: (2022)
par: Nie, Yuting, et autres
Publié: (2022)
Automatic classification of stop realisation with wav2vec2.0
par: Tanner, James, et autres
Publié: (2025)
par: Tanner, James, et autres
Publié: (2025)
mHuBERT-147: A Compact Multilingual HuBERT Model
par: Boito, Marcely Zanon, et autres
Publié: (2024)
par: Boito, Marcely Zanon, et autres
Publié: (2024)
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
par: Yoon, Ji Won, et autres
Publié: (2022)
par: Yoon, Ji Won, et autres
Publié: (2022)
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
par: Grossman, Raymond, et autres
Publié: (2025)
par: Grossman, Raymond, et autres
Publié: (2025)
Comparative Evaluation of Expressive Japanese Character Text-to-Speech with VITS and Style-BERT-VITS2
par: Rackauckas, Zackary, et autres
Publié: (2025)
par: Rackauckas, Zackary, et autres
Publié: (2025)
Enhancing Speaker Verification with w2v-BERT 2.0 and Knowledge Distillation guided Structured Pruning
par: Li, Ze, et autres
Publié: (2025)
par: Li, Ze, et autres
Publié: (2025)
Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages
par: Anidjar, Or Haim, et autres
Publié: (2024)
par: Anidjar, Or Haim, et autres
Publié: (2024)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
par: Wang, Qingzheng, et autres
Publié: (2025)
par: Wang, Qingzheng, et autres
Publié: (2025)
Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice
par: Cheng, Shanbo, et autres
Publié: (2025)
par: Cheng, Shanbo, et autres
Publié: (2025)
Self-Supervised Syllable Discovery Based on Speaker-Disentangled HuBERT
par: Komatsu, Ryota, et autres
Publié: (2024)
par: Komatsu, Ryota, et autres
Publié: (2024)
AfriHuBERT: A self-supervised speech representation model for African languages
par: Alabi, Jesujoba O., et autres
Publié: (2024)
par: Alabi, Jesujoba O., et autres
Publié: (2024)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
par: Yamauchi, Kazuki, et autres
Publié: (2024)
par: Yamauchi, Kazuki, et autres
Publié: (2024)
Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM
par: Shahin, Mostafa, et autres
Publié: (2025)
par: Shahin, Mostafa, et autres
Publié: (2025)
MTP-S2UT: Enhancing Speech-to-Speech Translation Quality with Multi-token Prediction
par: Wang, Jianjin, et autres
Publié: (2025)
par: Wang, Jianjin, et autres
Publié: (2025)
MelHuBERT: A simplified HuBERT on Mel spectrograms
par: Lin, Tzu-Quan, et autres
Publié: (2022)
par: Lin, Tzu-Quan, et autres
Publié: (2022)
LeBenchmark 2.0: a Standardized, Replicable and Enhanced Framework for Self-supervised Representations of French Speech
par: Parcollet, Titouan, et autres
Publié: (2023)
par: Parcollet, Titouan, et autres
Publié: (2023)
Exploring SSL Discrete Tokens for Multilingual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study
par: Min, Zeping, et autres
Publié: (2023)
par: Min, Zeping, et autres
Publié: (2023)
Tackling Cognitive Impairment Detection from Speech: A submission to the PROCESS Challenge
par: Botelho, Catarina, et autres
Publié: (2024)
par: Botelho, Catarina, et autres
Publié: (2024)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
par: Cheng, Yao-Fei, et autres
Publié: (2024)
par: Cheng, Yao-Fei, et autres
Publié: (2024)
Exploring the Potential of Large Multimodal Models as Effective Alternatives for Pronunciation Assessment
par: Wang, Ke, et autres
Publié: (2025)
par: Wang, Ke, et autres
Publié: (2025)
Swin-BERT: A Feature Fusion System designed for Speech-based Alzheimer's Dementia Detection
par: Pan, Yilin, et autres
Publié: (2024)
par: Pan, Yilin, et autres
Publié: (2024)
Pitch-Aware RNN-T for Mandarin Chinese Mispronunciation Detection and Diagnosis
par: Wang, Xintong, et autres
Publié: (2024)
par: Wang, Xintong, et autres
Publié: (2024)
Mispronunciation Detection Without L2 Pronunciation Dataset in Low-Resource Setting: A Case Study in Finland Swedish
par: Phan, Nhan, et autres
Publié: (2025)
par: Phan, Nhan, et autres
Publié: (2025)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022)
par: Wang, Yujin, et autres
Publié: (2022)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Exploring the Benefits of Tokenization of Discrete Acoustic Units
par: Dekel, Avihu, et autres
Publié: (2024)
par: Dekel, Avihu, et autres
Publié: (2024)
CPT-Boosted Wav2vec2.0: Towards Noise Robust Speech Recognition for Classroom Environments
par: Attia, Ahmed Adel, et autres
Publié: (2024)
par: Attia, Ahmed Adel, et autres
Publié: (2024)
Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR
par: Wang, Zilai, et autres
Publié: (2026)
par: Wang, Zilai, et autres
Publié: (2026)
Exploring Gender Disparities in Automatic Speech Recognition Technology
par: ElGhazaly, Hend, et autres
Publié: (2025)
par: ElGhazaly, Hend, et autres
Publié: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
par: Liu, Jizhong, et autres
Publié: (2024)
par: Liu, Jizhong, et autres
Publié: (2024)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
par: Wang, Xuechen, et autres
Publié: (2024)
par: Wang, Xuechen, et autres
Publié: (2024)
Detecting the Undetectable: Assessing the Efficacy of Current Spoof Detection Methods Against Seamless Speech Edits
par: Huang, Sung-Feng, et autres
Publié: (2025)
par: Huang, Sung-Feng, et autres
Publié: (2025)
Phonetic and Lexical Discovery of a Canine Language using HuBERT
par: Li, Xingyuan, et autres
Publié: (2024)
par: Li, Xingyuan, et autres
Publié: (2024)
Documents similaires
-
Iterative refinement, not training objective, makes HuBERT behave differently from wav2vec 2.0
par: Huo, Robin, et autres
Publié: (2025) -
Analyzing Multimodal Features of Spontaneous Voice Assistant Commands for Mild Cognitive Impairment Detection
par: Lin, Nana, et autres
Publié: (2024) -
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
par: Bayerl, Sebastian P., et autres
Publié: (2022) -
The Voice of Equity: A Systematic Evaluation of Bias Mitigation Techniques for Speech-Based Cognitive Impairment Detection Across Architectures and Demographics
par: Haghbin, Yasaman, et autres
Publié: (2026) -
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
par: Nie, Yuting, et autres
Publié: (2022)