Swin-BERT: A Feature Fusion System designed for Speech-based Alzheimer's Dementia Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Yilin, Shi, Yanpei, Zhang, Yijia, Lu, Mingyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Optimizing Speech Multi-View Feature Fusion through Conditional Computation
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies
di: Wu, Chung-Wen, et al.
Pubblicazione: (2024)
di: Wu, Chung-Wen, et al.
Pubblicazione: (2024)
Temporal-Aware Iterative Speech Model for Dementia Detection
di: Ugwu, Chukwuemeka, et al.
Pubblicazione: (2025)
di: Ugwu, Chukwuemeka, et al.
Pubblicazione: (2025)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
di: Siriwardhana, Shamane, et al.
Pubblicazione: (2020)
di: Siriwardhana, Shamane, et al.
Pubblicazione: (2020)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
Self-supervised Speech Models for Word-Level Stuttered Speech Detection
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
AudioBERT: Audio Knowledge Augmented Language Model
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation
di: Le, Chenyang, et al.
Pubblicazione: (2024)
di: Le, Chenyang, et al.
Pubblicazione: (2024)
Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2025)
di: Shi, Hao, et al.
Pubblicazione: (2025)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
di: Choi, Yerin, et al.
Pubblicazione: (2024)
di: Choi, Yerin, et al.
Pubblicazione: (2024)
An Investigation Into Explainable Audio Hate Speech Detection
di: An, Jinmyeong, et al.
Pubblicazione: (2024)
di: An, Jinmyeong, et al.
Pubblicazione: (2024)
QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
di: Wang, Siyin, et al.
Pubblicazione: (2025)
di: Wang, Siyin, et al.
Pubblicazione: (2025)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
di: Ahn, Hyebin, et al.
Pubblicazione: (2025)
di: Ahn, Hyebin, et al.
Pubblicazione: (2025)
Phoneme-Level Feature Discrepancies: A Key to Detecting Sophisticated Speech Deepfakes
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2024)
Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time
di: Seide, Frank, et al.
Pubblicazione: (2024)
di: Seide, Frank, et al.
Pubblicazione: (2024)
Bimodal Connection Attention Fusion for Speech Emotion Recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
Real-Time Speech Enhancement via a Hybrid ViT: A Dual-Input Acoustic-Image Feature Fusion
di: Bahmei, Behnaz, et al.
Pubblicazione: (2025)
di: Bahmei, Behnaz, et al.
Pubblicazione: (2025)
Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-trained BERT
di: Dai, Dongyang, et al.
Pubblicazione: (2025)
di: Dai, Dongyang, et al.
Pubblicazione: (2025)
A Benchmark for Early-stage Parkinson's Disease Detection from Speech
di: Zhong, Terry Yi, et al.
Pubblicazione: (2026)
di: Zhong, Terry Yi, et al.
Pubblicazione: (2026)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
di: Li, Yuxin, et al.
Pubblicazione: (2025)
di: Li, Yuxin, et al.
Pubblicazione: (2025)
Improving Child Speech Recognition and Reading Mistake Detection by Using Prompts
di: Gao, Lingyun, et al.
Pubblicazione: (2025)
di: Gao, Lingyun, et al.
Pubblicazione: (2025)
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
di: Wen, Bin, et al.
Pubblicazione: (2025)
di: Wen, Bin, et al.
Pubblicazione: (2025)
Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder
di: Dai, Yusheng, et al.
Pubblicazione: (2023)
di: Dai, Yusheng, et al.
Pubblicazione: (2023)
Dynamic Stress Detection: A Study of Temporal Progression Modelling of Stress in Speech
di: Lall, Vishakha, et al.
Pubblicazione: (2025)
di: Lall, Vishakha, et al.
Pubblicazione: (2025)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
Device-Directed Speech Detection for Follow-up Conversations Using Large Language Models
di: Ognjen, et al.
Pubblicazione: (2024)
di: Ognjen, et al.
Pubblicazione: (2024)
A Chinese Heart Failure Status Speech Database with Universal and Personalised Classification
di: Pan, Yue, et al.
Pubblicazione: (2025)
di: Pan, Yue, et al.
Pubblicazione: (2025)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
How "Real" is Your Real-Time Simultaneous Speech-to-Text Translation System?
di: Papi, Sara, et al.
Pubblicazione: (2024)
di: Papi, Sara, et al.
Pubblicazione: (2024)
Improved Contextual Recognition In Automatic Speech Recognition Systems By Semantic Lattice Rescoring
di: Sudarshan, Ankitha, et al.
Pubblicazione: (2023)
di: Sudarshan, Ankitha, et al.
Pubblicazione: (2023)
SeamlessExpressiveLM: Speech Language Model for Expressive Speech-to-Speech Translation with Chain-of-Thought
di: Gong, Hongyu, et al.
Pubblicazione: (2024)
di: Gong, Hongyu, et al.
Pubblicazione: (2024)
Streaming Speaker Change Detection and Gender Classification for Transducer-Based Multi-Talker Speech Translation
di: Wang, Peidong, et al.
Pubblicazione: (2025)
di: Wang, Peidong, et al.
Pubblicazione: (2025)
Towards Robust Speech Representation Learning for Thousands of Languages
di: Chen, William, et al.
Pubblicazione: (2024)
di: Chen, William, et al.
Pubblicazione: (2024)
Towards Quantifying and Reducing Language Mismatch Effects in Cross-Lingual Speech Anti-Spoofing
di: Liu, Tianchi, et al.
Pubblicazione: (2024)
di: Liu, Tianchi, et al.
Pubblicazione: (2024)
SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation
di: Yu, Wenyi, et al.
Pubblicazione: (2024)
di: Yu, Wenyi, et al.
Pubblicazione: (2024)
Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Optimizing Speech Multi-View Feature Fusion through Conditional Computation
di: Shan, Weiqiao, et al.
Pubblicazione: (2025) -
Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies
di: Wu, Chung-Wen, et al.
Pubblicazione: (2024) -
Temporal-Aware Iterative Speech Model for Dementia Detection
di: Ugwu, Chukwuemeka, et al.
Pubblicazione: (2025) -
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025) -
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
di: Siriwardhana, Shamane, et al.
Pubblicazione: (2020)