Temporal-Aware Iterative Speech Model for Dementia Detection
Fuente:
arXiv
Guardado en:
| Autores principales: | Ugwu, Chukwuemeka, Oyeleke, Oluwafemi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2024)
por: Truong, Duc-Tuan, et al.
Publicado: (2024)
EchoFake: A Replay-Aware Dataset for Practical Speech Deepfake Detection
por: Zhang, Tong, et al.
Publicado: (2025)
por: Zhang, Tong, et al.
Publicado: (2025)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024)
por: Qi, Xin, et al.
Publicado: (2024)
Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate
por: Zhang, Hanglei, et al.
Publicado: (2025)
por: Zhang, Hanglei, et al.
Publicado: (2025)
WhisperD: Dementia Speech Recognition and Filler Word Detection with Whisper
por: Akinrintoyo, Emmanuel, et al.
Publicado: (2025)
por: Akinrintoyo, Emmanuel, et al.
Publicado: (2025)
Stage-Wise and Prior-Aware Neural Speech Phase Prediction
por: Liu, Fei, et al.
Publicado: (2024)
por: Liu, Fei, et al.
Publicado: (2024)
FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation
por: Lee, Junseok, et al.
Publicado: (2026)
por: Lee, Junseok, et al.
Publicado: (2026)
MEBM-Speech: Multi-scale Enhanced BrainMagic for Robust MEG Speech Detection
por: Songyi, Li, et al.
Publicado: (2026)
por: Songyi, Li, et al.
Publicado: (2026)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
por: Kang, Jiawen, et al.
Publicado: (2024)
por: Kang, Jiawen, et al.
Publicado: (2024)
Temporal Information Reconstruction and Non-Aligned Residual in Spiking Neural Networks for Speech Classification
por: Zhang, Qi, et al.
Publicado: (2024)
por: Zhang, Qi, et al.
Publicado: (2024)
Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models
por: Kabir, Muhammad Ashad, et al.
Publicado: (2026)
por: Kabir, Muhammad Ashad, et al.
Publicado: (2026)
Adaptive Knowledge Distillation for Device-Directed Speech Detection
por: Chi, Hyung Gun, et al.
Publicado: (2025)
por: Chi, Hyung Gun, et al.
Publicado: (2025)
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild
por: Jung, Jee-weon, et al.
Publicado: (2024)
por: Jung, Jee-weon, et al.
Publicado: (2024)
Leveraging Mixture of Experts for Improved Speech Deepfake Detection
por: Negroni, Viola, et al.
Publicado: (2024)
por: Negroni, Viola, et al.
Publicado: (2024)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
por: Lau, Hok-Shing, et al.
Publicado: (2024)
por: Lau, Hok-Shing, et al.
Publicado: (2024)
Speech Foundation Model Ensembles for the Controlled Singing Voice Deepfake Detection (CtrSVDD) Challenge 2024
por: Guragain, Anmol, et al.
Publicado: (2024)
por: Guragain, Anmol, et al.
Publicado: (2024)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
por: Zhang, Jinming, et al.
Publicado: (2025)
por: Zhang, Jinming, et al.
Publicado: (2025)
Audio Deepfake Detection in the Age of Advanced Text-to-Speech models
por: Singh, Robin, et al.
Publicado: (2026)
por: Singh, Robin, et al.
Publicado: (2026)
Meta-Learning Approaches for Improving Detection of Unseen Speech Deepfakes
por: Kukanov, Ivan, et al.
Publicado: (2024)
por: Kukanov, Ivan, et al.
Publicado: (2024)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
por: Zhou, Xuanru, et al.
Publicado: (2024)
por: Zhou, Xuanru, et al.
Publicado: (2024)
Dynamic Stress Detection: A Study of Temporal Progression Modelling of Stress in Speech
por: Lall, Vishakha, et al.
Publicado: (2025)
por: Lall, Vishakha, et al.
Publicado: (2025)
Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection
por: Wu, Jinyang, et al.
Publicado: (2026)
por: Wu, Jinyang, et al.
Publicado: (2026)
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
por: Shah, Neil, et al.
Publicado: (2024)
por: Shah, Neil, et al.
Publicado: (2024)
WavShape: Information-Theoretic Speech Representation Learning for Fair and Privacy-Aware Audio Processing
por: Baser, Oguzhan, et al.
Publicado: (2025)
por: Baser, Oguzhan, et al.
Publicado: (2025)
HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection
por: Li, Harrison, et al.
Publicado: (2026)
por: Li, Harrison, et al.
Publicado: (2026)
DSFlow: Dual Supervision and Step-Aware Architecture for One-Step Flow Matching Speech Synthesis
por: Lin, Bin, et al.
Publicado: (2026)
por: Lin, Bin, et al.
Publicado: (2026)
Swin-BERT: A Feature Fusion System designed for Speech-based Alzheimer's Dementia Detection
por: Pan, Yilin, et al.
Publicado: (2024)
por: Pan, Yilin, et al.
Publicado: (2024)
Improving Pretrained YAMNet for Enhanced Speech Command Detection via Transfer Learning
por: Lachenani, Sidahmed, et al.
Publicado: (2025)
por: Lachenani, Sidahmed, et al.
Publicado: (2025)
Phoneme-Level Feature Discrepancies: A Key to Detecting Sophisticated Speech Deepfakes
por: Zhang, Kuiyuan, et al.
Publicado: (2024)
por: Zhang, Kuiyuan, et al.
Publicado: (2024)
Adaptive Duration Model for Text Speech Alignment
por: Cao, Junjie
Publicado: (2025)
por: Cao, Junjie
Publicado: (2025)
Unveiling the Best Practices for Applying Speech Foundation Models to Speech Intelligibility Prediction for Hearing-Impaired People
por: Zhou, Haoshuai, et al.
Publicado: (2025)
por: Zhou, Haoshuai, et al.
Publicado: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
Defense Against Synthetic Speech: Real-Time Detection of RVC Voice Conversion Attacks
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025)
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025)
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
por: Bibbó, Gabriel, et al.
Publicado: (2024)
por: Bibbó, Gabriel, et al.
Publicado: (2024)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
por: Cao, Yubing, et al.
Publicado: (2025)
por: Cao, Yubing, et al.
Publicado: (2025)
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
por: Xu, Haoning, et al.
Publicado: (2025)
por: Xu, Haoning, et al.
Publicado: (2025)
Ejemplares similares
-
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2024) -
EchoFake: A Replay-Aware Dataset for Practical Speech Deepfake Detection
por: Zhang, Tong, et al.
Publicado: (2025) -
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024) -
Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate
por: Zhang, Hanglei, et al.
Publicado: (2025) -
WhisperD: Dementia Speech Recognition and Filler Word Detection with Whisper
por: Akinrintoyo, Emmanuel, et al.
Publicado: (2025)