Density Adaptive Attention-based Speech Network: Enhancing Feature Understanding for Mental Health Disorders
Fuente:
arXiv
Guardado en:
| Autores principales: | Ioannides, Georgios, Kieback, Adrian, Chadha, Aman, Elkins, Aaron |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Density Adaptive Attention is All You Need: Robust Parameter-Efficient Fine-Tuning Across Multiple Modalities
por: Ioannides, Georgios, et al.
Publicado: (2024)
por: Ioannides, Georgios, et al.
Publicado: (2024)
JEPA as a Neural Tokenizer: Learning Robust Speech Representations with Density Adaptive Attention
por: Ioannides, Georgios, et al.
Publicado: (2025)
por: Ioannides, Georgios, et al.
Publicado: (2025)
Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures
por: Ioannides, Georgios, et al.
Publicado: (2026)
por: Ioannides, Georgios, et al.
Publicado: (2026)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
por: Choi, Yerin, et al.
Publicado: (2024)
por: Choi, Yerin, et al.
Publicado: (2024)
Improved Contextual Recognition In Automatic Speech Recognition Systems By Semantic Lattice Rescoring
por: Sudarshan, Ankitha, et al.
Publicado: (2023)
por: Sudarshan, Ankitha, et al.
Publicado: (2023)
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
por: Wang, Cong, et al.
Publicado: (2025)
por: Wang, Cong, et al.
Publicado: (2025)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
por: Lau, Hok-Shing, et al.
Publicado: (2024)
por: Lau, Hok-Shing, et al.
Publicado: (2024)
Improving speaker verification robustness with synthetic emotional utterances
por: Koditala, Nikhil Kumar, et al.
Publicado: (2024)
por: Koditala, Nikhil Kumar, et al.
Publicado: (2024)
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
por: Jiao, Xinxin, et al.
Publicado: (2024)
por: Jiao, Xinxin, et al.
Publicado: (2024)
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
por: Cao, Yubing, et al.
Publicado: (2025)
por: Cao, Yubing, et al.
Publicado: (2025)
Facial Expression-Enhanced TTS: Combining Face Representation and Emotion Intensity for Adaptive Speech
por: Chu, Yunji, et al.
Publicado: (2024)
por: Chu, Yunji, et al.
Publicado: (2024)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
por: Hyeon, Jonghwan, et al.
Publicado: (2024)
por: Hyeon, Jonghwan, et al.
Publicado: (2024)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
A Frequency-aware Augmentation Network for Mental Disorders Assessment from Audio
por: Li, Shuanglin, et al.
Publicado: (2025)
por: Li, Shuanglin, et al.
Publicado: (2025)
MambAttention: Mamba with Multi-Head Attention for Generalizable Single-Channel Speech Enhancement
por: Kühne, Nikolai Lund, et al.
Publicado: (2025)
por: Kühne, Nikolai Lund, et al.
Publicado: (2025)
Searching for Effective Preprocessing Method and CNN-based Architecture with Efficient Channel Attention on Speech Emotion Recognition
por: Kim, Byunggun, et al.
Publicado: (2024)
por: Kim, Byunggun, et al.
Publicado: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
Adaptive Duration Model for Text Speech Alignment
por: Cao, Junjie
Publicado: (2025)
por: Cao, Junjie
Publicado: (2025)
DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis
por: Gu, Yu, et al.
Publicado: (2024)
por: Gu, Yu, et al.
Publicado: (2024)
Perceiver-Prompt: Flexible Speaker Adaptation in Whisper for Chinese Disordered Speech Recognition
por: Jiang, Yicong, et al.
Publicado: (2024)
por: Jiang, Yicong, et al.
Publicado: (2024)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
por: Lemerle, Théodor, et al.
Publicado: (2024)
por: Lemerle, Théodor, et al.
Publicado: (2024)
Adaptive Convolution for CNN-based Speech Enhancement Models
por: Wang, Dahan, et al.
Publicado: (2025)
por: Wang, Dahan, et al.
Publicado: (2025)
Adaptive Knowledge Distillation for Device-Directed Speech Detection
por: Chi, Hyung Gun, et al.
Publicado: (2025)
por: Chi, Hyung Gun, et al.
Publicado: (2025)
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
AASIST3: KAN-Enhanced AASIST Speech Deepfake Detection using SSL Features and Additional Regularization for the ASVspoof 2024 Challenge
por: Borodin, Kirill, et al.
Publicado: (2024)
por: Borodin, Kirill, et al.
Publicado: (2024)
Toward Efficient Speech Emotion Recognition via Spectral Learning and Attention
por: Lee, HyeYoung, et al.
Publicado: (2025)
por: Lee, HyeYoung, et al.
Publicado: (2025)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
por: Lee, Seo-Hyun, et al.
Publicado: (2023)
por: Lee, Seo-Hyun, et al.
Publicado: (2023)
Articulatory Feature Prediction from Surface EMG during Speech Production
por: Lee, Jihwan, et al.
Publicado: (2025)
por: Lee, Jihwan, et al.
Publicado: (2025)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
por: Hu, Shujie, et al.
Publicado: (2024)
por: Hu, Shujie, et al.
Publicado: (2024)
Attention-based Interactive Disentangling Network for Instance-level Emotional Voice Conversion
por: Chen, Yun, et al.
Publicado: (2023)
por: Chen, Yun, et al.
Publicado: (2023)
Do we really need Self-Attention for Streaming Automatic Speech Recognition?
por: Dkhissi, Youness, et al.
Publicado: (2026)
por: Dkhissi, Youness, et al.
Publicado: (2026)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2024)
por: Truong, Duc-Tuan, et al.
Publicado: (2024)
Enhancing Infant Crying Detection with Gradient Boosting for Improved Emotional and Mental Health Diagnostics
por: Lee, Kyunghun, et al.
Publicado: (2024)
por: Lee, Kyunghun, et al.
Publicado: (2024)
Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech
por: He, Shuwei, et al.
Publicado: (2024)
por: He, Shuwei, et al.
Publicado: (2024)
MEBM-Speech: Multi-scale Enhanced BrainMagic for Robust MEG Speech Detection
por: Songyi, Li, et al.
Publicado: (2026)
por: Songyi, Li, et al.
Publicado: (2026)
Phoneme-Level Feature Discrepancies: A Key to Detecting Sophisticated Speech Deepfakes
por: Zhang, Kuiyuan, et al.
Publicado: (2024)
por: Zhang, Kuiyuan, et al.
Publicado: (2024)
Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation
por: Chen, Guo, et al.
Publicado: (2025)
por: Chen, Guo, et al.
Publicado: (2025)
DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis
por: Li, Yingahao Aaron, et al.
Publicado: (2024)
por: Li, Yingahao Aaron, et al.
Publicado: (2024)
CAMEL: Cross-Attention Enhanced Mixture-of-Experts and Language Bias for Code-Switching Speech Recognition
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
por: Ahasan, Md Mubtasim, et al.
Publicado: (2024)
por: Ahasan, Md Mubtasim, et al.
Publicado: (2024)
Ejemplares similares
-
Density Adaptive Attention is All You Need: Robust Parameter-Efficient Fine-Tuning Across Multiple Modalities
por: Ioannides, Georgios, et al.
Publicado: (2024) -
JEPA as a Neural Tokenizer: Learning Robust Speech Representations with Density Adaptive Attention
por: Ioannides, Georgios, et al.
Publicado: (2025) -
Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures
por: Ioannides, Georgios, et al.
Publicado: (2026) -
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
por: Choi, Yerin, et al.
Publicado: (2024) -
Improved Contextual Recognition In Automatic Speech Recognition Systems By Semantic Lattice Rescoring
por: Sudarshan, Ankitha, et al.
Publicado: (2023)