A Frequency-aware Augmentation Network for Mental Disorders Assessment from Audio
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Shuanglin, Song, Siyang, Nair, Rajesh, Naqvi, Syed Mohsen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient Long Speech Sequence Modelling for Time-Domain Depression Level Estimation
por: Li, Shuanglin, et al.
Publicado: (2025)
por: Li, Shuanglin, et al.
Publicado: (2025)
Frequency-aware convolution for sound event detection
por: Song, Tao, et al.
Publicado: (2024)
por: Song, Tao, et al.
Publicado: (2024)
ALDAS: Audio-Linguistic Data Augmentation for Spoofed Audio Detection
por: Khanjani, Zahra, et al.
Publicado: (2024)
por: Khanjani, Zahra, et al.
Publicado: (2024)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Listening for Expert Identified Linguistic Features: Assessment of Audio Deepfake Discernment among Undergraduate Students
por: Bhalli, Noshaba N., et al.
Publicado: (2024)
por: Bhalli, Noshaba N., et al.
Publicado: (2024)
Towards Neural Audio Codec Source Parsing
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation
por: Feng, Tao, et al.
Publicado: (2025)
por: Feng, Tao, et al.
Publicado: (2025)
Audio Inpainting in Time-Frequency Domain with Phase-Aware Prior
por: Balušík, Peter, et al.
Publicado: (2026)
por: Balušík, Peter, et al.
Publicado: (2026)
Evaluating Text-to-Speech Synthesis from a Large Discrete Token-based Speech Language Model
por: Wang, Siyang, et al.
Publicado: (2024)
por: Wang, Siyang, et al.
Publicado: (2024)
BWSNet: Automatic Perceptual Assessment of Audio Signals
por: Veillon, Clément Le Moine, et al.
Publicado: (2023)
por: Veillon, Clément Le Moine, et al.
Publicado: (2023)
AVR: Synergizing Foundation Models for Audio-Visual Humor Detection
por: Sharma, Sarthak, et al.
Publicado: (2024)
por: Sharma, Sarthak, et al.
Publicado: (2024)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
por: Chen, Wenxi, et al.
Publicado: (2024)
por: Chen, Wenxi, et al.
Publicado: (2024)
Combining Audio and Non-Audio Inputs in Evolved Neural Networks for Ovenbird
por: Hernandez, Sergio Poo, et al.
Publicado: (2025)
por: Hernandez, Sergio Poo, et al.
Publicado: (2025)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
por: Wu, Shih-Lun, et al.
Publicado: (2023)
por: Wu, Shih-Lun, et al.
Publicado: (2023)
Generalizable Audio Deepfake Detection via Latent Space Refinement and Augmentation
por: Huang, Wen, et al.
Publicado: (2025)
por: Huang, Wen, et al.
Publicado: (2025)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
por: Kumar, Sonal, et al.
Publicado: (2024)
por: Kumar, Sonal, et al.
Publicado: (2024)
Comparative Analysis of Mel-Frequency Cepstral Coefficients and Wavelet Based Audio Signal Processing for Emotion Detection and Mental Health Assessment in Spoken Speech
por: Agbo, Idoko, et al.
Publicado: (2024)
por: Agbo, Idoko, et al.
Publicado: (2024)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
por: Lin, Jingru, et al.
Publicado: (2026)
por: Lin, Jingru, et al.
Publicado: (2026)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
por: Zhao, Xiaohan, et al.
Publicado: (2025)
por: Zhao, Xiaohan, et al.
Publicado: (2025)
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
por: Wu, Yusong, et al.
Publicado: (2022)
por: Wu, Yusong, et al.
Publicado: (2022)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
SemanticAudio: Audio Generation and Editing in Semantic Space
por: Dai, Zheqi, et al.
Publicado: (2026)
por: Dai, Zheqi, et al.
Publicado: (2026)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
por: Li, Chenxing, et al.
Publicado: (2024)
por: Li, Chenxing, et al.
Publicado: (2024)
Enhancing Generalization in Audio Deepfake Detection: A Neural Collapse based Sampling and Training Approach
por: Yousif, Mohammed, et al.
Publicado: (2024)
por: Yousif, Mohammed, et al.
Publicado: (2024)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
Lightweight Implicit Neural Network for Binaural Audio Synthesis
por: Lu, Xikun, et al.
Publicado: (2025)
por: Lu, Xikun, et al.
Publicado: (2025)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
por: Pierotti, Francesco, et al.
Publicado: (2025)
por: Pierotti, Francesco, et al.
Publicado: (2025)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
QuarkAudio Technical Report
por: Liu, Chengwei, et al.
Publicado: (2025)
por: Liu, Chengwei, et al.
Publicado: (2025)
Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2025)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2025)
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
por: Sun, Haoqin, et al.
Publicado: (2025)
por: Sun, Haoqin, et al.
Publicado: (2025)
Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation
por: Yang, Mu, et al.
Publicado: (2024)
por: Yang, Mu, et al.
Publicado: (2024)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
por: Wang, Yucheng, et al.
Publicado: (2026)
por: Wang, Yucheng, et al.
Publicado: (2026)
DIVINE: Coordinating Multimodal Disentangled Representations for Oro-Facial Neurological Disorder Assessment
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
The ICME 2025 Audio Encoder Capability Challenge
por: Zhang, Junbo, et al.
Publicado: (2025)
por: Zhang, Junbo, et al.
Publicado: (2025)
Network Modulation Synthesis: New Algorithms for Generating Musical Audio Using Autoencoder Networks
por: Hyrkas, Jeremy
Publicado: (2021)
por: Hyrkas, Jeremy
Publicado: (2021)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
TF-Mamba: A Time-Frequency Network for Sound Source Localization
por: Xiao, Yang, et al.
Publicado: (2024)
por: Xiao, Yang, et al.
Publicado: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
Ejemplares similares
-
Efficient Long Speech Sequence Modelling for Time-Domain Depression Level Estimation
por: Li, Shuanglin, et al.
Publicado: (2025) -
Frequency-aware convolution for sound event detection
por: Song, Tao, et al.
Publicado: (2024) -
ALDAS: Audio-Linguistic Data Augmentation for Spoofed Audio Detection
por: Khanjani, Zahra, et al.
Publicado: (2024) -
PAM: Prompting Audio-Language Models for Audio Quality Assessment
por: Deshmukh, Soham, et al.
Publicado: (2024) -
Listening for Expert Identified Linguistic Features: Assessment of Audio Deepfake Discernment among Undergraduate Students
por: Bhalli, Noshaba N., et al.
Publicado: (2024)