Phase-Aware Deep Learning with Complex-Valued CNNs for Audio Signal Applications
Fuente:
arXiv
Salvato in:
| Autore principale: | Agrawal, Naman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals
di: Saky, S M Asiful Islam, et al.
Pubblicazione: (2025)
di: Saky, S M Asiful Islam, et al.
Pubblicazione: (2025)
Preference-Based Learning in Audio Applications: A Systematic Analysis
di: Broukhim, Aaron, et al.
Pubblicazione: (2025)
di: Broukhim, Aaron, et al.
Pubblicazione: (2025)
Evaluation of Deep Audio Representations for Hearables
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
AudioMosaic: Contrastive Masked Audio Representation Learning
di: Huang, Hanxun, et al.
Pubblicazione: (2026)
di: Huang, Hanxun, et al.
Pubblicazione: (2026)
A Human-Inspired Decoupled Architecture for Efficient Audio Representation Learning
di: Kawano, Harunori, et al.
Pubblicazione: (2026)
di: Kawano, Harunori, et al.
Pubblicazione: (2026)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
di: Wang, Lu, et al.
Pubblicazione: (2025)
di: Wang, Lu, et al.
Pubblicazione: (2025)
SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction
di: Agrawal, Saurabh, et al.
Pubblicazione: (2025)
di: Agrawal, Saurabh, et al.
Pubblicazione: (2025)
A Survey of Deep Learning Audio Generation Methods
di: Božić, Matej, et al.
Pubblicazione: (2024)
di: Božić, Matej, et al.
Pubblicazione: (2024)
Boosting ASR Robustness via Test-Time Reinforcement Learning with Audio-Text Semantic Rewards
di: Fang, Linghan, et al.
Pubblicazione: (2026)
di: Fang, Linghan, et al.
Pubblicazione: (2026)
Representation-Based Data Quality Audits for Audio
di: Gonzalez-Jimenez, Alvaro, et al.
Pubblicazione: (2025)
di: Gonzalez-Jimenez, Alvaro, et al.
Pubblicazione: (2025)
Structured-Noise Masked Modeling for Video, Audio and Beyond
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
Low-Resource Guidance for Controllable Latent Audio Diffusion
di: Novack, Zachary, et al.
Pubblicazione: (2026)
di: Novack, Zachary, et al.
Pubblicazione: (2026)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
di: Paissan, Francesco, et al.
Pubblicazione: (2026)
di: Paissan, Francesco, et al.
Pubblicazione: (2026)
Linguistic and Audio Embedding-Based Machine Learning for Alzheimer's Dementia and Mild Cognitive Impairment Detection: Insights from the PROCESS Challenge
di: Devahi, Adharsha Sam Edwin Sam, et al.
Pubblicazione: (2025)
di: Devahi, Adharsha Sam Edwin Sam, et al.
Pubblicazione: (2025)
AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds
di: Wang, Qizhou, et al.
Pubblicazione: (2025)
di: Wang, Qizhou, et al.
Pubblicazione: (2025)
When Denoising Hinders: Revisiting Zero-Shot ASR with SAM-Audio and Whisper
di: Islam, Akif, et al.
Pubblicazione: (2026)
di: Islam, Akif, et al.
Pubblicazione: (2026)
Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features
di: Saurav, Kumar
Pubblicazione: (2026)
di: Saurav, Kumar
Pubblicazione: (2026)
A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model
di: Hu, Xiaolin, et al.
Pubblicazione: (2026)
di: Hu, Xiaolin, et al.
Pubblicazione: (2026)
Dynamic HumTrans: Humming Transcription Using CNNs and Dynamic Programming
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
AUDRON: A Deep Learning Framework with Fused Acoustic Signatures for Drone Type Recognition
di: Chatterjee, Rajdeep, et al.
Pubblicazione: (2025)
di: Chatterjee, Rajdeep, et al.
Pubblicazione: (2025)
QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems
di: Wang, Chien-Chun, et al.
Pubblicazione: (2025)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2025)
Unsupervised Evaluation of Deep Audio Embeddings for Music Structure Analysis
di: Marmoret, Axel
Pubblicazione: (2026)
di: Marmoret, Axel
Pubblicazione: (2026)
DOA-Aware Audio-Visual Self-Supervised Learning for Sound Event Localization and Detection
di: Fujita, Yoto, et al.
Pubblicazione: (2024)
di: Fujita, Yoto, et al.
Pubblicazione: (2024)
Learning When to Think While Listening in Large Audio-Language Models
di: Song, Zhiyuan, et al.
Pubblicazione: (2026)
di: Song, Zhiyuan, et al.
Pubblicazione: (2026)
Two-Dimensional Quantization for Geometry-Aware Audio Coding
di: Shuster, Tal, et al.
Pubblicazione: (2025)
di: Shuster, Tal, et al.
Pubblicazione: (2025)
Learning Source Disentanglement in Neural Audio Codec
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
aTENNuate: Optimized Real-time Speech Enhancement with Deep SSMs on Raw Audio
di: Pei, Yan Ru, et al.
Pubblicazione: (2024)
di: Pei, Yan Ru, et al.
Pubblicazione: (2024)
Guiding Audio Editing with Audio Language Model
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
MAEB: Massive Audio Embedding Benchmark
di: Assadi, Adnan El, et al.
Pubblicazione: (2026)
di: Assadi, Adnan El, et al.
Pubblicazione: (2026)
Geometry-Aware Optimization for Respiratory Sound Classification: Enhancing Sensitivity with SAM-Optimized Audio Spectrogram Transformers
di: Işık, Atakan, et al.
Pubblicazione: (2025)
di: Işık, Atakan, et al.
Pubblicazione: (2025)
Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization
di: Torres, Bernardo, et al.
Pubblicazione: (2025)
di: Torres, Bernardo, et al.
Pubblicazione: (2025)
Understanding Pedestrian Movement Using Urban Sensing Technologies: The Promise of Audio-based Sensors
di: Han, Chaeyeon, et al.
Pubblicazione: (2024)
di: Han, Chaeyeon, et al.
Pubblicazione: (2024)
Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
Synthetic Audio Helps for Cognitive State Tasks
di: Soubki, Adil, et al.
Pubblicazione: (2025)
di: Soubki, Adil, et al.
Pubblicazione: (2025)
AudioGenX: Explainability on Text-to-Audio Generative Models
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
FISHER: A Foundation Model for Multi-Modal Industrial Signal Comprehensive Representation
di: Fan, Pingyi, et al.
Pubblicazione: (2025)
di: Fan, Pingyi, et al.
Pubblicazione: (2025)
Learning Relationships Between Separate Audio Tracks for Creative Applications
di: Bujard, Balthazar, et al.
Pubblicazione: (2025)
di: Bujard, Balthazar, et al.
Pubblicazione: (2025)
Linear Complexity Self-Supervised Learning for Music Understanding with Random Quantizer
di: Vavaroutsos, Petros, et al.
Pubblicazione: (2026)
di: Vavaroutsos, Petros, et al.
Pubblicazione: (2026)
Quantifying Multimodal Imbalance: A GMM-Guided Adaptive Loss for Audio-Visual Learning
di: Liu, Zhaocheng, et al.
Pubblicazione: (2025)
di: Liu, Zhaocheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals
di: Saky, S M Asiful Islam, et al.
Pubblicazione: (2025) -
Preference-Based Learning in Audio Applications: A Systematic Analysis
di: Broukhim, Aaron, et al.
Pubblicazione: (2025) -
Evaluation of Deep Audio Representations for Hearables
di: Gröger, Fabian, et al.
Pubblicazione: (2025) -
AudioMosaic: Contrastive Masked Audio Representation Learning
di: Huang, Hanxun, et al.
Pubblicazione: (2026) -
A Human-Inspired Decoupled Architecture for Efficient Audio Representation Learning
di: Kawano, Harunori, et al.
Pubblicazione: (2026)