Generative AI in Signal Processing Education: An Audio Foundation Model Based Approach
Fuente:
arXiv
Salvato in:
| Autori principali: | Khan, Muhammad Salman, Ullah, Ahmad, Latif, Siddique, Qadir, Junaid |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generative Deep Learning and Signal Processing for Data Augmentation of Cardiac Auscultation Signals: Improving Model Robustness Using Synthetic Audio
di: Abbott, Leigh, et al.
Pubblicazione: (2024)
di: Abbott, Leigh, et al.
Pubblicazione: (2024)
Beyond Identity: A Generalizable Approach for Deepfake Audio Detection
di: Ahmadiadli, Yasaman, et al.
Pubblicazione: (2025)
di: Ahmadiadli, Yasaman, et al.
Pubblicazione: (2025)
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
di: Meng, Hanyu, et al.
Pubblicazione: (2025)
di: Meng, Hanyu, et al.
Pubblicazione: (2025)
Transformers in Speech Processing: A Survey
di: Latif, Siddique, et al.
Pubblicazione: (2023)
di: Latif, Siddique, et al.
Pubblicazione: (2023)
AI-Driven Cardiorespiratory Signal Processing: Separation, Clustering, and Anomaly Detection
di: Torabi, Yasaman
Pubblicazione: (2026)
di: Torabi, Yasaman
Pubblicazione: (2026)
Frequency-Based Alignment of EEG and Audio Signals Using Contrastive Learning and SincNet for Auditory Attention Detection
di: Liao, Yuan, et al.
Pubblicazione: (2025)
di: Liao, Yuan, et al.
Pubblicazione: (2025)
Robust Fixed-Filter Sound Zone Control with Audio-Based Position Tracking
di: Bhattacharjee, Sankha Subhra, et al.
Pubblicazione: (2024)
di: Bhattacharjee, Sankha Subhra, et al.
Pubblicazione: (2024)
Sample Rate Independent Recurrent Neural Networks for Audio Effects Processing
di: Carson, Alistair, et al.
Pubblicazione: (2024)
di: Carson, Alistair, et al.
Pubblicazione: (2024)
Parameter-Efficient Fine-Tuning of Foundation Models for CLP Speech Classification
di: Bhattacharjee, Susmita, et al.
Pubblicazione: (2025)
di: Bhattacharjee, Susmita, et al.
Pubblicazione: (2025)
Microphone Array Signal Processing and Deep Learning for Speech Enhancement
di: Haeb-Umbach, Reinhold, et al.
Pubblicazione: (2025)
di: Haeb-Umbach, Reinhold, et al.
Pubblicazione: (2025)
SUNAC: Source-aware Unified Neural Audio Codec
di: Aihara, Ryo, et al.
Pubblicazione: (2025)
di: Aihara, Ryo, et al.
Pubblicazione: (2025)
Detection of manatee vocalisations using the Audio Spectrogram Transformer
di: Schiappacasse, Stefano, et al.
Pubblicazione: (2024)
di: Schiappacasse, Stefano, et al.
Pubblicazione: (2024)
A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
On the Parameter Estimation of Sinusoidal Models for Speech and Audio Signals
di: Kafentzis, George P.
Pubblicazione: (2024)
di: Kafentzis, George P.
Pubblicazione: (2024)
Phase-Based Signal Representations for Scattering
di: Haider, Daniel, et al.
Pubblicazione: (2022)
di: Haider, Daniel, et al.
Pubblicazione: (2022)
Benchmarking Audio Deepfake Detection Robustness in Real-world Communication Scenarios
di: Shi, Haohan, et al.
Pubblicazione: (2025)
di: Shi, Haohan, et al.
Pubblicazione: (2025)
Perceptually-motivated Spatial Audio Codec for Higher-Order Ambisonics Compression
di: Hold, Christoph, et al.
Pubblicazione: (2024)
di: Hold, Christoph, et al.
Pubblicazione: (2024)
A Novel Numerical Method for Relaxing the Minimal Configurations of TOA-Based Joint Sensors and Sources Localization
di: Cao, Faxian, et al.
Pubblicazione: (2024)
di: Cao, Faxian, et al.
Pubblicazione: (2024)
Noise Suppression for Time Difference of Arrival: Performance Evaluation of a Generalized Cross-Correlation Method Using Mean Signal and Inverse Filter
di: Obo, Hirotaka, et al.
Pubblicazione: (2025)
di: Obo, Hirotaka, et al.
Pubblicazione: (2025)
Zero-Bit Transmission of Adaptive Pre- and De-emphasis Filters for Speech and Audio Coding
di: Piralideh, Niloofar Omidi, et al.
Pubblicazione: (2024)
di: Piralideh, Niloofar Omidi, et al.
Pubblicazione: (2024)
Exploring Audio-Visual Information Fusion for Sound Event Localization and Detection In Low-Resource Realistic Scenarios
di: Jiang, Ya, et al.
Pubblicazione: (2024)
di: Jiang, Ya, et al.
Pubblicazione: (2024)
The Overview of Segmental Durations Modification Algorithms on Speech Signal Characteristics
di: Jang, Kyeomeun, et al.
Pubblicazione: (2025)
di: Jang, Kyeomeun, et al.
Pubblicazione: (2025)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
Do Music Source Separation Models Preserve Spatial Information in Binaural Audio?
di: Namballa, Richa, et al.
Pubblicazione: (2025)
di: Namballa, Richa, et al.
Pubblicazione: (2025)
Advanced Signal Analysis in Detecting Replay Attacks for Automatic Speaker Verification Systems
di: Kuang, Lee Shih
Pubblicazione: (2024)
di: Kuang, Lee Shih
Pubblicazione: (2024)
SoundSpring: Loss-Resilient Audio Transceiver with Dual-Functional Masked Language Modeling
di: Yao, Shengshi, et al.
Pubblicazione: (2025)
di: Yao, Shengshi, et al.
Pubblicazione: (2025)
Aliasing-Free Neural Audio Synthesis
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
Neural Spectral Band Generation for Audio Coding
di: Choi, Woongjib, et al.
Pubblicazione: (2025)
di: Choi, Woongjib, et al.
Pubblicazione: (2025)
HOMULA-RIR: A Room Impulse Response Dataset for Teleconferencing and Spatial Audio Applications Acquired Through Higher-Order Microphones and Uniform Linear Microphone Arrays
di: Miotello, Federico, et al.
Pubblicazione: (2024)
di: Miotello, Federico, et al.
Pubblicazione: (2024)
On the Invariance of Cross-Correlation Peak Positions Under Monotonic Signal Transformations, with Application to Fast Time Difference Estimation
di: Ueno, Natsuki, et al.
Pubblicazione: (2025)
di: Ueno, Natsuki, et al.
Pubblicazione: (2025)
One-Shot Distributed Node-Specific Signal Estimation with Non-Overlapping Latent Subspaces in Acoustic Sensor Networks
di: Didier, Paul, et al.
Pubblicazione: (2024)
di: Didier, Paul, et al.
Pubblicazione: (2024)
Harmonics to the Rescue: Why Voiced Speech is Not a Wss Process
di: Bologni, Giovanni, et al.
Pubblicazione: (2025)
di: Bologni, Giovanni, et al.
Pubblicazione: (2025)
Auditory Attention Decoding from Ear-EEG Signals: A Dataset with Dynamic Attention Switching and Rigorous Cross-Validation
di: Zhang, Yuanming, et al.
Pubblicazione: (2025)
di: Zhang, Yuanming, et al.
Pubblicazione: (2025)
A Machine Hearing System for Robust Cough Detection Based on a High-Level Representation of Band-Specific Audio Features
di: Monge-Alvarez, Jesús, et al.
Pubblicazione: (2024)
di: Monge-Alvarez, Jesús, et al.
Pubblicazione: (2024)
Audio signal interpolation using optimal transportation of spectrograms
di: Valdivia, David, et al.
Pubblicazione: (2025)
di: Valdivia, David, et al.
Pubblicazione: (2025)
DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing
di: Lee, Dongheon, et al.
Pubblicazione: (2023)
di: Lee, Dongheon, et al.
Pubblicazione: (2023)
Towards Improved Objective Perceptual Audio Quality Assessment -- Part 1: A Novel Data-Driven Cognitive Model
di: Delgado, Pablo M., et al.
Pubblicazione: (2024)
di: Delgado, Pablo M., et al.
Pubblicazione: (2024)
Significance of Chirp MFCC as a Feature in Speech and Audio Applications
di: Joysingh, S. Johanan, et al.
Pubblicazione: (2024)
di: Joysingh, S. Johanan, et al.
Pubblicazione: (2024)
Low-Complexity Neural Wind Noise Reduction for Audio Recordings
di: Eftekhari, Hesam, et al.
Pubblicazione: (2025)
di: Eftekhari, Hesam, et al.
Pubblicazione: (2025)
Interpolation Filter Design for Sample Rate Independent Audio Effect RNNs
di: Carson, Alistair, et al.
Pubblicazione: (2024)
di: Carson, Alistair, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Generative Deep Learning and Signal Processing for Data Augmentation of Cardiac Auscultation Signals: Improving Model Robustness Using Synthetic Audio
di: Abbott, Leigh, et al.
Pubblicazione: (2024) -
Beyond Identity: A Generalizable Approach for Deepfake Audio Detection
di: Ahmadiadli, Yasaman, et al.
Pubblicazione: (2025) -
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
di: Meng, Hanyu, et al.
Pubblicazione: (2025) -
Transformers in Speech Processing: A Survey
di: Latif, Siddique, et al.
Pubblicazione: (2023) -
AI-Driven Cardiorespiratory Signal Processing: Separation, Clustering, and Anomaly Detection
di: Torabi, Yasaman
Pubblicazione: (2026)