Conditional Generative Data Augmentation for Clinical Audio Datasets
Fuente:
arXiv
Salvato in:
| Autori principali: | Seibold, Matthias, Hoch, Armando, Farshad, Mazda, Navab, Nassir, Fürnstahl, Philipp |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Targeted Augmented Data for Audio Deepfake Detection
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
Improved Techniques for the Conditional Generative Augmentation of Clinical Audio Data
di: Margaryan, Mane, et al.
Pubblicazione: (2022)
di: Margaryan, Mane, et al.
Pubblicazione: (2022)
Music Boomerang: Reusing Diffusion Models for Data Augmentation and Audio Manipulation
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)
Training Generative Adversarial Network-Based Vocoder with Limited Data Using Augmentation-Conditional Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
EmotionCaps: Enhancing Audio Captioning Through Emotion-Augmented Data Generation
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)
Fast Timing-Conditioned Latent Audio Diffusion
di: Evans, Zach, et al.
Pubblicazione: (2024)
di: Evans, Zach, et al.
Pubblicazione: (2024)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
di: Collins, Nick
Pubblicazione: (2024)
di: Collins, Nick
Pubblicazione: (2024)
FlowMAC: Conditional Flow Matching for Audio Coding at Low Bit Rates
di: Pia, Nicola, et al.
Pubblicazione: (2024)
di: Pia, Nicola, et al.
Pubblicazione: (2024)
Does Audio Deepfake Detection Generalize?
di: Müller, Nicolas M., et al.
Pubblicazione: (2022)
di: Müller, Nicolas M., et al.
Pubblicazione: (2022)
Learning Music Audio Representations With Limited Data
di: Plachouras, Christos, et al.
Pubblicazione: (2025)
di: Plachouras, Christos, et al.
Pubblicazione: (2025)
Vocal Melody Construction for Persian Lyrics Using LSTM Recurrent Neural Networks
di: Jafari, Farshad, et al.
Pubblicazione: (2024)
di: Jafari, Farshad, et al.
Pubblicazione: (2024)
StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks
di: Wang, Yishan, et al.
Pubblicazione: (2026)
di: Wang, Yishan, et al.
Pubblicazione: (2026)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
PTQ4ADM: Post-Training Quantization for Efficient Text Conditional Audio Diffusion Models
di: Vora, Jayneel, et al.
Pubblicazione: (2024)
di: Vora, Jayneel, et al.
Pubblicazione: (2024)
Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use
di: Pahwa, Ramit, et al.
Pubblicazione: (2026)
di: Pahwa, Ramit, et al.
Pubblicazione: (2026)
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
Creative Text-to-Audio Generation via Synthesizer Programming
di: Cherep, Manuel, et al.
Pubblicazione: (2024)
di: Cherep, Manuel, et al.
Pubblicazione: (2024)
SoundReactor: Frame-level Online Video-to-Audio Generation
di: Saito, Koichi, et al.
Pubblicazione: (2025)
di: Saito, Koichi, et al.
Pubblicazione: (2025)
RiTTA: Modeling Event Relations in Text-to-Audio Generation
di: He, Yuhang, et al.
Pubblicazione: (2024)
di: He, Yuhang, et al.
Pubblicazione: (2024)
Adversarial Data Augmentation for Robust Speaker Verification
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
A2SB: Audio-to-Audio Schrodinger Bridges
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
HiddenSpeaker: Generate Imperceptible Unlearnable Audios for Speaker Verification System
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
di: Primus, Paul, et al.
Pubblicazione: (2025)
di: Primus, Paul, et al.
Pubblicazione: (2025)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
Annotation-Free MIDI-to-Audio Synthesis via Concatenative Synthesis and Generative Refinement
di: Take, Osamu, et al.
Pubblicazione: (2024)
di: Take, Osamu, et al.
Pubblicazione: (2024)
LiLAC: A Lightweight Latent ControlNet for Musical Audio Generation
di: Baker, Tom, et al.
Pubblicazione: (2025)
di: Baker, Tom, et al.
Pubblicazione: (2025)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
A Novel Stochastic Transformer-based Approach for Post-Traumatic Stress Disorder Detection using Audio Recording of Clinical Interviews
di: Dia, Mamadou, et al.
Pubblicazione: (2024)
di: Dia, Mamadou, et al.
Pubblicazione: (2024)
Generating Sample-Based Musical Instruments Using Neural Audio Codec Language Models
di: Nercessian, Shahan, et al.
Pubblicazione: (2024)
di: Nercessian, Shahan, et al.
Pubblicazione: (2024)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2025)
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2025)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
Mitigating Sex Bias in Audio Data-driven COPD and COVID-19 Breathing Pattern Detection Models
di: Pfeifer, Rachel, et al.
Pubblicazione: (2024)
di: Pfeifer, Rachel, et al.
Pubblicazione: (2024)
Unsupervised Composable Representations for Audio
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
Multi-bit Audio Watermarking
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Diffusion Models for Audio Restoration
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
Instabilities in Convnets for Raw Audio
di: Haider, Daniel, et al.
Pubblicazione: (2023)
di: Haider, Daniel, et al.
Pubblicazione: (2023)
Automatic Contextual Audio Denoising
di: Luong, Diep, et al.
Pubblicazione: (2026)
di: Luong, Diep, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Targeted Augmented Data for Audio Deepfake Detection
di: Astrid, Marcella, et al.
Pubblicazione: (2024) -
Improved Techniques for the Conditional Generative Augmentation of Clinical Audio Data
di: Margaryan, Mane, et al.
Pubblicazione: (2022) -
Music Boomerang: Reusing Diffusion Models for Data Augmentation and Audio Manipulation
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025) -
Training Generative Adversarial Network-Based Vocoder with Limited Data Using Augmentation-Conditional Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024) -
EmotionCaps: Enhancing Audio Captioning Through Emotion-Augmented Data Generation
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)