Synthetic training set generation using text-to-audio models for environmental sound classification
Fuente:
arXiv
Salvato in:
| Autori principali: | Ronchini, Francesca, Comanducci, Luca, Antonacci, Fabio |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance
di: Messina, Francisco, et al.
Pubblicazione: (2025)
di: Messina, Francisco, et al.
Pubblicazione: (2025)
AI-Assisted Music Production: A User Study on Text-to-Music Models
di: Ronchini, Francesca, et al.
Pubblicazione: (2025)
di: Ronchini, Francesca, et al.
Pubblicazione: (2025)
PAGURI: a user experience study of creative interaction with text-to-music models
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
Room Transfer Function Reconstruction Using Complex-valued Neural Networks and Irregularly Distributed Microphones
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
MambaFoley: Foley Sound Generation using Selective State-Space Models
di: Colombo, Marco Furio, et al.
Pubblicazione: (2024)
di: Colombo, Marco Furio, et al.
Pubblicazione: (2024)
Mind the Prompt: Prompting Strategies in Audio Generations for Improving Sound Classification
di: Ronchini, Francesca, et al.
Pubblicazione: (2025)
di: Ronchini, Francesca, et al.
Pubblicazione: (2025)
Interpreting End-to-End Deep Learning Models for Speech Source Localization Using Layer-wise Relevance Propagation
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
Reconstruction of Sound Field through Diffusion Models
di: Miotello, Federico, et al.
Pubblicazione: (2023)
di: Miotello, Federico, et al.
Pubblicazione: (2023)
Diffused Responsibility: Analyzing the Energy Consumption of Generative Text-to-Audio Diffusion Models
di: Passoni, Riccardo, et al.
Pubblicazione: (2025)
di: Passoni, Riccardo, et al.
Pubblicazione: (2025)
Towards HRTF Personalization using Denoising Diffusion Models
di: Sánchez, Juan Camilo Albarracín, et al.
Pubblicazione: (2025)
di: Sánchez, Juan Camilo Albarracín, et al.
Pubblicazione: (2025)
Self-supervised speech representation and contextual text embedding for match-mismatch classification with EEG recording
di: Wang, Bo, et al.
Pubblicazione: (2024)
di: Wang, Bo, et al.
Pubblicazione: (2024)
Performance and energy balance: a comprehensive study of state-of-the-art sound event detection systems
di: Ronchini, Francesca, et al.
Pubblicazione: (2023)
di: Ronchini, Francesca, et al.
Pubblicazione: (2023)
Implicit neural representation with physics-informed neural networks for the reconstruction of the early part of room impulse responses
di: Pezzoli, Mirco, et al.
Pubblicazione: (2023)
di: Pezzoli, Mirco, et al.
Pubblicazione: (2023)
Time-domain sound field estimation using kernel ridge regression
di: Brunnström, Jesper, et al.
Pubblicazione: (2025)
di: Brunnström, Jesper, et al.
Pubblicazione: (2025)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
Why some audio signal short-time Fourier transform coefficients have nonuniform phase distributions
di: Voran, Stephen D.
Pubblicazione: (2024)
di: Voran, Stephen D.
Pubblicazione: (2024)
HOMULA-RIR: A Room Impulse Response Dataset for Teleconferencing and Spatial Audio Applications Acquired Through Higher-Order Microphones and Uniform Linear Microphone Arrays
di: Miotello, Federico, et al.
Pubblicazione: (2024)
di: Miotello, Federico, et al.
Pubblicazione: (2024)
Exploiting spatial diversity for increasing the robustness of sound source localization systems against reverberation
di: Garcia-Barrios, Guillermo, et al.
Pubblicazione: (2024)
di: Garcia-Barrios, Guillermo, et al.
Pubblicazione: (2024)
Deep learning-based filtering of cross-spectral matrices using generative adversarial networks
di: Puhle, Christof
Pubblicazione: (2025)
di: Puhle, Christof
Pubblicazione: (2025)
A Physics-Informed Neural Network-Based Approach for the Spatial Upsampling of Spherical Microphone Arrays
di: Miotello, Federico, et al.
Pubblicazione: (2024)
di: Miotello, Federico, et al.
Pubblicazione: (2024)
Acousto-optic reconstruction of exterior sound field based on concentric circle sampling with circular harmonic expansion
di: Nguyen, Phuc Duc, et al.
Pubblicazione: (2023)
di: Nguyen, Phuc Duc, et al.
Pubblicazione: (2023)
STASE: A spatialized text-to-audio synthesis engine for music generation
di: Chi, Tutti, et al.
Pubblicazione: (2025)
di: Chi, Tutti, et al.
Pubblicazione: (2025)
Deep learning classification system for coconut maturity levels based on acoustic signals
di: Caladcad, June Anne, et al.
Pubblicazione: (2024)
di: Caladcad, June Anne, et al.
Pubblicazione: (2024)
A benchmark of state-of-the-art sound event detection systems evaluated on synthetic soundscapes
di: Ronchini, Francesca, et al.
Pubblicazione: (2022)
di: Ronchini, Francesca, et al.
Pubblicazione: (2022)
Discriminating real and synthetic super-resolved audio samples using embedding-based classifiers
di: Silaev, Mikhail, et al.
Pubblicazione: (2026)
di: Silaev, Mikhail, et al.
Pubblicazione: (2026)
Episodic fine-tuning prototypical networks for optimization-based few-shot learning: Application to audio classification
di: Zhuang, Xuanyu, et al.
Pubblicazione: (2024)
di: Zhuang, Xuanyu, et al.
Pubblicazione: (2024)
Confidence-Based Self-Training for EMG-to-Speech: Leveraging Synthetic EMG for Robust Modeling
di: Chen, Xiaodan, et al.
Pubblicazione: (2025)
di: Chen, Xiaodan, et al.
Pubblicazione: (2025)
Compositional nonlinear audio signal processing with Volterra series
di: Araujo-Simon, Jake
Pubblicazione: (2023)
di: Araujo-Simon, Jake
Pubblicazione: (2023)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
Using perceptive subbands analysis to perform audio scenes cartography
di: Millot, Laurent, et al.
Pubblicazione: (2024)
di: Millot, Laurent, et al.
Pubblicazione: (2024)
Generative Deep Learning and Signal Processing for Data Augmentation of Cardiac Auscultation Signals: Improving Model Robustness Using Synthetic Audio
di: Abbott, Leigh, et al.
Pubblicazione: (2024)
di: Abbott, Leigh, et al.
Pubblicazione: (2024)
Scaling up masked audio encoder learning for general audio classification
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
Sound event localization and detection based on crnn using rectangular filters and channel rotation data augmentation
di: Ronchini, Francesca, et al.
Pubblicazione: (2020)
di: Ronchini, Francesca, et al.
Pubblicazione: (2020)
Automatic Voice Classification Of Autistic Subjects
di: Vacca, Jessica, et al.
Pubblicazione: (2024)
di: Vacca, Jessica, et al.
Pubblicazione: (2024)
Synthesis of Soundfields through Irregular Loudspeaker Arrays Based on Convolutional Neural Networks
di: Comanducci, Luca, et al.
Pubblicazione: (2022)
di: Comanducci, Luca, et al.
Pubblicazione: (2022)
Musical Score Following using Statistical Inference
di: Cowley, Josephine
Pubblicazione: (2025)
di: Cowley, Josephine
Pubblicazione: (2025)
Audio signal interpolation using optimal transportation of spectrograms
di: Valdivia, David, et al.
Pubblicazione: (2025)
di: Valdivia, David, et al.
Pubblicazione: (2025)
FlowDec: A flow-based full-band general audio codec with high perceptual quality
di: Welker, Simon, et al.
Pubblicazione: (2025)
di: Welker, Simon, et al.
Pubblicazione: (2025)
Adaptive Diagonal Loading using Krylov Subspaces for Robust Beamforming
di: Mittal, Manan, et al.
Pubblicazione: (2026)
di: Mittal, Manan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance
di: Messina, Francisco, et al.
Pubblicazione: (2025) -
AI-Assisted Music Production: A User Study on Text-to-Music Models
di: Ronchini, Francesca, et al.
Pubblicazione: (2025) -
PAGURI: a user experience study of creative interaction with text-to-music models
di: Ronchini, Francesca, et al.
Pubblicazione: (2024) -
Room Transfer Function Reconstruction Using Complex-valued Neural Networks and Irregularly Distributed Microphones
di: Ronchini, Francesca, et al.
Pubblicazione: (2024) -
MambaFoley: Foley Sound Generation using Selective State-Space Models
di: Colombo, Marco Furio, et al.
Pubblicazione: (2024)