Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance
Fuente:
arXiv
Salvato in:
| Autori principali: | Messina, Francisco, Ronchini, Francesca, Comanducci, Luca, Bestagini, Paolo, Antonacci, Fabio |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Synthetic training set generation using text-to-audio models for environmental sound classification
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
AI-Assisted Music Production: A User Study on Text-to-Music Models
di: Ronchini, Francesca, et al.
Pubblicazione: (2025)
di: Ronchini, Francesca, et al.
Pubblicazione: (2025)
PAGURI: a user experience study of creative interaction with text-to-music models
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
Room Transfer Function Reconstruction Using Complex-valued Neural Networks and Irregularly Distributed Microphones
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
MambaFoley: Foley Sound Generation using Selective State-Space Models
di: Colombo, Marco Furio, et al.
Pubblicazione: (2024)
di: Colombo, Marco Furio, et al.
Pubblicazione: (2024)
Reconstruction of Sound Field through Diffusion Models
di: Miotello, Federico, et al.
Pubblicazione: (2023)
di: Miotello, Federico, et al.
Pubblicazione: (2023)
FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
Mind the Prompt: Prompting Strategies in Audio Generations for Improving Sound Classification
di: Ronchini, Francesca, et al.
Pubblicazione: (2025)
di: Ronchini, Francesca, et al.
Pubblicazione: (2025)
Interpreting End-to-End Deep Learning Models for Speech Source Localization Using Layer-wise Relevance Propagation
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
Diffused Responsibility: Analyzing the Energy Consumption of Generative Text-to-Audio Diffusion Models
di: Passoni, Riccardo, et al.
Pubblicazione: (2025)
di: Passoni, Riccardo, et al.
Pubblicazione: (2025)
Towards HRTF Personalization using Denoising Diffusion Models
di: Sánchez, Juan Camilo Albarracín, et al.
Pubblicazione: (2025)
di: Sánchez, Juan Camilo Albarracín, et al.
Pubblicazione: (2025)
HOMULA-RIR: A Room Impulse Response Dataset for Teleconferencing and Spatial Audio Applications Acquired Through Higher-Order Microphones and Uniform Linear Microphone Arrays
di: Miotello, Federico, et al.
Pubblicazione: (2024)
di: Miotello, Federico, et al.
Pubblicazione: (2024)
Implicit neural representation with physics-informed neural networks for the reconstruction of the early part of room impulse responses
di: Pezzoli, Mirco, et al.
Pubblicazione: (2023)
di: Pezzoli, Mirco, et al.
Pubblicazione: (2023)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
Why some audio signal short-time Fourier transform coefficients have nonuniform phase distributions
di: Voran, Stephen D.
Pubblicazione: (2024)
di: Voran, Stephen D.
Pubblicazione: (2024)
A Physics-Informed Neural Network-Based Approach for the Spatial Upsampling of Spherical Microphone Arrays
di: Miotello, Federico, et al.
Pubblicazione: (2024)
di: Miotello, Federico, et al.
Pubblicazione: (2024)
Self-supervised speech representation and contextual text embedding for match-mismatch classification with EEG recording
di: Wang, Bo, et al.
Pubblicazione: (2024)
di: Wang, Bo, et al.
Pubblicazione: (2024)
STASE: A spatialized text-to-audio synthesis engine for music generation
di: Chi, Tutti, et al.
Pubblicazione: (2025)
di: Chi, Tutti, et al.
Pubblicazione: (2025)
Synthesis of Soundfields through Irregular Loudspeaker Arrays Based on Convolutional Neural Networks
di: Comanducci, Luca, et al.
Pubblicazione: (2022)
di: Comanducci, Luca, et al.
Pubblicazione: (2022)
VR-PTOLEMAIC: A Virtual Environment for the Perceptual Testing of Spatial Audio Algorithms
di: Ostan, Paolo, et al.
Pubblicazione: (2025)
di: Ostan, Paolo, et al.
Pubblicazione: (2025)
Compositional nonlinear audio signal processing with Volterra series
di: Araujo-Simon, Jake
Pubblicazione: (2023)
di: Araujo-Simon, Jake
Pubblicazione: (2023)
Performance and energy balance: a comprehensive study of state-of-the-art sound event detection systems
di: Ronchini, Francesca, et al.
Pubblicazione: (2023)
di: Ronchini, Francesca, et al.
Pubblicazione: (2023)
SIRUP: A diffusion-based virtual upmixer of steering vectors for highly-directive spatialization with first-order ambisonics
di: Picard, Emilio, et al.
Pubblicazione: (2026)
di: Picard, Emilio, et al.
Pubblicazione: (2026)
Using perceptive subbands analysis to perform audio scenes cartography
di: Millot, Laurent, et al.
Pubblicazione: (2024)
di: Millot, Laurent, et al.
Pubblicazione: (2024)
Deep learning-based filtering of cross-spectral matrices using generative adversarial networks
di: Puhle, Christof
Pubblicazione: (2025)
di: Puhle, Christof
Pubblicazione: (2025)
Freeze and Learn: Continual Learning with Selective Freezing for Speech Deepfake Detection
di: Salvi, Davide, et al.
Pubblicazione: (2024)
di: Salvi, Davide, et al.
Pubblicazione: (2024)
TEAdapter: Supply abundant guidance for controllable text-to-music generation
di: Zou, Jialing, et al.
Pubblicazione: (2024)
di: Zou, Jialing, et al.
Pubblicazione: (2024)
Automatic Voice Classification Of Autistic Subjects
di: Vacca, Jessica, et al.
Pubblicazione: (2024)
di: Vacca, Jessica, et al.
Pubblicazione: (2024)
Discriminating real and synthetic super-resolved audio samples using embedding-based classifiers
di: Silaev, Mikhail, et al.
Pubblicazione: (2026)
di: Silaev, Mikhail, et al.
Pubblicazione: (2026)
Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
Enhancing Anti-spoofing Countermeasures Robustness through Joint Optimization and Transfer Learning
di: Wang, Yikang, et al.
Pubblicazione: (2024)
di: Wang, Yikang, et al.
Pubblicazione: (2024)
FlowDec: A flow-based full-band general audio codec with high perceptual quality
di: Welker, Simon, et al.
Pubblicazione: (2025)
di: Welker, Simon, et al.
Pubblicazione: (2025)
FxSearcher: gradient-free text-driven audio transformation
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
EDTC: enhance depth of text comprehension in automated audio captioning
di: Tan, Liwen, et al.
Pubblicazione: (2024)
di: Tan, Liwen, et al.
Pubblicazione: (2024)
Source Verification for Speech Deepfakes
di: Negroni, Viola, et al.
Pubblicazione: (2025)
di: Negroni, Viola, et al.
Pubblicazione: (2025)
An incremental algorithm based on multichannel non-negative matrix partial co-factorization for ambient denoising in auscultation
di: Cruz, Juan De La Torre, et al.
Pubblicazione: (2024)
di: Cruz, Juan De La Torre, et al.
Pubblicazione: (2024)
Sound event localization and detection based on crnn using rectangular filters and channel rotation data augmentation
di: Ronchini, Francesca, et al.
Pubblicazione: (2020)
di: Ronchini, Francesca, et al.
Pubblicazione: (2020)
RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio
di: Kanamori, Yusuke, et al.
Pubblicazione: (2025)
di: Kanamori, Yusuke, et al.
Pubblicazione: (2025)
A SOUND APPROACH: Using Large Language Models to generate audio descriptions for egocentric text-audio retrieval
di: Oncescu, Andreea-Maria, et al.
Pubblicazione: (2024)
di: Oncescu, Andreea-Maria, et al.
Pubblicazione: (2024)
Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection
di: Salvi, Davide, et al.
Pubblicazione: (2025)
di: Salvi, Davide, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Synthetic training set generation using text-to-audio models for environmental sound classification
di: Ronchini, Francesca, et al.
Pubblicazione: (2024) -
AI-Assisted Music Production: A User Study on Text-to-Music Models
di: Ronchini, Francesca, et al.
Pubblicazione: (2025) -
PAGURI: a user experience study of creative interaction with text-to-music models
di: Ronchini, Francesca, et al.
Pubblicazione: (2024) -
Room Transfer Function Reconstruction Using Complex-valued Neural Networks and Irregularly Distributed Microphones
di: Ronchini, Francesca, et al.
Pubblicazione: (2024) -
MambaFoley: Foley Sound Generation using Selective State-Space Models
di: Colombo, Marco Furio, et al.
Pubblicazione: (2024)