Enforcing Speech Content Privacy in Environmental Sound Recordings using Segment-wise Waveform Reversal
Fuente:
arXiv
Guardado en:
| Autores principales: | Tailleur, Modan, Lagrange, Mathieu, Aumond, Pierre, Tourre, Vincent |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards better visualizations of urban sound environments: insights from interviews
por: Tailleur, Modan, et al.
Publicado: (2024)
por: Tailleur, Modan, et al.
Publicado: (2024)
Detection of Deepfake Environmental Audio
por: Ouajdi, Hafsa, et al.
Publicado: (2024)
por: Ouajdi, Hafsa, et al.
Publicado: (2024)
Machine listening in a neonatal intensive care unit
por: Tailleur, Modan, et al.
Publicado: (2024)
por: Tailleur, Modan, et al.
Publicado: (2024)
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
por: Tailleur, Modan, et al.
Publicado: (2024)
por: Tailleur, Modan, et al.
Publicado: (2024)
Sound Scene Synthesis at the DCASE 2024 Challenge
por: Lagrange, Mathieu, et al.
Publicado: (2025)
por: Lagrange, Mathieu, et al.
Publicado: (2025)
Learning to Solve Inverse Problems for Perceptual Sound Matching
por: Han, Han, et al.
Publicado: (2023)
por: Han, Han, et al.
Publicado: (2023)
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
por: Lee, Junwon, et al.
Publicado: (2024)
por: Lee, Junwon, et al.
Publicado: (2024)
S-KEY: Self-supervised Learning of Major and Minor Keys from Audio
por: Kong, Yuexuan, et al.
Publicado: (2025)
por: Kong, Yuexuan, et al.
Publicado: (2025)
STONE: Self-supervised Tonality Estimator
por: Kong, Yuexuan, et al.
Publicado: (2024)
por: Kong, Yuexuan, et al.
Publicado: (2024)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
SCRAPL: Scattering Transform with Random Paths for Machine Learning
por: Mitcheltree, Christopher, et al.
Publicado: (2026)
por: Mitcheltree, Christopher, et al.
Publicado: (2026)
Content Leakage in LibriSpeech and Its Impact on the Privacy Evaluation of Speaker Anonymization
por: Franzreb, Carlos, et al.
Publicado: (2026)
por: Franzreb, Carlos, et al.
Publicado: (2026)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
por: Cooper, Erica, et al.
Publicado: (2025)
por: Cooper, Erica, et al.
Publicado: (2025)
Universal Speech Content Factorization
por: Xinyuan, Henry Li, et al.
Publicado: (2026)
por: Xinyuan, Henry Li, et al.
Publicado: (2026)
Contrastive Loss Based Frame-wise Feature disentanglement for Polyphonic Sound Event Detection
por: Guan, Yadong, et al.
Publicado: (2024)
por: Guan, Yadong, et al.
Publicado: (2024)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
por: Xin, Detai, et al.
Publicado: (2026)
por: Xin, Detai, et al.
Publicado: (2026)
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
por: Ojha, Shuubham, et al.
Publicado: (2025)
por: Ojha, Shuubham, et al.
Publicado: (2025)
DIFFRENT: A Diffusion Model for Recording Environment Transfer of Speech
por: Im, Jaekwon, et al.
Publicado: (2024)
por: Im, Jaekwon, et al.
Publicado: (2024)
Construction and Analysis of Impression Caption Dataset for Environmental Sounds
por: Okamoto, Yuki, et al.
Publicado: (2024)
por: Okamoto, Yuki, et al.
Publicado: (2024)
Trainingless Adaptation of Pretrained Models for Environmental Sound Classification
por: Tonami, Noriyuki, et al.
Publicado: (2024)
por: Tonami, Noriyuki, et al.
Publicado: (2024)
VoiceRestore: Flow-Matching Transformers for Speech Recording Quality Restoration
por: Kirdey, Stanislav
Publicado: (2025)
por: Kirdey, Stanislav
Publicado: (2025)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
por: Guo, Dake, et al.
Publicado: (2025)
por: Guo, Dake, et al.
Publicado: (2025)
Analytic Class Incremental Learning for Sound Source Localization with Privacy Protection
por: Qian, Xinyuan, et al.
Publicado: (2024)
por: Qian, Xinyuan, et al.
Publicado: (2024)
SecureSpeech: Prompt-based Speaker and Content Protection
por: Hui, Belinda Soh Hui, et al.
Publicado: (2025)
por: Hui, Belinda Soh Hui, et al.
Publicado: (2025)
Vision Transformer Segmentation for Visual Bird Sound Denoising
por: Kumar, Sahil, et al.
Publicado: (2024)
por: Kumar, Sahil, et al.
Publicado: (2024)
Interpreting End-to-End Deep Learning Models for Speech Source Localization Using Layer-wise Relevance Propagation
por: Comanducci, Luca, et al.
Publicado: (2024)
por: Comanducci, Luca, et al.
Publicado: (2024)
Continuous Target Speech Extraction: Enhancing Personalized Diarization and Extraction on Complex Recordings
por: Zhao, He, et al.
Publicado: (2024)
por: Zhao, He, et al.
Publicado: (2024)
Universal Score-based Speech Enhancement with High Content Preservation
por: Scheibler, Robin, et al.
Publicado: (2024)
por: Scheibler, Robin, et al.
Publicado: (2024)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
por: Gong, Xun, et al.
Publicado: (2024)
por: Gong, Xun, et al.
Publicado: (2024)
Listen through the Sound: Generative Speech Restoration Leveraging Acoustic Context Representation
por: Chung, Soo-Whan, et al.
Publicado: (2025)
por: Chung, Soo-Whan, et al.
Publicado: (2025)
AFT: An Exemplar-Free Class Incremental Learning Method for Environmental Sound Classification
por: Chen, Xinyi, et al.
Publicado: (2025)
por: Chen, Xinyi, et al.
Publicado: (2025)
Technical Report of Nomi Team in the Environmental Sound Deepfake Detection Challenge 2026
por: Mawalim, Candy Olivia, et al.
Publicado: (2025)
por: Mawalim, Candy Olivia, et al.
Publicado: (2025)
Baseline Systems and Evaluation Metrics for Spatial Semantic Segmentation of Sound Scenes
por: Nguyen, Binh Thien, et al.
Publicado: (2025)
por: Nguyen, Binh Thien, et al.
Publicado: (2025)
Examining the Interplay Between Privacy and Fairness for Speech Processing: A Review and Perspective
por: Leschanowsky, Anna, et al.
Publicado: (2024)
por: Leschanowsky, Anna, et al.
Publicado: (2024)
JVNV: A Corpus of Japanese Emotional Speech with Verbal Content and Nonverbal Expressions
por: Xin, Detai, et al.
Publicado: (2023)
por: Xin, Detai, et al.
Publicado: (2023)
Multi-Utterance Speech Separation and Association Trained on Short Segments
por: Wang, Yuzhu, et al.
Publicado: (2025)
por: Wang, Yuzhu, et al.
Publicado: (2025)
RealMAN: A Real-Recorded and Annotated Microphone Array Dataset for Dynamic Speech Enhancement and Localization
por: Yang, Bing, et al.
Publicado: (2024)
por: Yang, Bing, et al.
Publicado: (2024)
Investigating Effective Speaker Property Privacy Protection in Federated Learning for Speech Emotion Recognition
por: Tan, Chao, et al.
Publicado: (2024)
por: Tan, Chao, et al.
Publicado: (2024)
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
por: Wang, Siyi, et al.
Publicado: (2024)
por: Wang, Siyi, et al.
Publicado: (2024)
AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences
por: Kishi, Minoru, et al.
Publicado: (2025)
por: Kishi, Minoru, et al.
Publicado: (2025)
Ejemplares similares
-
Towards better visualizations of urban sound environments: insights from interviews
por: Tailleur, Modan, et al.
Publicado: (2024) -
Detection of Deepfake Environmental Audio
por: Ouajdi, Hafsa, et al.
Publicado: (2024) -
Machine listening in a neonatal intensive care unit
por: Tailleur, Modan, et al.
Publicado: (2024) -
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
por: Tailleur, Modan, et al.
Publicado: (2024) -
Sound Scene Synthesis at the DCASE 2024 Challenge
por: Lagrange, Mathieu, et al.
Publicado: (2025)