Gencho: Room Impulse Response Generation from Reverberant Speech and Text via Diffusion Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Jackie, Su, Jiaqi, Anand, Nishit, Jin, Zeyu, Kim, Minje, Smaragdis, Paris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
User-guided Generative Source Separation
di: Wen, Yutong, et al.
Pubblicazione: (2025)
di: Wen, Yutong, et al.
Pubblicazione: (2025)
Combolutional Neural Networks
di: Churchwell, Cameron, et al.
Pubblicazione: (2025)
di: Churchwell, Cameron, et al.
Pubblicazione: (2025)
PromptSep: Generative Audio Separation via Multimodal Prompting
di: Wen, Yutong, et al.
Pubblicazione: (2025)
di: Wen, Yutong, et al.
Pubblicazione: (2025)
Adaptive Slimming for Scalable and Efficient Speech Enhancement
di: Miccini, Riccardo, et al.
Pubblicazione: (2025)
di: Miccini, Riccardo, et al.
Pubblicazione: (2025)
Generative Data Augmentation Challenge: Synthesis of Room Acoustics for Speaker Distance Estimation
di: Lin, Jackie, et al.
Pubblicazione: (2025)
di: Lin, Jackie, et al.
Pubblicazione: (2025)
RevRIR: Joint Reverberant Speech and Room Impulse Response Embedding using Contrastive Learning with Application to Room Shape Classification
di: Bitterman, Jacob, et al.
Pubblicazione: (2024)
di: Bitterman, Jacob, et al.
Pubblicazione: (2024)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
Room Impulse Response Generation Conditioned on Acoustic Parameters
di: Arellano, Silvia, et al.
Pubblicazione: (2025)
di: Arellano, Silvia, et al.
Pubblicazione: (2025)
DARAS: Dynamic Audio-Room Acoustic Synthesis for Blind Room Impulse Response Estimation
di: Wang, Chunxi, et al.
Pubblicazione: (2025)
di: Wang, Chunxi, et al.
Pubblicazione: (2025)
Hyperbolic Distance-Based Speech Separation
di: Petermann, Darius, et al.
Pubblicazione: (2024)
di: Petermann, Darius, et al.
Pubblicazione: (2024)
Scaling Up Adaptive Filter Optimizers
di: Casebeer, Jonah, et al.
Pubblicazione: (2024)
di: Casebeer, Jonah, et al.
Pubblicazione: (2024)
Sensitivity of Room Impulse Responses in Changing Acoustic Environment
di: Prawda, Karolina
Pubblicazione: (2025)
di: Prawda, Karolina
Pubblicazione: (2025)
Room Impulse Response as a Prompt for Acoustic Echo Cancellation
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Direct and Residual Subspace Decomposition of Spatial Room Impulse Responses
di: Deppisch, Thomas, et al.
Pubblicazione: (2022)
di: Deppisch, Thomas, et al.
Pubblicazione: (2022)
DiffusionRIR: Room Impulse Response Interpolation using Diffusion Models
di: Della Torre, Sagi, et al.
Pubblicazione: (2025)
di: Della Torre, Sagi, et al.
Pubblicazione: (2025)
On Class Separability Pitfalls In Audio-Text Contrastive Zero-Shot Learning
di: Tavares, Tiago, et al.
Pubblicazione: (2024)
di: Tavares, Tiago, et al.
Pubblicazione: (2024)
Room Impulse Responses help attackers to evade Deep Fake Detection
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2024)
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2024)
Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
3D Room Geometry Inference from Multichannel Room Impulse Response using Deep Neural Network
di: Yeon, Inmo, et al.
Pubblicazione: (2024)
di: Yeon, Inmo, et al.
Pubblicazione: (2024)
Re-Bottleneck: Latent Re-Structuring for Neural Audio Autoencoders
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
Learning to Upsample and Upmix Audio in the Latent Domain
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
Low-Rank Adaptation of Deep Prior Neural Networks For Room Impulse Response Reconstruction
di: Pezzoli, Mirco, et al.
Pubblicazione: (2025)
di: Pezzoli, Mirco, et al.
Pubblicazione: (2025)
Personalized Neural Speech Codec
di: Jang, Inseon, et al.
Pubblicazione: (2024)
di: Jang, Inseon, et al.
Pubblicazione: (2024)
ReverbMiipher: Generative Speech Restoration meets Reverberation Characteristics Controllability
di: Nakata, Wataru, et al.
Pubblicazione: (2025)
di: Nakata, Wataru, et al.
Pubblicazione: (2025)
Enhanced Reverberation as Supervision for Unsupervised Speech Separation
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
MEAN-RIR: Multi-Modal Environment-Aware Network for Robust Room Impulse Response Estimation
di: Chen, Jiajian, et al.
Pubblicazione: (2025)
di: Chen, Jiajian, et al.
Pubblicazione: (2025)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
di: Liu, Huadai, et al.
Pubblicazione: (2023)
di: Liu, Huadai, et al.
Pubblicazione: (2023)
Noise-Robust DSP-Assisted Neural Pitch Estimation with Very Low Complexity
di: Subramani, Krishna, et al.
Pubblicazione: (2023)
di: Subramani, Krishna, et al.
Pubblicazione: (2023)
A Multi-loudspeaker Binaural Room Impulse Response Dataset with High-Resolution Translational and Rotational Head Coordinates in a Listening Room
di: Qiao, Yue, et al.
Pubblicazione: (2024)
di: Qiao, Yue, et al.
Pubblicazione: (2024)
Room Impulse Response Synthesis via Differentiable Feedback Delay Networks for Efficient Spatial Audio Rendering
di: Gerami, Armin, et al.
Pubblicazione: (2025)
di: Gerami, Armin, et al.
Pubblicazione: (2025)
A Comparative Analysis of Poetry Reading Audio: Singing, Narrating, or Somewhere In Between?
di: Choi, Kahyun, et al.
Pubblicazione: (2024)
di: Choi, Kahyun, et al.
Pubblicazione: (2024)
Accelerating Diffusion Transformer-Based Text-to-Speech with Transformer Layer Caching
di: Sakpiboonchit, Siratish
Pubblicazione: (2025)
di: Sakpiboonchit, Siratish
Pubblicazione: (2025)
Audio Editing with Non-Rigid Text Prompts
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
Rethinking Non-Negative Matrix Factorization with Implicit Neural Representations
di: Subramani, Krishna, et al.
Pubblicazione: (2024)
di: Subramani, Krishna, et al.
Pubblicazione: (2024)
Blind Spatial Impulse Response Generation from Separate Room- and Scene-Specific Information
di: Lluís, Francesc, et al.
Pubblicazione: (2024)
di: Lluís, Francesc, et al.
Pubblicazione: (2024)
ReverbFX: A Dataset of Room Impulse Responses Derived from Reverb Effect Plugins for Singing Voice Dereverberation
di: Richter, Julius, et al.
Pubblicazione: (2025)
di: Richter, Julius, et al.
Pubblicazione: (2025)
Deep Room Impulse Response Completion
di: Lin, Jackie, et al.
Pubblicazione: (2024)
di: Lin, Jackie, et al.
Pubblicazione: (2024)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
Sound Source Separation Using Latent Variational Block-Wise Disentanglement
di: Helwani, Karim, et al.
Pubblicazione: (2024)
di: Helwani, Karim, et al.
Pubblicazione: (2024)
Diminishing Domain Mismatch for DNN-Based Acoustic Distance Estimation via Stochastic Room Reverberation Models
di: Gburrek, Tobias, et al.
Pubblicazione: (2024)
di: Gburrek, Tobias, et al.
Pubblicazione: (2024)
Documenti analoghi
-
User-guided Generative Source Separation
di: Wen, Yutong, et al.
Pubblicazione: (2025) -
Combolutional Neural Networks
di: Churchwell, Cameron, et al.
Pubblicazione: (2025) -
PromptSep: Generative Audio Separation via Multimodal Prompting
di: Wen, Yutong, et al.
Pubblicazione: (2025) -
Adaptive Slimming for Scalable and Efficient Speech Enhancement
di: Miccini, Riccardo, et al.
Pubblicazione: (2025) -
Generative Data Augmentation Challenge: Synthesis of Room Acoustics for Speaker Distance Estimation
di: Lin, Jackie, et al.
Pubblicazione: (2025)