SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Kai, Sang, Wendi, Zeng, Chang, Yang, Runxuan, Chen, Guo, Hu, Xiaolin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
por: Sang, Wendi, et al.
Publicado: (2025)
por: Sang, Wendi, et al.
Publicado: (2025)
SPMamba: State-space model is all you need in speech separation
por: Li, Kai, et al.
Publicado: (2024)
por: Li, Kai, et al.
Publicado: (2024)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
por: Yang, Runxuan, et al.
Publicado: (2025)
por: Yang, Runxuan, et al.
Publicado: (2025)
Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation
por: Chen, Guo, et al.
Publicado: (2025)
por: Chen, Guo, et al.
Publicado: (2025)
SonicRAG : High Fidelity Sound Effects Synthesis Based on Retrival Augmented Generation
por: Guo, Yu-Ren, et al.
Publicado: (2025)
por: Guo, Yu-Ren, et al.
Publicado: (2025)
Text2Move: Text-to-moving sound generation via trajectory prediction and temporal alignment
por: Liu, Yunyi, et al.
Publicado: (2025)
por: Liu, Yunyi, et al.
Publicado: (2025)
Advances in Speech Separation: Techniques, Challenges, and Future Trends
por: Li, Kai, et al.
Publicado: (2025)
por: Li, Kai, et al.
Publicado: (2025)
Signal processing algorithm effective for sound quality of hearing loss simulators
por: Irino, Toshio, et al.
Publicado: (2024)
por: Irino, Toshio, et al.
Publicado: (2024)
Real-time multichannel deep speech enhancement in hearing aids: Comparing monaural and binaural processing in complex acoustic scenarios
por: Westhausen, Nils L., et al.
Publicado: (2024)
por: Westhausen, Nils L., et al.
Publicado: (2024)
Multichannel blind speech source separation with a disjoint constraint source model
por: Wang, Jianyu, et al.
Publicado: (2024)
por: Wang, Jianyu, et al.
Publicado: (2024)
The Neural-SRP method for positional sound source localization
por: Grinstein, Eric, et al.
Publicado: (2024)
por: Grinstein, Eric, et al.
Publicado: (2024)
A two-step approach for speech enhancement in low-SNR scenarios using cyclostationary beamforming and DNNs
por: Bologni, Giovanni, et al.
Publicado: (2026)
por: Bologni, Giovanni, et al.
Publicado: (2026)
Omni-directional attention mechanism based on Mamba for speech separation
por: Xue, Ke, et al.
Publicado: (2026)
por: Xue, Ke, et al.
Publicado: (2026)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
por: Li, Kai, et al.
Publicado: (2023)
por: Li, Kai, et al.
Publicado: (2023)
Representational learning for an anomalous sound detection system with source separation model
por: Shin, Seunghyeon, et al.
Publicado: (2024)
por: Shin, Seunghyeon, et al.
Publicado: (2024)
Localizing uniformly moving single-frequency sources using an inverse 2.5D approach
por: Kasess, Christian H., et al.
Publicado: (2024)
por: Kasess, Christian H., et al.
Publicado: (2024)
Determined blind source separation via modeling adjacent frequency band correlations in speech signals
por: Wang, Jianyu, et al.
Publicado: (2025)
por: Wang, Jianyu, et al.
Publicado: (2025)
Binaural sound source localization using a hybrid time and frequency domain model
por: Geva, Gil, et al.
Publicado: (2024)
por: Geva, Gil, et al.
Publicado: (2024)
Adaptive high-precision sound source localization at low frequencies based on convolutional neural network
por: Ma, Wenbo, et al.
Publicado: (2024)
por: Ma, Wenbo, et al.
Publicado: (2024)
Probing mental health information in speech foundation models
por: de Gennes, Marc, et al.
Publicado: (2024)
por: de Gennes, Marc, et al.
Publicado: (2024)
Efficient learning-based sound propagation for virtual and real-world audio processing applications
por: Ratnarajah, Anton Jeran
Publicado: (2024)
por: Ratnarajah, Anton Jeran
Publicado: (2024)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
por: García, Hugo Flores, et al.
Publicado: (2024)
por: García, Hugo Flores, et al.
Publicado: (2024)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
por: Tabatabaee, Saba, et al.
Publicado: (2026)
por: Tabatabaee, Saba, et al.
Publicado: (2026)
SonicBoom: Contact Localization Using Array of Microphones
por: Lee, Moonyoung, et al.
Publicado: (2024)
por: Lee, Moonyoung, et al.
Publicado: (2024)
On the relationship between speech and hearing
por: Umesh, Srinivasan, et al.
Publicado: (2024)
por: Umesh, Srinivasan, et al.
Publicado: (2024)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
por: Ducorroy, Alexandre, et al.
Publicado: (2025)
por: Ducorroy, Alexandre, et al.
Publicado: (2025)
TIGER: Time-frequency Interleaved Gain Extraction and Reconstruction for Efficient Speech Separation
por: Xu, Mohan, et al.
Publicado: (2024)
por: Xu, Mohan, et al.
Publicado: (2024)
SonicVisionLM: Playing Sound with Vision Language Models
por: Xie, Zhifeng, et al.
Publicado: (2024)
por: Xie, Zhifeng, et al.
Publicado: (2024)
An interpretable speech foundation model for depression detection by revealing prediction-relevant acoustic features from long speech
por: Deng, Qingkun, et al.
Publicado: (2024)
por: Deng, Qingkun, et al.
Publicado: (2024)
Can large audio language models understand child stuttering speech? speech summarization, and source separation
por: Okocha, Chibuzor, et al.
Publicado: (2025)
por: Okocha, Chibuzor, et al.
Publicado: (2025)
Exploiting spatial diversity for increasing the robustness of sound source localization systems against reverberation
por: Garcia-Barrios, Guillermo, et al.
Publicado: (2024)
por: Garcia-Barrios, Guillermo, et al.
Publicado: (2024)
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
por: Li, Junjie, et al.
Publicado: (2024)
por: Li, Junjie, et al.
Publicado: (2024)
Distilling a speech and music encoder with task arithmetic
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025)
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025)
WhisperFlow: speech foundation models in real time
por: Wang, Rongxiang, et al.
Publicado: (2024)
por: Wang, Rongxiang, et al.
Publicado: (2024)
TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion
por: Pegg, Samuel, et al.
Publicado: (2024)
por: Pegg, Samuel, et al.
Publicado: (2024)
Differentiable physics for sound field reconstruction
por: Verburg, Samuel A., et al.
Publicado: (2025)
por: Verburg, Samuel A., et al.
Publicado: (2025)
Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?
por: Araiza-Illan, Gloria, et al.
Publicado: (2023)
por: Araiza-Illan, Gloria, et al.
Publicado: (2023)
Unsupervised speech enhancement with spectral kurtosis and double deep priors
por: Ohnaka, Hien, et al.
Publicado: (2024)
por: Ohnaka, Hien, et al.
Publicado: (2024)
BFA: Real-time Multilingual Text-to-speech Forced Alignment
por: Rehman, Abdul, et al.
Publicado: (2025)
por: Rehman, Abdul, et al.
Publicado: (2025)
SPGM: Prioritizing Local Features for enhanced speech separation performance
por: Yip, Jia Qi, et al.
Publicado: (2023)
por: Yip, Jia Qi, et al.
Publicado: (2023)
Ejemplares similares
-
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
por: Sang, Wendi, et al.
Publicado: (2025) -
SPMamba: State-space model is all you need in speech separation
por: Li, Kai, et al.
Publicado: (2024) -
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
por: Yang, Runxuan, et al.
Publicado: (2025) -
Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation
por: Chen, Guo, et al.
Publicado: (2025) -
SonicRAG : High Fidelity Sound Effects Synthesis Based on Retrival Augmented Generation
por: Guo, Yu-Ren, et al.
Publicado: (2025)