Modeling Analog Dynamic Range Compressors using Deep Learning and State-space Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yin, Hanzhi, Cheng, Gang, Steinmetz, Christian J., Yuan, Ruibin, Stern, Richard M., Dannenberg, Roger B. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Solid State Bus-Comp: A Large-Scale and Diverse Dataset for Dynamic Range Compressor Virtual Analog Modeling
por: Gu, Yicheng, et al.
Publicado: (2025)
por: Gu, Yicheng, et al.
Publicado: (2025)
Automatic Melody Reduction via Shortest Path Finding
por: Wang, Ziyu, et al.
Publicado: (2025)
por: Wang, Ziyu, et al.
Publicado: (2025)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
por: Dai, Shuqi, et al.
Publicado: (2025)
por: Dai, Shuqi, et al.
Publicado: (2025)
Differentiable Black-box and Gray-box Modeling of Nonlinear Audio Effects
por: Comunità, Marco, et al.
Publicado: (2025)
por: Comunità, Marco, et al.
Publicado: (2025)
Modeling Time-Variant Responses of Optical Compressors with Selective State Space Models
por: Simionato, Riccardo, et al.
Publicado: (2024)
por: Simionato, Riccardo, et al.
Publicado: (2024)
ST-ITO: Controlling Audio Effects for Style Transfer with Inference-Time Optimization
por: Steinmetz, Christian J., et al.
Publicado: (2024)
por: Steinmetz, Christian J., et al.
Publicado: (2024)
LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
por: Zhuo, Le, et al.
Publicado: (2023)
por: Zhuo, Le, et al.
Publicado: (2023)
Demo of Zero-Shot Guitar Amplifier Modelling: Enhancing Modeling with Hyper Neural Networks
por: Chen, Yu-Hua, et al.
Publicado: (2024)
por: Chen, Yu-Hua, et al.
Publicado: (2024)
Diff-MST: Differentiable Mixing Style Transfer
por: Vanka, Soumya Sai, et al.
Publicado: (2024)
por: Vanka, Soumya Sai, et al.
Publicado: (2024)
Voices of Civilizations: A Multilingual QA Benchmark for Global Music Understanding
por: Wu, Shangda, et al.
Publicado: (2026)
por: Wu, Shangda, et al.
Publicado: (2026)
Editing Music with Melody and Text: Using ControlNet for Diffusion Transformer
por: Hou, Siyuan, et al.
Publicado: (2024)
por: Hou, Siyuan, et al.
Publicado: (2024)
BickGraphing: Web-Based Application for Visual Inspection of Audio Recordings
por: Seow, Kayley, et al.
Publicado: (2026)
por: Seow, Kayley, et al.
Publicado: (2026)
MambaFoley: Foley Sound Generation using Selective State-Space Models
por: Colombo, Marco Furio, et al.
Publicado: (2024)
por: Colombo, Marco Furio, et al.
Publicado: (2024)
Dynamic Range Compression and Its Effect on Music Genre Classification
por: Madsen III, Arlyn Reese
Publicado: (2024)
por: Madsen III, Arlyn Reese
Publicado: (2024)
SongTrans: An unified song transcription and alignment method for lyrics and notes
por: Wu, Siwei, et al.
Publicado: (2024)
por: Wu, Siwei, et al.
Publicado: (2024)
The Impact of Frequency Bands on Acoustic Anomaly Detection of Machines using Deep Learning Based Model
por: Nguyen, Tin, et al.
Publicado: (2024)
por: Nguyen, Tin, et al.
Publicado: (2024)
AntiDeepFake: AI for Deep Fake Speech Recognition
por: Togootogtokh, Enkhtogtokh, et al.
Publicado: (2024)
por: Togootogtokh, Enkhtogtokh, et al.
Publicado: (2024)
Deep Learning for Tuberculosis Screening in a High-burden Setting using Cough Analysis and Speech Foundation Models
por: Ma, Ning, et al.
Publicado: (2025)
por: Ma, Ning, et al.
Publicado: (2025)
CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages
por: Wu, Shangda, et al.
Publicado: (2025)
por: Wu, Shangda, et al.
Publicado: (2025)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
por: Tang, Haobin, et al.
Publicado: (2024)
por: Tang, Haobin, et al.
Publicado: (2024)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
por: Kammoun, Sofiene, et al.
Publicado: (2025)
por: Kammoun, Sofiene, et al.
Publicado: (2025)
De-crackling Virtual Analog Controls with Asymptotically Stable Recurrent Neural Networks
por: Kallinen, Valtteri, et al.
Publicado: (2025)
por: Kallinen, Valtteri, et al.
Publicado: (2025)
Control Surfaces: Using the Commodore 64 and Analog Synthesizer to Expand Musical Boundaries
por: McKemie, Daniel
Publicado: (2025)
por: McKemie, Daniel
Publicado: (2025)
Keyword Mamba: Spoken Keyword Spotting with State Space Models
por: Ding, Hanyu, et al.
Publicado: (2025)
por: Ding, Hanyu, et al.
Publicado: (2025)
DDSP Guitar Amp: Interpretable Guitar Amplifier Modeling
por: Yeh, Yen-Tung, et al.
Publicado: (2024)
por: Yeh, Yen-Tung, et al.
Publicado: (2024)
State-Space Models in Efficient Whispered and Multi-dialect Speech Recognition
por: Farhadipour, Aref, et al.
Publicado: (2025)
por: Farhadipour, Aref, et al.
Publicado: (2025)
SAM: A Mamba-2 State-Space Audio-Language Model
por: Lee, Taehan, et al.
Publicado: (2025)
por: Lee, Taehan, et al.
Publicado: (2025)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning
por: Wang, Shuai, et al.
Publicado: (2024)
por: Wang, Shuai, et al.
Publicado: (2024)
Towards HRTF Personalization using Denoising Diffusion Models
por: Sánchez, Juan Camilo Albarracín, et al.
Publicado: (2025)
por: Sánchez, Juan Camilo Albarracín, et al.
Publicado: (2025)
Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model
por: Li, Jizhen, et al.
Publicado: (2025)
por: Li, Jizhen, et al.
Publicado: (2025)
Cross-attention Inspired Selective State Space Models for Target Sound Extraction
por: Wu, Donghang, et al.
Publicado: (2024)
por: Wu, Donghang, et al.
Publicado: (2024)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
por: Gao, Xiaoxue, et al.
Publicado: (2024)
por: Gao, Xiaoxue, et al.
Publicado: (2024)
SALM: Spatial Audio Language Model with Structured Embeddings for Understanding and Editing
por: Hu, Jinbo, et al.
Publicado: (2025)
por: Hu, Jinbo, et al.
Publicado: (2025)
Codec-SUPERB: An In-Depth Analysis of Sound Codec Models
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
por: Fang, Yuan, et al.
Publicado: (2024)
por: Fang, Yuan, et al.
Publicado: (2024)
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
por: Wei, Haojie, et al.
Publicado: (2024)
por: Wei, Haojie, et al.
Publicado: (2024)
SICRN: Advancing Speech Enhancement through State Space Model and Inplace Convolution Techniques
por: Zhao, Changjiang, et al.
Publicado: (2024)
por: Zhao, Changjiang, et al.
Publicado: (2024)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
por: Chen, Yujie, et al.
Publicado: (2024)
por: Chen, Yujie, et al.
Publicado: (2024)
CJST: CTC Compressor based Joint Speech and Text Training for Decoder-Only ASR
por: Zhou, Wei, et al.
Publicado: (2024)
por: Zhou, Wei, et al.
Publicado: (2024)
Ejemplares similares
-
Solid State Bus-Comp: A Large-Scale and Diverse Dataset for Dynamic Range Compressor Virtual Analog Modeling
por: Gu, Yicheng, et al.
Publicado: (2025) -
Automatic Melody Reduction via Shortest Path Finding
por: Wang, Ziyu, et al.
Publicado: (2025) -
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
por: Dai, Shuqi, et al.
Publicado: (2025) -
Differentiable Black-box and Gray-box Modeling of Nonlinear Audio Effects
por: Comunità, Marco, et al.
Publicado: (2025) -
Modeling Time-Variant Responses of Optical Compressors with Selective State Space Models
por: Simionato, Riccardo, et al.
Publicado: (2024)