Towards an Accessible and Rapidly Trainable Rhythm Sequencer Using a Generative Stacked Autoencoder
Fuente:
arXiv
Guardado en:
| Autor principal: | Wastnidge, Alex |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generating Rhythm Game Music with Jukebox
por: Yan, Nicholas
Publicado: (2023)
por: Yan, Nicholas
Publicado: (2023)
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
por: O'Reilly, Patrick, et al.
Publicado: (2025)
por: O'Reilly, Patrick, et al.
Publicado: (2025)
DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization
por: Chen, Huakang, et al.
Publicado: (2025)
por: Chen, Huakang, et al.
Publicado: (2025)
Network Modulation Synthesis: New Algorithms for Generating Musical Audio Using Autoencoder Networks
por: Hyrkas, Jeremy
Publicado: (2021)
por: Hyrkas, Jeremy
Publicado: (2021)
A Generative-First Neural Audio Autoencoder
por: Casebeer, Jonah, et al.
Publicado: (2026)
por: Casebeer, Jonah, et al.
Publicado: (2026)
Leveraging AM and FM Rhythm Spectrograms for Dementia Classification and Assessment
por: Gogoi, Parismita, et al.
Publicado: (2025)
por: Gogoi, Parismita, et al.
Publicado: (2025)
Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations
por: Wachter, Maximilian, et al.
Publicado: (2026)
por: Wachter, Maximilian, et al.
Publicado: (2026)
Muyan-TTS: A Trainable Text-to-Speech Model Optimized for Podcast Scenarios with a $50K Budget
por: Li, Xin, et al.
Publicado: (2025)
por: Li, Xin, et al.
Publicado: (2025)
Wave-Trainer-Fit: Neural Vocoder with Trainable Prior and Fixed-Point Iteration towards High-Quality Speech Generation from SSL features
por: Ohnaka, Hien, et al.
Publicado: (2026)
por: Ohnaka, Hien, et al.
Publicado: (2026)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
Variational Autoencoder for Personalized Pathological Speech Enhancement
por: Hou, Mingchi, et al.
Publicado: (2025)
por: Hou, Mingchi, et al.
Publicado: (2025)
Multimodal Lyrics-Rhythm Matching
por: Liao, Callie C., et al.
Publicado: (2023)
por: Liao, Callie C., et al.
Publicado: (2023)
Automatic Live Music Song Identification Using Multi-level Deep Sequence Similarity Learning
por: Hakala, Aapo, et al.
Publicado: (2025)
por: Hakala, Aapo, et al.
Publicado: (2025)
Imperceptible Rhythm Backdoor Attacks: Exploring Rhythm Transformation for Embedding Undetectable Vulnerabilities on Speech Recognition
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
Learning Magnitude Distribution of Sound Fields via Conditioned Autoencoder
por: Koyama, Shoichi, et al.
Publicado: (2025)
por: Koyama, Shoichi, et al.
Publicado: (2025)
Disentangling Dual-Encoder Masked Autoencoder for Respiratory Sound Classification
por: Wei, Peidong, et al.
Publicado: (2025)
por: Wei, Peidong, et al.
Publicado: (2025)
Pre-training Autoencoder for Acoustic Event Classification via Blinky
por: Liu, Xiaoyang, et al.
Publicado: (2025)
por: Liu, Xiaoyang, et al.
Publicado: (2025)
Audible Networks: Deconstructing and Manipulating Sounds with Deep Non-Negative Autoencoders
por: Burred, Juan José, et al.
Publicado: (2025)
por: Burred, Juan José, et al.
Publicado: (2025)
Fine-Tuning Automatic Speech Recognition for People with Parkinson's: An Effective Strategy for Enhancing Speech Technology Accessibility
por: Zheng, Xiuwen, et al.
Publicado: (2024)
por: Zheng, Xiuwen, et al.
Publicado: (2024)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026)
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026)
MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation
por: Lan, Yun-Han, et al.
Publicado: (2024)
por: Lan, Yun-Han, et al.
Publicado: (2024)
Improving Speech Emotion Recognition Through Cross Modal Attention Alignment and Balanced Stacking Model
por: Ueda, Lucas, et al.
Publicado: (2025)
por: Ueda, Lucas, et al.
Publicado: (2025)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
ACE-Step: A Step Towards Music Generation Foundation Model
por: Gong, Junmin, et al.
Publicado: (2025)
por: Gong, Junmin, et al.
Publicado: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
Period Singer: Integrating Periodic and Aperiodic Variational Autoencoders for Natural-Sounding End-to-End Singing Voice Synthesis
por: Kim, Taewoo, et al.
Publicado: (2024)
por: Kim, Taewoo, et al.
Publicado: (2024)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
por: Wang, Yuanyuan, et al.
Publicado: (2024)
por: Wang, Yuanyuan, et al.
Publicado: (2024)
Towards High-Fidelity and Controllable Bioacoustic Generation via Enhanced Diffusion Learning
por: Song, Tianyu, et al.
Publicado: (2025)
por: Song, Tianyu, et al.
Publicado: (2025)
FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
por: Xie, Kun, et al.
Publicado: (2025)
por: Xie, Kun, et al.
Publicado: (2025)
DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis
por: Gu, Yu, et al.
Publicado: (2024)
por: Gu, Yu, et al.
Publicado: (2024)
Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision
por: Li, Zhaoqing, et al.
Publicado: (2025)
por: Li, Zhaoqing, et al.
Publicado: (2025)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
por: Yang, Xiaoyu, et al.
Publicado: (2024)
por: Yang, Xiaoyu, et al.
Publicado: (2024)
Efficient Long Speech Sequence Modelling for Time-Domain Depression Level Estimation
por: Li, Shuanglin, et al.
Publicado: (2025)
por: Li, Shuanglin, et al.
Publicado: (2025)
Enhancing Open-Set Speaker Identification through Rapid Tuning with Speaker Reciprocal Points and Negative Sample
por: Chen, Zhiyong, et al.
Publicado: (2024)
por: Chen, Zhiyong, et al.
Publicado: (2024)
ParaStyleTTS: Toward Efficient and Robust Paralinguistic Style Control for Expressive Text-to-Speech Generation
por: Lou, Haowei, et al.
Publicado: (2025)
por: Lou, Haowei, et al.
Publicado: (2025)
Simultaneous Music Separation and Generation Using Multi-Track Latent Diffusion Models
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
por: Kushwaha, Saksham Singh, et al.
Publicado: (2024)
por: Kushwaha, Saksham Singh, et al.
Publicado: (2024)
Generalized Audio Deepfake Detection Using Frame-level Latent Information Entropy
por: Zhao, Botao, et al.
Publicado: (2025)
por: Zhao, Botao, et al.
Publicado: (2025)
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
por: Wang, Haoran, et al.
Publicado: (2025)
por: Wang, Haoran, et al.
Publicado: (2025)
A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion
por: Geng, Haopeng, et al.
Publicado: (2025)
por: Geng, Haopeng, et al.
Publicado: (2025)
Ejemplares similares
-
Generating Rhythm Game Music with Jukebox
por: Yan, Nicholas
Publicado: (2023) -
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
por: O'Reilly, Patrick, et al.
Publicado: (2025) -
DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization
por: Chen, Huakang, et al.
Publicado: (2025) -
Network Modulation Synthesis: New Algorithms for Generating Musical Audio Using Autoencoder Networks
por: Hyrkas, Jeremy
Publicado: (2021) -
A Generative-First Neural Audio Autoencoder
por: Casebeer, Jonah, et al.
Publicado: (2026)