TokenSynth: A Token-based Neural Synthesizer for Instrument Cloning and Text-to-Instrument
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Kyungsu, Koo, Junghyun, Lee, Sungho, Joung, Haesun, Lee, Kyogu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Music Auto-Tagging with Robust Music Representation Learned via Domain Adversarial Training
par: Joung, Haesun, et autres
Publié: (2024)
par: Joung, Haesun, et autres
Publié: (2024)
DDD: A Perceptually Superior Low-Response-Time DNN-based Declipper
par: Yi, Jayeon, et autres
Publié: (2024)
par: Yi, Jayeon, et autres
Publié: (2024)
Distance Sampling-based Paraphraser Leveraging ChatGPT for Text Data Manipulation
par: Oh, Yoori, et autres
Publié: (2024)
par: Oh, Yoori, et autres
Publié: (2024)
Learning Semantic Information from Raw Audio Signal Using Both Contextual and Phonetic Representations
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
Removing Speaker Information from Speech Representation using Variable-Length Soft Pooling
par: Hwang, Injune, et autres
Publié: (2024)
par: Hwang, Injune, et autres
Publié: (2024)
CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens
par: Du, Zhihao, et autres
Publié: (2024)
par: Du, Zhihao, et autres
Publié: (2024)
Wavespace: A Highly Explorable Wavetable Generator
par: Lee, Hazounne, et autres
Publié: (2024)
par: Lee, Hazounne, et autres
Publié: (2024)
Token Pruning in Audio Transformers: Optimizing Performance and Decoding Patch Importance
par: Lee, Taehan, et autres
Publié: (2025)
par: Lee, Taehan, et autres
Publié: (2025)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
par: Han, Seungu, et autres
Publié: (2026)
par: Han, Seungu, et autres
Publié: (2026)
Practical and Reproducible Symbolic Music Generation by Large Language Models with Structural Embeddings
par: Rhyu, Seungyeon, et autres
Publié: (2024)
par: Rhyu, Seungyeon, et autres
Publié: (2024)
SynthScribe: Deep Multimodal Tools for Synthesizer Sound Retrieval and Exploration
par: Brade, Stephen, et autres
Publié: (2023)
par: Brade, Stephen, et autres
Publié: (2023)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
par: Nguyen, Tan Dat, et autres
Publié: (2024)
par: Nguyen, Tan Dat, et autres
Publié: (2024)
Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech
par: Kotoge, Rikuto, et autres
Publié: (2025)
par: Kotoge, Rikuto, et autres
Publié: (2025)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
par: Paissan, Francesco, et autres
Publié: (2026)
par: Paissan, Francesco, et autres
Publié: (2026)
Neural Multi-Speaker Voice Cloning for Nepali in Low-Resource Settings
par: Shrestha, Aayush M., et autres
Publié: (2026)
par: Shrestha, Aayush M., et autres
Publié: (2026)
DOSE : Drum One-Shot Extraction from Music Mixture
par: Hwang, Suntae, et autres
Publié: (2025)
par: Hwang, Suntae, et autres
Publié: (2025)
Residual Tokens Enhance Masked Autoencoders for Speech Modeling
par: Sadok, Samir, et autres
Publié: (2026)
par: Sadok, Samir, et autres
Publié: (2026)
DSA-Tokenizer: Disentangled Semantic-Acoustic Tokenization via Flow Matching-based Hierarchical Fusion
par: Zhang, Hanlin, et autres
Publié: (2026)
par: Zhang, Hanlin, et autres
Publié: (2026)
Few-step Adversarial Schrödinger Bridge for Generative Speech Enhancement
par: Han, Seungu, et autres
Publié: (2025)
par: Han, Seungu, et autres
Publié: (2025)
TokenDance: Token-to-Token Music-to-Dance Generation with Bidirectional Mamba
par: Yang, Ziyue, et autres
Publié: (2026)
par: Yang, Ziyue, et autres
Publié: (2026)
Deep Neural Network for Musical Instrument Recognition using MFCCs
par: Mahanta, Saranga Kingkor, et autres
Publié: (2021)
par: Mahanta, Saranga Kingkor, et autres
Publié: (2021)
Differentiable Modal Synthesis for Physical Modeling of Planar String Sound and Motion Simulation
par: Lee, Jin Woo, et autres
Publié: (2024)
par: Lee, Jin Woo, et autres
Publié: (2024)
CONMOD: Controllable Neural Frame-based Modulation Effects
par: Lee, Gyubin, et autres
Publié: (2024)
par: Lee, Gyubin, et autres
Publié: (2024)
A Hierarchical Deep Learning Approach for Minority Instrument Detection
par: Sechet, Dylan, et autres
Publié: (2025)
par: Sechet, Dylan, et autres
Publié: (2025)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
par: Choi, Yerin, et autres
Publié: (2024)
par: Choi, Yerin, et autres
Publié: (2024)
Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation
par: Cheng, Yuqing, et autres
Publié: (2026)
par: Cheng, Yuqing, et autres
Publié: (2026)
Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation
par: Liu, Jiafeng, et autres
Publié: (2026)
par: Liu, Jiafeng, et autres
Publié: (2026)
DuoTok: Source-Aware Dual-Track Tokenization for Multi-Track Music Language Modeling
par: Lin, Rui, et autres
Publié: (2025)
par: Lin, Rui, et autres
Publié: (2025)
Universal Speech Token Learning via Low-Bitrate Neural Codec and Pretrained Representations
par: Jiang, Xue, et autres
Publié: (2025)
par: Jiang, Xue, et autres
Publié: (2025)
Toward Complex-Valued Neural Networks for Waveform Generation
par: Oh, Hyung-Seok, et autres
Publié: (2026)
par: Oh, Hyung-Seok, et autres
Publié: (2026)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
VocalNet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction
par: Wang, Yuhao, et autres
Publié: (2025)
par: Wang, Yuhao, et autres
Publié: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
par: Wang, Xinsheng, et autres
Publié: (2025)
par: Wang, Xinsheng, et autres
Publié: (2025)
A Lightweight Pipeline for Noisy Speech Voice Cloning and Accurate Lip Sync Synthesis
par: Amir, Javeria, et autres
Publié: (2025)
par: Amir, Javeria, et autres
Publié: (2025)
CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance
par: Zhao, Junchuan, et autres
Publié: (2025)
par: Zhao, Junchuan, et autres
Publié: (2025)
A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech
par: Huang, Jia-Hong, et autres
Publié: (2026)
par: Huang, Jia-Hong, et autres
Publié: (2026)
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
par: Della Libera, Luca, et autres
Publié: (2026)
par: Della Libera, Luca, et autres
Publié: (2026)
Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis
par: Cui, Shuyang, et autres
Publié: (2026)
par: Cui, Shuyang, et autres
Publié: (2026)
Discrete Audio Tokens: More Than a Survey!
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
CloneShield: A Framework for Universal Perturbation Against Zero-Shot Voice Cloning
par: Li, Renyuan, et autres
Publié: (2025)
par: Li, Renyuan, et autres
Publié: (2025)
Documents similaires
-
Music Auto-Tagging with Robust Music Representation Learned via Domain Adversarial Training
par: Joung, Haesun, et autres
Publié: (2024) -
DDD: A Perceptually Superior Low-Response-Time DNN-based Declipper
par: Yi, Jayeon, et autres
Publié: (2024) -
Distance Sampling-based Paraphraser Leveraging ChatGPT for Text Data Manipulation
par: Oh, Yoori, et autres
Publié: (2024) -
Learning Semantic Information from Raw Audio Signal Using Both Contextual and Phonetic Representations
par: Kim, Jaeyeon, et autres
Publié: (2024) -
Removing Speaker Information from Speech Representation using Variable-Length Soft Pooling
par: Hwang, Injune, et autres
Publié: (2024)