AnyAccomp: Generalizable Accompaniment Generation via Quantized Melodic Bottleneck
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Junan, Zhang, Yunjia, Zhang, Xueyao, Wu, Zhizheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
por: Gu, Yicheng, et al.
Publicado: (2024)
por: Gu, Yicheng, et al.
Publicado: (2024)
Aliasing-Free Neural Audio Synthesis
por: Gu, Yicheng, et al.
Publicado: (2025)
por: Gu, Yicheng, et al.
Publicado: (2025)
Solid State Bus-Comp: A Large-Scale and Diverse Dataset for Dynamic Range Compressor Virtual Analog Modeling
por: Gu, Yicheng, et al.
Publicado: (2025)
por: Gu, Yicheng, et al.
Publicado: (2025)
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
por: Jiang, Shaohan, et al.
Publicado: (2025)
por: Jiang, Shaohan, et al.
Publicado: (2025)
Multi-Metric Preference Alignment for Generative Speech Restoration
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
por: Gu, Yicheng, et al.
Publicado: (2025)
por: Gu, Yicheng, et al.
Publicado: (2025)
Beyond Identity: A Generalizable Approach for Deepfake Audio Detection
por: Ahmadiadli, Yasaman, et al.
Publicado: (2025)
por: Ahmadiadli, Yasaman, et al.
Publicado: (2025)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
por: Zhang, Xueyao, et al.
Publicado: (2023)
por: Zhang, Xueyao, et al.
Publicado: (2023)
A Data-Centric Approach to Generalizable Speech Deepfake Detection
por: Huang, Wen, et al.
Publicado: (2025)
por: Huang, Wen, et al.
Publicado: (2025)
AnyEnhance: A Unified Generative Model with Prompt-Guidance and Self-Critic for Voice Enhancement
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
An Attention-Assisted Multi-Modal Data Fusion Model for Real-Time Estimation of Underwater Sound Velocity
por: Wu, Pengfei, et al.
Publicado: (2025)
por: Wu, Pengfei, et al.
Publicado: (2025)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
Lightweight and Generalizable Acoustic Scene Representations via Contrastive Fine-Tuning and Distillation
por: Yuan, Kuang, et al.
Publicado: (2025)
por: Yuan, Kuang, et al.
Publicado: (2025)
The CCF AATC 2025 Speech Restoration Challenge: A Retrospective
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
Noisereduce: Domain General Noise Reduction for Time Series Signals
por: Sainburg, Tim, et al.
Publicado: (2024)
por: Sainburg, Tim, et al.
Publicado: (2024)
Future Full-Ocean Deep SSPs Prediction based on Hierarchical Long Short-Term Memory Neural Networks
por: Lu, Jiajun, et al.
Publicado: (2023)
por: Lu, Jiajun, et al.
Publicado: (2023)
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
por: Wang, Yuxiang, et al.
Publicado: (2026)
por: Wang, Yuxiang, et al.
Publicado: (2026)
SSM2Mel: State Space Model to Reconstruct Mel Spectrogram from the EEG
por: Fan, Cunhang, et al.
Publicado: (2025)
por: Fan, Cunhang, et al.
Publicado: (2025)
Binaural Selective Attention Model for Target Speaker Extraction
por: Meng, Hanyu, et al.
Publicado: (2024)
por: Meng, Hanyu, et al.
Publicado: (2024)
An LLM-Enabled Frequency-Aware Flow Diffusion Model for Natural-Language-Guided Power System Scenario Generation
por: Zhou, Zhenghao, et al.
Publicado: (2026)
por: Zhou, Zhenghao, et al.
Publicado: (2026)
Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization
por: Gao, Xiaoxue, et al.
Publicado: (2024)
por: Gao, Xiaoxue, et al.
Publicado: (2024)
A Multimodal Data Fusion Attention-Empowered Generative Adversarial Network for Real Time 3D Underwater Sound Speed Field Construction
por: Huang, Wei, et al.
Publicado: (2025)
por: Huang, Wei, et al.
Publicado: (2025)
Dynamic Prediction of Full-Ocean Depth SSP by Hierarchical LSTM: An Experimental Result
por: Lu, Jiajun, et al.
Publicado: (2023)
por: Lu, Jiajun, et al.
Publicado: (2023)
Self-supervised speech representation and contextual text embedding for match-mismatch classification with EEG recording
por: Wang, Bo, et al.
Publicado: (2024)
por: Wang, Bo, et al.
Publicado: (2024)
STNet: Prediction of Underwater Sound Speed Profiles with An Advanced Semi-Transformer Neural Network
por: Huang, Wei, et al.
Publicado: (2025)
por: Huang, Wei, et al.
Publicado: (2025)
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
por: Meng, Hanyu, et al.
Publicado: (2025)
por: Meng, Hanyu, et al.
Publicado: (2025)
LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement
por: Yan, Haoyin, et al.
Publicado: (2024)
por: Yan, Haoyin, et al.
Publicado: (2024)
Toward Universal Speech Enhancement for Diverse Input Conditions
por: Zhang, Wangyou, et al.
Publicado: (2023)
por: Zhang, Wangyou, et al.
Publicado: (2023)
Dynamic Multi-Species Bird Soundscape Generation with Acoustic Patterning and 3D Spatialization
por: Zhang, Ellie L., et al.
Publicado: (2025)
por: Zhang, Ellie L., et al.
Publicado: (2025)
Machine Learning in Acoustics: A Review and Open-Source Repository
por: McCarthy, Ryan A., et al.
Publicado: (2025)
por: McCarthy, Ryan A., et al.
Publicado: (2025)
SoundSpring: Loss-Resilient Audio Transceiver with Dual-Functional Masked Language Modeling
por: Yao, Shengshi, et al.
Publicado: (2025)
por: Yao, Shengshi, et al.
Publicado: (2025)
State Space and Self-Attention Collaborative Network with Feature Aggregation for DOA Estimation
por: You, Qi, et al.
Publicado: (2025)
por: You, Qi, et al.
Publicado: (2025)
Investigation of Feature Selection and Pooling Methods for Environmental Sound Classification
por: Dehaghani, Parinaz Binandeh, et al.
Publicado: (2025)
por: Dehaghani, Parinaz Binandeh, et al.
Publicado: (2025)
Unsupervised EEG-based decoding of absolute auditory attention with canonical correlation analysis
por: Heintz, Nicolas, et al.
Publicado: (2025)
por: Heintz, Nicolas, et al.
Publicado: (2025)
Efficient Solutions for Mitigating Initialization Bias in Unsupervised Self-Adaptive Auditory Attention Decoding
por: Yao, Yuanyuan, et al.
Publicado: (2025)
por: Yao, Yuanyuan, et al.
Publicado: (2025)
QINCODEC: Neural Audio Compression with Implicit Neural Codebooks
por: Lahrichi, Zineb, et al.
Publicado: (2025)
por: Lahrichi, Zineb, et al.
Publicado: (2025)
SONIC: Sound Optimization for Noise In Crowds
por: N, Pranav M, et al.
Publicado: (2025)
por: N, Pranav M, et al.
Publicado: (2025)
Audio-Visual Speech Enhancement: Architectural Design and Deployment Strategies
por: Hamadouche, Anis, et al.
Publicado: (2025)
por: Hamadouche, Anis, et al.
Publicado: (2025)
Ejemplares similares
-
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
por: Wang, Yuancheng, et al.
Publicado: (2025) -
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
por: Gu, Yicheng, et al.
Publicado: (2024) -
Aliasing-Free Neural Audio Synthesis
por: Gu, Yicheng, et al.
Publicado: (2025) -
Solid State Bus-Comp: A Large-Scale and Diverse Dataset for Dynamic Range Compressor Virtual Analog Modeling
por: Gu, Yicheng, et al.
Publicado: (2025) -
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
por: Jiang, Shaohan, et al.
Publicado: (2025)