Exploring Disentangled Neural Speech Codecs from Self-Supervised Representations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Aihara, Ryo, Masuyama, Yoshiki, Wichern, Gordon, Germain, François G., Roux, Jonathan Le |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SUNAC: Source-aware Unified Neural Audio Codec
par: Aihara, Ryo, et autres
Publié: (2025)
par: Aihara, Ryo, et autres
Publié: (2025)
Physics-Informed Direction-Aware Neural Acoustic Fields
par: Masuyama, Yoshiki, et autres
Publié: (2025)
par: Masuyama, Yoshiki, et autres
Publié: (2025)
Velocity Potential Neural Field for Efficient Ambisonics Impulse Response Modeling
par: Masuyama, Yoshiki, et autres
Publié: (2026)
par: Masuyama, Yoshiki, et autres
Publié: (2026)
FasTUSS: Faster Task-Aware Unified Source Separation
par: Paissan, Francesco, et autres
Publié: (2025)
par: Paissan, Francesco, et autres
Publié: (2025)
FlexIO: Flexible Single- and Multi-Channel Speech Separation and Enhancement
par: Masuyama, Yoshiki, et autres
Publié: (2025)
par: Masuyama, Yoshiki, et autres
Publié: (2025)
Retrieval-Augmented Neural Field for HRTF Upsampling and Personalization
par: Masuyama, Yoshiki, et autres
Publié: (2025)
par: Masuyama, Yoshiki, et autres
Publié: (2025)
HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement
par: Hussein, Amir, et autres
Publié: (2025)
par: Hussein, Amir, et autres
Publié: (2025)
NIIRF: Neural IIR Filter Field for HRTF Upsampling and Personalization
par: Masuyama, Yoshiki, et autres
Publié: (2024)
par: Masuyama, Yoshiki, et autres
Publié: (2024)
Enhanced Reverberation as Supervision for Unsupervised Speech Separation
par: Saijo, Kohei, et autres
Publié: (2024)
par: Saijo, Kohei, et autres
Publié: (2024)
Direction-Aware Neural Acoustic Fields for Few-Shot Interpolation of Ambisonic Impulse Responses
par: Ick, Christopher, et autres
Publié: (2025)
par: Ick, Christopher, et autres
Publié: (2025)
Predictive-Generative Drift Decomposition for Speech Enhancement and Separation
par: Richter, Julius, et autres
Publié: (2026)
par: Richter, Julius, et autres
Publié: (2026)
Why does music source separation benefit from cacophony?
par: Jeon, Chang-Bin, et autres
Publié: (2024)
par: Jeon, Chang-Bin, et autres
Publié: (2024)
Factorized RVQ-GAN For Disentangled Speech Tokenization
par: Khurana, Sameer, et autres
Publié: (2025)
par: Khurana, Sameer, et autres
Publié: (2025)
TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and Enhancement
par: Saijo, Kohei, et autres
Publié: (2024)
par: Saijo, Kohei, et autres
Publié: (2024)
Data Augmentation Using Neural Acoustic Fields With Retrieval-Augmented Pre-training
par: Ick, Christopher, et autres
Publié: (2025)
par: Ick, Christopher, et autres
Publié: (2025)
Sound Event Bounding Boxes
par: Ebbers, Janek, et autres
Publié: (2024)
par: Ebbers, Janek, et autres
Publié: (2024)
SMITIN: Self-Monitored Inference-Time INtervention for Generative Music Transformers
par: Koo, Junghyun, et autres
Publié: (2024)
par: Koo, Junghyun, et autres
Publié: (2024)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
par: Sato, Hiroshi, et autres
Publié: (2025)
par: Sato, Hiroshi, et autres
Publié: (2025)
Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech Codec
par: Ren, Yanzhou, et autres
Publié: (2026)
par: Ren, Yanzhou, et autres
Publié: (2026)
Task-Aware Unified Source Separation
par: Saijo, Kohei, et autres
Publié: (2024)
par: Saijo, Kohei, et autres
Publié: (2024)
Speech dereverberation constrained on room impulse response characteristics
par: Bahrman, Louis, et autres
Publié: (2024)
par: Bahrman, Louis, et autres
Publié: (2024)
Bird Vocalization Embedding Extraction Using Self-Supervised Disentangled Representation Learning
par: Shi, Runwu, et autres
Publié: (2024)
par: Shi, Runwu, et autres
Publié: (2024)
Local Density-Based Anomaly Score Normalization for Domain Generalization
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
Leveraging Audio-Only Data for Text-Queried Target Sound Extraction
par: Saijo, Kohei, et autres
Publié: (2024)
par: Saijo, Kohei, et autres
Publié: (2024)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
par: Wu, Shih-Lun, et autres
Publié: (2023)
par: Wu, Shih-Lun, et autres
Publié: (2023)
Exploring the Capability of Mamba in Speech Applications
par: Miyazaki, Koichi, et autres
Publié: (2024)
par: Miyazaki, Koichi, et autres
Publié: (2024)
Relating the Neural Representations of Vocalized, Mimed, and Imagined Speech
par: Maghsoudi, Maryam, et autres
Publié: (2026)
par: Maghsoudi, Maryam, et autres
Publié: (2026)
Codec2Vec: Self-Supervised Speech Representation Learning Using Neural Speech Codecs
par: Tseng, Wei-Cheng, et autres
Publié: (2025)
par: Tseng, Wei-Cheng, et autres
Publié: (2025)
Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms
par: Premananth, Gowtham, et autres
Publié: (2024)
par: Premananth, Gowtham, et autres
Publié: (2024)
Speaker and Style Disentanglement of Speech Based on Contrastive Predictive Coding Supported Factorized Variational Autoencoder
par: Xie, Yuying, et autres
Publié: (2024)
par: Xie, Yuying, et autres
Publié: (2024)
Neural Speech and Audio Coding: Modern AI Technology Meets Traditional Codecs
par: Kim, Minje, et autres
Publié: (2024)
par: Kim, Minje, et autres
Publié: (2024)
30+ Years of Source Separation Research: Achievements and Future Challenges
par: Araki, Shoko, et autres
Publié: (2025)
par: Araki, Shoko, et autres
Publié: (2025)
Perceptually-motivated Spatial Audio Codec for Higher-Order Ambisonics Compression
par: Hold, Christoph, et autres
Publié: (2024)
par: Hold, Christoph, et autres
Publié: (2024)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
par: Zaiem, Salah, et autres
Publié: (2023)
par: Zaiem, Salah, et autres
Publié: (2023)
SpecDiff-GAN: A Spectrally-Shaped Noise Diffusion GAN for Speech and Music Synthesis
par: Baoueb, Teysir, et autres
Publié: (2024)
par: Baoueb, Teysir, et autres
Publié: (2024)
Spatially Aware Self-Supervised Models for Multi-Channel Neural Speaker Diarization
par: Han, Jiangyu, et autres
Publié: (2025)
par: Han, Jiangyu, et autres
Publié: (2025)
Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition
par: Masuyama, Yoshiki, et autres
Publié: (2024)
par: Masuyama, Yoshiki, et autres
Publié: (2024)
USDnet: Unsupervised Speech Dereverberation via Neural Forward Filtering
par: Wang, Zhong-Qiu
Publié: (2024)
par: Wang, Zhong-Qiu
Publié: (2024)
Mind the Gap: Detecting Cluster Exits for Robust Local Density-Based Score Normalization in Anomalous Sound Detection
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Documents similaires
-
SUNAC: Source-aware Unified Neural Audio Codec
par: Aihara, Ryo, et autres
Publié: (2025) -
Physics-Informed Direction-Aware Neural Acoustic Fields
par: Masuyama, Yoshiki, et autres
Publié: (2025) -
Velocity Potential Neural Field for Efficient Ambisonics Impulse Response Modeling
par: Masuyama, Yoshiki, et autres
Publié: (2026) -
FasTUSS: Faster Task-Aware Unified Source Separation
par: Paissan, Francesco, et autres
Publié: (2025) -
FlexIO: Flexible Single- and Multi-Channel Speech Separation and Enhancement
par: Masuyama, Yoshiki, et autres
Publié: (2025)