Residual Tokens Enhance Masked Autoencoders for Speech Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Sadok, Samir, Lathuilière, Stéphane, Alameda-Pineda, Xavier |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder
di: Sadok, Samir, et al.
Pubblicazione: (2025)
di: Sadok, Samir, et al.
Pubblicazione: (2025)
The Equalizer: Introducing Shape-Gain Decomposition in Neural Audio Codecs
di: Sadok, Samir, et al.
Pubblicazione: (2026)
di: Sadok, Samir, et al.
Pubblicazione: (2026)
Scaling Speech Tokenizers with Diffusion Autoencoders
di: Wang, Yuancheng, et al.
Pubblicazione: (2026)
di: Wang, Yuancheng, et al.
Pubblicazione: (2026)
Diffusion-based Unsupervised Audio-visual Speech Enhancement
di: Ayilo, Jean-Eudes, et al.
Pubblicazione: (2024)
di: Ayilo, Jean-Eudes, et al.
Pubblicazione: (2024)
A multimodal dynamical variational autoencoder for audiovisual speech representation learning
di: Sadok, Samir, et al.
Pubblicazione: (2023)
di: Sadok, Samir, et al.
Pubblicazione: (2023)
SyncSpeech: Efficient and Low-Latency Text-to-Speech based on Temporal Masked Transformer
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
Diffusion-based Frameworks for Unsupervised Speech Enhancement
di: Ayilo, Jean-Eudes, et al.
Pubblicazione: (2026)
di: Ayilo, Jean-Eudes, et al.
Pubblicazione: (2026)
Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations
di: Han, Yichen, et al.
Pubblicazione: (2025)
di: Han, Yichen, et al.
Pubblicazione: (2025)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
di: Zhao, Junqi, et al.
Pubblicazione: (2024)
di: Zhao, Junqi, et al.
Pubblicazione: (2024)
Full-Frequency Temporal Patching and Structured Masking for Enhanced Audio Classification
di: Makineni, Aditya, et al.
Pubblicazione: (2025)
di: Makineni, Aditya, et al.
Pubblicazione: (2025)
GSRM: Generative Speech Reward Model for Speech RLHF
di: Shen, Maohao, et al.
Pubblicazione: (2026)
di: Shen, Maohao, et al.
Pubblicazione: (2026)
MATPAC++: Enhanced Masked Latent Prediction for Self-Supervised Audio Representation Learning
di: Quelennec, Aurian, et al.
Pubblicazione: (2025)
di: Quelennec, Aurian, et al.
Pubblicazione: (2025)
SLM-SS: Speech Language Model for Generative Speech Separation
di: Li, Tianhua, et al.
Pubblicazione: (2026)
di: Li, Tianhua, et al.
Pubblicazione: (2026)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
di: Wang, Xinsheng, et al.
Pubblicazione: (2025)
di: Wang, Xinsheng, et al.
Pubblicazione: (2025)
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
di: Della Libera, Luca, et al.
Pubblicazione: (2026)
Posterior Transition Modeling for Unsupervised Diffusion-Based Speech Enhancement
di: Sadeghi, Mostafa, et al.
Pubblicazione: (2025)
di: Sadeghi, Mostafa, et al.
Pubblicazione: (2025)
SAME: A Semantically-Aligned Music Autoencoder
di: Parker, Julian D., et al.
Pubblicazione: (2026)
di: Parker, Julian D., et al.
Pubblicazione: (2026)
Mask2Flow-TSE: Two-Stage Target Speaker Extraction with Masking and Flow Matching
di: Moon, Junwon, et al.
Pubblicazione: (2026)
di: Moon, Junwon, et al.
Pubblicazione: (2026)
Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment
di: Huang, Pu, et al.
Pubblicazione: (2025)
di: Huang, Pu, et al.
Pubblicazione: (2025)
Large Speech Model Enabled Semantic Communication
di: Tian, Yun, et al.
Pubblicazione: (2025)
di: Tian, Yun, et al.
Pubblicazione: (2025)
Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models
di: Pappa, Massimiliano, et al.
Pubblicazione: (2026)
di: Pappa, Massimiliano, et al.
Pubblicazione: (2026)
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
di: Xue, Jun, et al.
Pubblicazione: (2026)
di: Xue, Jun, et al.
Pubblicazione: (2026)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
di: Kammoun, Sofiene, et al.
Pubblicazione: (2025)
di: Kammoun, Sofiene, et al.
Pubblicazione: (2025)
Learning Marmoset Vocal Patterns with a Masked Autoencoder for Robust Call Segmentation, Classification, and Caller Identification
di: Wu, Bin, et al.
Pubblicazione: (2024)
di: Wu, Bin, et al.
Pubblicazione: (2024)
DDSP-QbE++: Improving Speech Quality for Speech Anonymisation for Atypical Speech
di: Ghosh, Suhita, et al.
Pubblicazione: (2026)
di: Ghosh, Suhita, et al.
Pubblicazione: (2026)
TokenSynth: A Token-based Neural Synthesizer for Instrument Cloning and Text-to-Instrument
di: Kim, Kyungsu, et al.
Pubblicazione: (2025)
di: Kim, Kyungsu, et al.
Pubblicazione: (2025)
Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech
di: Kotoge, Rikuto, et al.
Pubblicazione: (2025)
di: Kotoge, Rikuto, et al.
Pubblicazione: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2025)
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2025)
Single-stage TTS with Masked Audio Token Modeling and Semantic Knowledge Distillation
di: Gállego, Gerard I., et al.
Pubblicazione: (2024)
di: Gállego, Gerard I., et al.
Pubblicazione: (2024)
MaskSR: Masked Language Model for Full-band Speech Restoration
di: Li, Xu, et al.
Pubblicazione: (2024)
di: Li, Xu, et al.
Pubblicazione: (2024)
Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation
di: Liu, Jiafeng, et al.
Pubblicazione: (2026)
di: Liu, Jiafeng, et al.
Pubblicazione: (2026)
Understanding Frechet Speech Distance for Synthetic Speech Quality Evaluation
di: Kim, June-Woo, et al.
Pubblicazione: (2026)
di: Kim, June-Woo, et al.
Pubblicazione: (2026)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
di: Wang, Yuancheng, et al.
Pubblicazione: (2024)
di: Wang, Yuancheng, et al.
Pubblicazione: (2024)
Evolution Strategy-Based Calibration for Low-Bit Quantization of Speech Models
di: Rakotoarivony, Lucas
Pubblicazione: (2026)
di: Rakotoarivony, Lucas
Pubblicazione: (2026)
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
SpeechQualityLLM: LLM-Based Multimodal Assessment of Speech Quality
di: Monjur, Mahathir, et al.
Pubblicazione: (2025)
di: Monjur, Mahathir, et al.
Pubblicazione: (2025)
SlimSpeech: Lightweight and Efficient Text-to-Speech with Slim Rectified Flow
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
di: Cheng, Sitong, et al.
Pubblicazione: (2025)
di: Cheng, Sitong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder
di: Sadok, Samir, et al.
Pubblicazione: (2025) -
The Equalizer: Introducing Shape-Gain Decomposition in Neural Audio Codecs
di: Sadok, Samir, et al.
Pubblicazione: (2026) -
Scaling Speech Tokenizers with Diffusion Autoencoders
di: Wang, Yuancheng, et al.
Pubblicazione: (2026) -
Diffusion-based Unsupervised Audio-visual Speech Enhancement
di: Ayilo, Jean-Eudes, et al.
Pubblicazione: (2024) -
A multimodal dynamical variational autoencoder for audiovisual speech representation learning
di: Sadok, Samir, et al.
Pubblicazione: (2023)