Iterative refinement, not training objective, makes HuBERT behave differently from wav2vec 2.0
Fuente:
arXiv
Guardado en:
| Autores principales: | Huo, Robin, Dunbar, Ewan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
por: Yoon, Ji Won, et al.
Publicado: (2022)
por: Yoon, Ji Won, et al.
Publicado: (2022)
Automatic classification of stop realisation with wav2vec2.0
por: Tanner, James, et al.
Publicado: (2025)
por: Tanner, James, et al.
Publicado: (2025)
mHuBERT-147: A Compact Multilingual HuBERT Model
por: Boito, Marcely Zanon, et al.
Publicado: (2024)
por: Boito, Marcely Zanon, et al.
Publicado: (2024)
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
por: Bayerl, Sebastian P., et al.
Publicado: (2022)
por: Bayerl, Sebastian P., et al.
Publicado: (2022)
MelHuBERT: A simplified HuBERT on Mel spectrograms
por: Lin, Tzu-Quan, et al.
Publicado: (2022)
por: Lin, Tzu-Quan, et al.
Publicado: (2022)
Self-Supervised Syllable Discovery Based on Speaker-Disentangled HuBERT
por: Komatsu, Ryota, et al.
Publicado: (2024)
por: Komatsu, Ryota, et al.
Publicado: (2024)
Phonetic and Lexical Discovery of a Canine Language using HuBERT
por: Li, Xingyuan, et al.
Publicado: (2024)
por: Li, Xingyuan, et al.
Publicado: (2024)
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
por: Wu, Wenxuan, et al.
Publicado: (2024)
por: Wu, Wenxuan, et al.
Publicado: (2024)
Mixture of Experts Fusion for Fake Audio Detection Using Frozen wav2vec 2.0
por: Wang, Zhiyong, et al.
Publicado: (2024)
por: Wang, Zhiyong, et al.
Publicado: (2024)
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
por: Cho, Cheol Jun, et al.
Publicado: (2023)
por: Cho, Cheol Jun, et al.
Publicado: (2023)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
RobustSVC: HuBERT-based Melody Extractor and Adversarial Learning for Robust Singing Voice Conversion
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
por: Chen, Xueyuan, et al.
Publicado: (2024)
por: Chen, Xueyuan, et al.
Publicado: (2024)
Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction
por: Shi, Jiatong, et al.
Publicado: (2023)
por: Shi, Jiatong, et al.
Publicado: (2023)
DiceHuBERT: Distilling HuBERT with a Self-Supervised Learning Objective
por: Chi, Hyung Gun, et al.
Publicado: (2025)
por: Chi, Hyung Gun, et al.
Publicado: (2025)
Multichannel AV-wav2vec2: A Framework for Learning Multichannel Multi-Modal Speech Representation
por: Zhu, Qiushi, et al.
Publicado: (2024)
por: Zhu, Qiushi, et al.
Publicado: (2024)
Enhancing and Exploring Mild Cognitive Impairment Detection with W2V-BERT-2.0
por: Wang, Yueguan, et al.
Publicado: (2025)
por: Wang, Yueguan, et al.
Publicado: (2025)
AfriHuBERT: A self-supervised speech representation model for African languages
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
VisG AV-HuBERT: Viseme-Guided AV-HuBERT
por: Papadopoulos, Aristeidis, et al.
Publicado: (2026)
por: Papadopoulos, Aristeidis, et al.
Publicado: (2026)
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
por: Li, Feng, et al.
Publicado: (2024)
por: Li, Feng, et al.
Publicado: (2024)
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition
por: Shao, Qijie, et al.
Publicado: (2025)
por: Shao, Qijie, et al.
Publicado: (2025)
The Faetar Benchmark: Speech Recognition in a Very Under-Resourced Language
por: Ong, Michael, et al.
Publicado: (2024)
por: Ong, Michael, et al.
Publicado: (2024)
CPT-Boosted Wav2vec2.0: Towards Noise Robust Speech Recognition for Classroom Environments
por: Attia, Ahmed Adel, et al.
Publicado: (2024)
por: Attia, Ahmed Adel, et al.
Publicado: (2024)
Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2025)
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2025)
Bigger is not Always Better: The Effect of Context Size on Speech Pre-Training
por: Robertson, Sean, et al.
Publicado: (2023)
por: Robertson, Sean, et al.
Publicado: (2023)
Experimental Study: Enhancing Voice Spoofing Detection Models with wav2vec 2.0
por: Kang, Taein, et al.
Publicado: (2024)
por: Kang, Taein, et al.
Publicado: (2024)
DiscoPhon: Benchmarking the Unsupervised Discovery of Phoneme Inventories With Discrete Speech Units
por: Poli, Maxime, et al.
Publicado: (2026)
por: Poli, Maxime, et al.
Publicado: (2026)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023)
por: Huang, Kuan-Po, et al.
Publicado: (2023)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
por: Nie, Yuting, et al.
Publicado: (2022)
por: Nie, Yuting, et al.
Publicado: (2022)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
por: Ahn, Hyebin, et al.
Publicado: (2025)
por: Ahn, Hyebin, et al.
Publicado: (2025)
Speaker Emotion Recognition: Leveraging Self-Supervised Models for Feature Extraction Using Wav2Vec2 and HuBERT
por: Jafarzadeh, Pourya, et al.
Publicado: (2024)
por: Jafarzadeh, Pourya, et al.
Publicado: (2024)
Comparative Evaluation of Expressive Japanese Character Text-to-Speech with VITS and Style-BERT-VITS2
por: Rackauckas, Zackary, et al.
Publicado: (2025)
por: Rackauckas, Zackary, et al.
Publicado: (2025)
Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages
por: Anidjar, Or Haim, et al.
Publicado: (2024)
por: Anidjar, Or Haim, et al.
Publicado: (2024)
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
por: Grossman, Raymond, et al.
Publicado: (2025)
por: Grossman, Raymond, et al.
Publicado: (2025)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice
por: Cheng, Shanbo, et al.
Publicado: (2025)
por: Cheng, Shanbo, et al.
Publicado: (2025)
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
por: Wang, Qingzheng, et al.
Publicado: (2025)
por: Wang, Qingzheng, et al.
Publicado: (2025)
Enhancing Speaker Verification with w2v-BERT 2.0 and Knowledge Distillation guided Structured Pruning
por: Li, Ze, et al.
Publicado: (2025)
por: Li, Ze, et al.
Publicado: (2025)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
por: Yamauchi, Kazuki, et al.
Publicado: (2024)
por: Yamauchi, Kazuki, et al.
Publicado: (2024)
Miipher-2: A Universal Speech Restoration Model for Million-Hour Scale Data Restoration
por: Karita, Shigeki, et al.
Publicado: (2025)
por: Karita, Shigeki, et al.
Publicado: (2025)
Ejemplares similares
-
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
por: Yoon, Ji Won, et al.
Publicado: (2022) -
Automatic classification of stop realisation with wav2vec2.0
por: Tanner, James, et al.
Publicado: (2025) -
mHuBERT-147: A Compact Multilingual HuBERT Model
por: Boito, Marcely Zanon, et al.
Publicado: (2024) -
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
por: Bayerl, Sebastian P., et al.
Publicado: (2022) -
MelHuBERT: A simplified HuBERT on Mel spectrograms
por: Lin, Tzu-Quan, et al.
Publicado: (2022)