VisG AV-HuBERT: Viseme-Guided AV-HuBERT
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Papadopoulos, Aristeidis, Jain, Rishabh, Harte, Naomi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
par: Yoon, Ji Won, et autres
Publié: (2022)
par: Yoon, Ji Won, et autres
Publié: (2022)
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
par: Cho, Cheol Jun, et autres
Publié: (2023)
par: Cho, Cheol Jun, et autres
Publié: (2023)
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
par: Wu, Wenxuan, et autres
Publié: (2024)
par: Wu, Wenxuan, et autres
Publié: (2024)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024)
par: Chen, Xueyuan, et autres
Publié: (2024)
mHuBERT-147: A Compact Multilingual HuBERT Model
par: Boito, Marcely Zanon, et autres
Publié: (2024)
par: Boito, Marcely Zanon, et autres
Publié: (2024)
MelHuBERT: A simplified HuBERT on Mel spectrograms
par: Lin, Tzu-Quan, et autres
Publié: (2022)
par: Lin, Tzu-Quan, et autres
Publié: (2022)
DiceHuBERT: Distilling HuBERT with a Self-Supervised Learning Objective
par: Chi, Hyung Gun, et autres
Publié: (2025)
par: Chi, Hyung Gun, et autres
Publié: (2025)
Interpreting the Role of Visemes in Audio-Visual Speech Recognition
par: Papadopoulos, Aristeidis, et autres
Publié: (2025)
par: Papadopoulos, Aristeidis, et autres
Publié: (2025)
Self-Supervised Syllable Discovery Based on Speaker-Disentangled HuBERT
par: Komatsu, Ryota, et autres
Publié: (2024)
par: Komatsu, Ryota, et autres
Publié: (2024)
AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos
par: Shahzad, Sahibzada Adil, et autres
Publié: (2023)
par: Shahzad, Sahibzada Adil, et autres
Publié: (2023)
Phonetic and Lexical Discovery of a Canine Language using HuBERT
par: Li, Xingyuan, et autres
Publié: (2024)
par: Li, Xingyuan, et autres
Publié: (2024)
Text-guided HuBERT: Self-Supervised Speech Pre-training via Generative Adversarial Networks
par: Ma, Duo, et autres
Publié: (2024)
par: Ma, Duo, et autres
Publié: (2024)
RobustSVC: HuBERT-based Melody Extractor and Adversarial Learning for Robust Singing Voice Conversion
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction
par: Shi, Jiatong, et autres
Publié: (2023)
par: Shi, Jiatong, et autres
Publié: (2023)
Iterative refinement, not training objective, makes HuBERT behave differently from wav2vec 2.0
par: Huo, Robin, et autres
Publié: (2025)
par: Huo, Robin, et autres
Publié: (2025)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
par: Ahn, Hyebin, et autres
Publié: (2025)
par: Ahn, Hyebin, et autres
Publié: (2025)
Speaker Emotion Recognition: Leveraging Self-Supervised Models for Feature Extraction Using Wav2Vec2 and HuBERT
par: Jafarzadeh, Pourya, et autres
Publié: (2024)
par: Jafarzadeh, Pourya, et autres
Publié: (2024)
AfriHuBERT: A self-supervised speech representation model for African languages
par: Alabi, Jesujoba O., et autres
Publié: (2024)
par: Alabi, Jesujoba O., et autres
Publié: (2024)
BabyHuBERT: Multilingual Self-Supervised Learning for Segmenting Speakers in Child-Centered Long-Form Recordings
par: Charlot, Théo, et autres
Publié: (2025)
par: Charlot, Théo, et autres
Publié: (2025)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024)
par: Lin, Zhaofeng, et autres
Publié: (2024)
HuPER: A Human-Inspired Framework for Phonetic Perception
par: Guo, Chenxu, et autres
Publié: (2026)
par: Guo, Chenxu, et autres
Publié: (2026)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
par: Nie, Yuting, et autres
Publié: (2022)
par: Nie, Yuting, et autres
Publié: (2022)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)
par: Koriyama, Tomoki
Publié: (2025)
Noise-Robust Hearing Aid Voice Control
par: López-Espejo, Iván, et autres
Publié: (2024)
par: López-Espejo, Iván, et autres
Publié: (2024)
Artificial Rigidities vs. Biological Noise: A Comparative Analysis of Multisensory Integration in AV-HuBERT and Human Observers
par: López, Francisco Portillo
Publié: (2026)
par: López, Francisco Portillo
Publié: (2026)
MMT-BERT: Chord-aware Symbolic Music Generation Based on Multitrack Music Transformer and MusicBERT
par: Zhu, Jinlong, et autres
Publié: (2024)
par: Zhu, Jinlong, et autres
Publié: (2024)
ExHuBERT: Enhancing HuBERT Through Block Extension and Fine-Tuning on 37 Emotion Datasets
par: Amiriparian, Shahin, et autres
Publié: (2024)
par: Amiriparian, Shahin, et autres
Publié: (2024)
Visual Cues Support Robust Turn-taking Prediction in Noise
par: Russell, Sam O'Connor, et autres
Publié: (2025)
par: Russell, Sam O'Connor, et autres
Publié: (2025)
Automatic Speech Recognition with BERT and CTC Transformers: A Review
par: Djeffal, Noussaiba, et autres
Publié: (2024)
par: Djeffal, Noussaiba, et autres
Publié: (2024)
Multichannel AV-wav2vec2: A Framework for Learning Multichannel Multi-Modal Speech Representation
par: Zhu, Qiushi, et autres
Publié: (2024)
par: Zhu, Qiushi, et autres
Publié: (2024)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
par: Salaj, Ina, et autres
Publié: (2025)
par: Salaj, Ina, et autres
Publié: (2025)
AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment
par: Chen, Yu, et autres
Publié: (2025)
par: Chen, Yu, et autres
Publié: (2025)
Scaling HuBERT for African Languages: From Base to Large and XL
par: Caubrière, Antoine, et autres
Publié: (2025)
par: Caubrière, Antoine, et autres
Publié: (2025)
HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
Enhancing Speaker Verification with w2v-BERT 2.0 and Knowledge Distillation guided Structured Pruning
par: Li, Ze, et autres
Publié: (2025)
par: Li, Ze, et autres
Publié: (2025)
MauBERT: Universal Phonetic Inductive Biases for Few-Shot Acoustic Units Discovery
par: Tandazo, Angelo Ortiz, et autres
Publié: (2025)
par: Tandazo, Angelo Ortiz, et autres
Publié: (2025)
AV-GS: Learning Material and Geometry Aware Priors for Novel View Acoustic Synthesis
par: Bhosale, Swapnil, et autres
Publié: (2024)
par: Bhosale, Swapnil, et autres
Publié: (2024)
AV-CrossNet: an Audiovisual Complex Spectral Mapping Network for Speech Separation By Leveraging Narrow- and Cross-Band Modeling
par: Kalkhorani, Vahid Ahmadi, et autres
Publié: (2024)
par: Kalkhorani, Vahid Ahmadi, et autres
Publié: (2024)
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
par: Buitrago, Pol, et autres
Publié: (2026)
par: Buitrago, Pol, et autres
Publié: (2026)
MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation
par: Cho, Sungwoo, et autres
Publié: (2025)
par: Cho, Sungwoo, et autres
Publié: (2025)
Documents similaires
-
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
par: Yoon, Ji Won, et autres
Publié: (2022) -
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
par: Cho, Cheol Jun, et autres
Publié: (2023) -
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
par: Wu, Wenxuan, et autres
Publié: (2024) -
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024) -
mHuBERT-147: A Compact Multilingual HuBERT Model
par: Boito, Marcely Zanon, et autres
Publié: (2024)