Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
Fuente:
arXiv
Salvato in:
| Autori principali: | Buitrago, Pol, Gàlvez, Pol, Pareras, Oriol, Hernando, Javier |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
di: Gállego, Gerard I., et al.
Pubblicazione: (2025)
di: Gállego, Gerard I., et al.
Pubblicazione: (2025)
Learning Video Temporal Dynamics with Cross-Modal Attention for Robust Audio-Visual Speech Recognition
di: Kim, Sungnyun, et al.
Pubblicazione: (2024)
di: Kim, Sungnyun, et al.
Pubblicazione: (2024)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
di: Salaj, Ina, et al.
Pubblicazione: (2025)
di: Salaj, Ina, et al.
Pubblicazione: (2025)
Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processing
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2024)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2024)
Improvement Of Audiovisual Quality Estimation Using A Nonlinear Autoregressive Exogenous Neural Network And Bitstream Parameters
di: Kossi, Koffi, et al.
Pubblicazione: (2024)
di: Kossi, Koffi, et al.
Pubblicazione: (2024)
Listening for "You": Enhancing Speech Image Retrieval via Target Speaker Extraction
di: Yang, Wenhao, et al.
Pubblicazione: (2025)
di: Yang, Wenhao, et al.
Pubblicazione: (2025)
Prompt Tuning of Deep Neural Networks for Speaker-adaptive Visual Speech Recognition
di: Kim, Minsu, et al.
Pubblicazione: (2023)
di: Kim, Minsu, et al.
Pubblicazione: (2023)
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
di: Eliav, Amit, et al.
Pubblicazione: (2024)
di: Eliav, Amit, et al.
Pubblicazione: (2024)
KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario
di: Zhou, Huali, et al.
Pubblicazione: (2024)
di: Zhou, Huali, et al.
Pubblicazione: (2024)
AKVSR: Audio Knowledge Empowered Visual Speech Recognition by Compressing Audio Knowledge of a Pretrained Model
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2023)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2023)
Leveraging Unlabeled Audio-Visual Data in Speech Emotion Recognition using Knowledge Distillation
di: Pendyala, Varsha, et al.
Pubblicazione: (2025)
di: Pendyala, Varsha, et al.
Pubblicazione: (2025)
Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition
di: Park, Jay, et al.
Pubblicazione: (2025)
di: Park, Jay, et al.
Pubblicazione: (2025)
Visual-Aware Speech Recognition for Noisy Scenarios
di: Balaji, Lakshmipathi, et al.
Pubblicazione: (2025)
di: Balaji, Lakshmipathi, et al.
Pubblicazione: (2025)
Lip Reading for Low-resource Languages by Learning and Combining General Speech Knowledge and Language-specific Knowledge
di: Kim, Minsu, et al.
Pubblicazione: (2023)
di: Kim, Minsu, et al.
Pubblicazione: (2023)
Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2021)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2021)
DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming
di: Wen, Shuide, et al.
Pubblicazione: (2026)
di: Wen, Shuide, et al.
Pubblicazione: (2026)
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
BUT System Description for CHiME-9 MCoRec Challenge
di: Klement, Dominik, et al.
Pubblicazione: (2026)
di: Klement, Dominik, et al.
Pubblicazione: (2026)
Bounds on Agreement between Subjective and Objective Measurements
di: Pieper, Jaden, et al.
Pubblicazione: (2026)
di: Pieper, Jaden, et al.
Pubblicazione: (2026)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
di: Mingote, Victoria, et al.
Pubblicazione: (2024)
di: Mingote, Victoria, et al.
Pubblicazione: (2024)
Personalized Lip Reading: Adapting to Your Unique Lip Movements with Vision and Language
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2024)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2024)
Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos
di: Ishikawa, Yuchi, et al.
Pubblicazione: (2025)
di: Ishikawa, Yuchi, et al.
Pubblicazione: (2025)
Speech2rtMRI: Speech-Guided Diffusion Model for Real-time MRI Video of the Vocal Tract during Speech
di: Nguyen, Hong, et al.
Pubblicazione: (2024)
di: Nguyen, Hong, et al.
Pubblicazione: (2024)
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
di: Cao, Yuqin, et al.
Pubblicazione: (2024)
di: Cao, Yuqin, et al.
Pubblicazione: (2024)
Listening without Looking: Modality Bias in Audio-Visual Captioning
di: Ishikawa, Yuchi, et al.
Pubblicazione: (2025)
di: Ishikawa, Yuchi, et al.
Pubblicazione: (2025)
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
di: Yue, Xianghu, et al.
Pubblicazione: (2024)
di: Yue, Xianghu, et al.
Pubblicazione: (2024)
Towards Language-Independent Face-Voice Association with Multimodal Foundation Models
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Efficient Face Detection with Audio-Based Region Proposals for Human-Robot Interactions
di: Aris, William, et al.
Pubblicazione: (2023)
di: Aris, William, et al.
Pubblicazione: (2023)
Multimodal sensor fusion for real-time location-dependent defect detection in laser-directed energy deposition
di: Chen, Lequn, et al.
Pubblicazione: (2023)
di: Chen, Lequn, et al.
Pubblicazione: (2023)
PersonaCite: VoC-Grounded Interviewable Agentic Synthetic AI Personas for Verifiable User and Design Research
di: Truss, Mario
Pubblicazione: (2026)
di: Truss, Mario
Pubblicazione: (2026)
Adaptive Multimodal Person Recognition: A Robust Framework for Handling Missing Modalities
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
Zero-resource Speech Translation and Recognition with LLMs
di: Mundnich, Karel, et al.
Pubblicazione: (2024)
di: Mundnich, Karel, et al.
Pubblicazione: (2024)
Leveraging Reverberation and Visual Depth Cues for Sound Event Localization and Detection with Distance Estimation
di: Berghi, Davide, et al.
Pubblicazione: (2024)
di: Berghi, Davide, et al.
Pubblicazione: (2024)
Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
Spoken question answering for visual queries
di: Shabtay, Nimrod, et al.
Pubblicazione: (2025)
di: Shabtay, Nimrod, et al.
Pubblicazione: (2025)
RestoreGrad: Signal Restoration Using Conditional Denoising Diffusion Models with Jointly Learned Prior
di: Lee, Ching-Hua, et al.
Pubblicazione: (2025)
di: Lee, Ching-Hua, et al.
Pubblicazione: (2025)
Efficient Test-Time Adaptation through Latent Subspace Coefficients Search
di: Luo, Xinyu, et al.
Pubblicazione: (2025)
di: Luo, Xinyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
di: Buitrago, Pol, et al.
Pubblicazione: (2026) -
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
di: Gállego, Gerard I., et al.
Pubblicazione: (2025) -
Learning Video Temporal Dynamics with Cross-Modal Attention for Robust Audio-Visual Speech Recognition
di: Kim, Sungnyun, et al.
Pubblicazione: (2024) -
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
di: Salaj, Ina, et al.
Pubblicazione: (2025) -
Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processing
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2024)