XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, HyoJung, Anwar, Mohamed, Pino, Juan, Hsu, Wei-Ning, Carpuat, Marine, Shi, Bowen, Wang, Changhan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Neural Speech Codec for Noise Robust Speech Coding
par: Huang, Jiayi, et autres
Publié: (2023)
par: Huang, Jiayi, et autres
Publié: (2023)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024)
par: Lin, Zhaofeng, et autres
Publié: (2024)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
par: Xiao, Yang, et autres
Publié: (2026)
par: Xiao, Yang, et autres
Publié: (2026)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation
par: Wei, Kun, et autres
Publié: (2023)
par: Wei, Kun, et autres
Publié: (2023)
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
par: Liu, Qianhui, et autres
Publié: (2024)
par: Liu, Qianhui, et autres
Publié: (2024)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
par: Ren, Wenze, et autres
Publié: (2024)
par: Ren, Wenze, et autres
Publié: (2024)
Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
par: Daeglau, Mareike, et autres
Publié: (2025)
par: Daeglau, Mareike, et autres
Publié: (2025)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
par: Deng, Yimin, et autres
Publié: (2024)
par: Deng, Yimin, et autres
Publié: (2024)
Multi-Task Corrupted Prediction for Learning Robust Audio-Visual Speech Representation
par: Kim, Sungnyun, et autres
Publié: (2025)
par: Kim, Sungnyun, et autres
Publié: (2025)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
par: Pan, Tianrui, et autres
Publié: (2024)
par: Pan, Tianrui, et autres
Publié: (2024)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
par: Zhao, Ya, et autres
Publié: (2026)
par: Zhao, Ya, et autres
Publié: (2026)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
SSNAPS: Audio-Visual Separation of Speech and Background Noise with Diffusion Inverse Sampling
par: Yemini, Yochai, et autres
Publié: (2026)
par: Yemini, Yochai, et autres
Publié: (2026)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
par: Rouditchenko, Andrew, et autres
Publié: (2025)
par: Rouditchenko, Andrew, et autres
Publié: (2025)
NAST: Noise Aware Speech Tokenization for Speech Language Models
par: Messica, Shoval, et autres
Publié: (2024)
par: Messica, Shoval, et autres
Publié: (2024)
Dual-Branch Knowledge Distillation for Noise-Robust Synthetic Speech Detection
par: Fan, Cunhang, et autres
Publié: (2023)
par: Fan, Cunhang, et autres
Publié: (2023)
Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition
par: Chen, Shuangyuan, et autres
Publié: (2025)
par: Chen, Shuangyuan, et autres
Publié: (2025)
Trade-offs Between Capacity and Robustness in Neural Audio Codecs for Adversarially Robust Speech Recognition
par: Prescott, Jordan, et autres
Publié: (2026)
par: Prescott, Jordan, et autres
Publié: (2026)
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
par: Chen, Chih-Ning, et autres
Publié: (2026)
par: Chen, Chih-Ning, et autres
Publié: (2026)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Enhancing Non-Core Language Instruction-Following in Speech LLMs via Semi-Implicit Cross-Lingual CoT Reasoning
par: Xue, Hongfei, et autres
Publié: (2025)
par: Xue, Hongfei, et autres
Publié: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)
par: Su, Fei, et autres
Publié: (2026)
Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ
par: Chae, Yunkee, et autres
Publié: (2025)
par: Chae, Yunkee, et autres
Publié: (2025)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
par: Pierotti, Francesco, et autres
Publié: (2025)
par: Pierotti, Francesco, et autres
Publié: (2025)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
par: Hussain, Tassadaq, et autres
Publié: (2024)
par: Hussain, Tassadaq, et autres
Publié: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
par: Zhang, Sidong, et autres
Publié: (2025)
par: Zhang, Sidong, et autres
Publié: (2025)
Enhancing Crowdsourced Audio for Text-to-Speech Models
par: Giraldo, José, et autres
Publié: (2024)
par: Giraldo, José, et autres
Publié: (2024)
Efficient Extraction of Noise-Robust Discrete Units from Self-Supervised Speech Models
par: Poncelet, Jakob, et autres
Publié: (2024)
par: Poncelet, Jakob, et autres
Publié: (2024)
ConSep: a Noise- and Reverberation-Robust Speech Separation Framework by Magnitude Conditioning
par: Ho, Kuan-Hsun, et autres
Publié: (2024)
par: Ho, Kuan-Hsun, et autres
Publié: (2024)
A Layer-Anchoring Strategy for Enhancing Cross-Lingual Speech Emotion Recognition
par: Upadhyay, Shreya G., et autres
Publié: (2024)
par: Upadhyay, Shreya G., et autres
Publié: (2024)
Noise-Aware Speech Separation with Contrastive Learning
par: Zhang, Zizheng, et autres
Publié: (2023)
par: Zhang, Zizheng, et autres
Publié: (2023)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
par: Nasretdinov, Rauf, et autres
Publié: (2025)
par: Nasretdinov, Rauf, et autres
Publié: (2025)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
par: Ma, Ding, et autres
Publié: (2026)
par: Ma, Ding, et autres
Publié: (2026)
Documents similaires
-
A Neural Speech Codec for Noise Robust Speech Coding
par: Huang, Jiayi, et autres
Publié: (2023) -
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024) -
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024) -
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
par: Xiao, Yang, et autres
Publié: (2026) -
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)