Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Yihan, Lu, Yichen, Peng, Yifan, Wang, Xihua, Song, Ruihua, Watanabe, Shinji |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Robust Audiovisual Speech Recognition Models with Mixture-of-Experts
par: Wu, Yihan, et autres
Publié: (2024)
par: Wu, Yihan, et autres
Publié: (2024)
SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition
par: Wu, Yihan, et autres
Publié: (2024)
par: Wu, Yihan, et autres
Publié: (2024)
Neural Blind Source Separation and Diarization for Distant Speech Recognition
par: Bando, Yoshiaki, et autres
Publié: (2024)
par: Bando, Yoshiaki, et autres
Publié: (2024)
FastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model
par: Lu, Yichen, et autres
Publié: (2024)
par: Lu, Yichen, et autres
Publié: (2024)
Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Aligning Text-to-Music Evaluation with Human Preferences
par: Huang, Yichen, et autres
Publié: (2025)
par: Huang, Yichen, et autres
Publié: (2025)
OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models
par: Chen, William, et autres
Publié: (2025)
par: Chen, William, et autres
Publié: (2025)
Text-To-Speech Synthesis In The Wild
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
LoVA: Long-form Video-to-Audio Generation
par: Cheng, Xin, et autres
Publié: (2024)
par: Cheng, Xin, et autres
Publié: (2024)
Do Neural Codecs Generalize? A Controlled Study Across Unseen Languages and Non-Speech Tasks
par: Wang, Shih-Heng, et autres
Publié: (2026)
par: Wang, Shih-Heng, et autres
Publié: (2026)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
par: Gao, Ming, et autres
Publié: (2025)
par: Gao, Ming, et autres
Publié: (2025)
VSSFlow: Unifying Video-conditioned Sound and Speech Generation via Joint Learning
par: Cheng, Xin, et autres
Publié: (2025)
par: Cheng, Xin, et autres
Publié: (2025)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition
par: Xie, Jiamin, et autres
Publié: (2025)
par: Xie, Jiamin, et autres
Publié: (2025)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
par: Yeo, Yue Heng, et autres
Publié: (2026)
par: Yeo, Yue Heng, et autres
Publié: (2026)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
par: Hyeon, Jonghwan, et autres
Publié: (2024)
par: Hyeon, Jonghwan, et autres
Publié: (2024)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
par: Kim, Jaeyoung, et autres
Publié: (2024)
par: Kim, Jaeyoung, et autres
Publié: (2024)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
par: Choi, Yerin, et autres
Publié: (2024)
par: Choi, Yerin, et autres
Publié: (2024)
Qieemo: Speech Is All You Need in the Emotion Recognition in Conversations
par: Chen, Jinming, et autres
Publié: (2025)
par: Chen, Jinming, et autres
Publié: (2025)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Personalized Adversarial Data Augmentation for Dysarthric and Elderly Speech Recognition
par: Jin, Zengrui, et autres
Publié: (2022)
par: Jin, Zengrui, et autres
Publié: (2022)
Visual Speech Recognition for Languages with Limited Labeled Data using Automatic Labels from Whisper
par: Yeo, Jeong Hun, et autres
Publié: (2023)
par: Yeo, Jeong Hun, et autres
Publié: (2023)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
par: Liu, Hexin, et autres
Publié: (2024)
par: Liu, Hexin, et autres
Publié: (2024)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2024)
par: Pan, Yu, et autres
Publié: (2024)
Towards Robust Speech Representation Learning for Thousands of Languages
par: Chen, William, et autres
Publié: (2024)
par: Chen, William, et autres
Publié: (2024)
Beyond Silence: Bias Analysis through Loss and Asymmetric Approach in Audio Anti-Spoofing
par: Shim, Hye-jin, et autres
Publié: (2024)
par: Shim, Hye-jin, et autres
Publié: (2024)
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
par: Jiao, Xinxin, et autres
Publié: (2024)
par: Jiao, Xinxin, et autres
Publié: (2024)
Open Source State-Of-the-Art Solution for Romanian Speech Recognition
par: Pirlogeanu, Gabriel, et autres
Publié: (2025)
par: Pirlogeanu, Gabriel, et autres
Publié: (2025)
Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition
par: Pokel, Niclas, et autres
Publié: (2025)
par: Pokel, Niclas, et autres
Publié: (2025)
The X-LANCE Technical Report for Interspeech 2024 Speech Processing Using Discrete Speech Unit Challenge
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
TinyML for Speech Recognition
par: Barovic, Andrew, et autres
Publié: (2025)
par: Barovic, Andrew, et autres
Publié: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
End-to-End Speech Recognition with Pre-trained Masked Language Model
par: Higuchi, Yosuke, et autres
Publié: (2024)
par: Higuchi, Yosuke, et autres
Publié: (2024)
Gesture-Aware Zero-Shot Speech Recognition for Patients with Language Disorders
par: Kim, Seungbae, et autres
Publié: (2025)
par: Kim, Seungbae, et autres
Publié: (2025)
MixRep: Hidden Representation Mixup for Low-Resource Speech Recognition
par: Xie, Jiamin, et autres
Publié: (2023)
par: Xie, Jiamin, et autres
Publié: (2023)
AS-ASR: A Lightweight Framework for Aphasia-Specific Automatic Speech Recognition
par: Bao, Chen, et autres
Publié: (2025)
par: Bao, Chen, et autres
Publié: (2025)
Documents similaires
-
Robust Audiovisual Speech Recognition Models with Mixture-of-Experts
par: Wu, Yihan, et autres
Publié: (2024) -
SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition
par: Wu, Yihan, et autres
Publié: (2024) -
Neural Blind Source Separation and Diarization for Distant Speech Recognition
par: Bando, Yoshiaki, et autres
Publié: (2024) -
FastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model
par: Lu, Yichen, et autres
Publié: (2024) -
Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play
par: Shi, Jiatong, et autres
Publié: (2025)