Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Yihan, Lu, Yichen, Peng, Yifan, Wang, Xihua, Song, Ruihua, Watanabe, Shinji |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Robust Audiovisual Speech Recognition Models with Mixture-of-Experts
di: Wu, Yihan, et al.
Pubblicazione: (2024)
di: Wu, Yihan, et al.
Pubblicazione: (2024)
SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition
di: Wu, Yihan, et al.
Pubblicazione: (2024)
di: Wu, Yihan, et al.
Pubblicazione: (2024)
Neural Blind Source Separation and Diarization for Distant Speech Recognition
di: Bando, Yoshiaki, et al.
Pubblicazione: (2024)
di: Bando, Yoshiaki, et al.
Pubblicazione: (2024)
FastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model
di: Lu, Yichen, et al.
Pubblicazione: (2024)
di: Lu, Yichen, et al.
Pubblicazione: (2024)
Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
Aligning Text-to-Music Evaluation with Human Preferences
di: Huang, Yichen, et al.
Pubblicazione: (2025)
di: Huang, Yichen, et al.
Pubblicazione: (2025)
OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models
di: Chen, William, et al.
Pubblicazione: (2025)
di: Chen, William, et al.
Pubblicazione: (2025)
Text-To-Speech Synthesis In The Wild
di: Jung, Jee-weon, et al.
Pubblicazione: (2024)
di: Jung, Jee-weon, et al.
Pubblicazione: (2024)
LoVA: Long-form Video-to-Audio Generation
di: Cheng, Xin, et al.
Pubblicazione: (2024)
di: Cheng, Xin, et al.
Pubblicazione: (2024)
Do Neural Codecs Generalize? A Controlled Study Across Unseen Languages and Non-Speech Tasks
di: Wang, Shih-Heng, et al.
Pubblicazione: (2026)
di: Wang, Shih-Heng, et al.
Pubblicazione: (2026)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
di: Gao, Ming, et al.
Pubblicazione: (2025)
di: Gao, Ming, et al.
Pubblicazione: (2025)
VSSFlow: Unifying Video-conditioned Sound and Speech Generation via Joint Learning
di: Cheng, Xin, et al.
Pubblicazione: (2025)
di: Cheng, Xin, et al.
Pubblicazione: (2025)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
di: Shakeel, Muhammad, et al.
Pubblicazione: (2024)
di: Shakeel, Muhammad, et al.
Pubblicazione: (2024)
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild
di: Jung, Jee-weon, et al.
Pubblicazione: (2024)
di: Jung, Jee-weon, et al.
Pubblicazione: (2024)
Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition
di: Xie, Jiamin, et al.
Pubblicazione: (2025)
di: Xie, Jiamin, et al.
Pubblicazione: (2025)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
di: Yeo, Yue Heng, et al.
Pubblicazione: (2026)
di: Yeo, Yue Heng, et al.
Pubblicazione: (2026)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
di: Hyeon, Jonghwan, et al.
Pubblicazione: (2024)
di: Hyeon, Jonghwan, et al.
Pubblicazione: (2024)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
di: Peng, Yifan, et al.
Pubblicazione: (2024)
di: Peng, Yifan, et al.
Pubblicazione: (2024)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
di: Wang, Helin, et al.
Pubblicazione: (2025)
di: Wang, Helin, et al.
Pubblicazione: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
di: Choi, Yerin, et al.
Pubblicazione: (2024)
di: Choi, Yerin, et al.
Pubblicazione: (2024)
Qieemo: Speech Is All You Need in the Emotion Recognition in Conversations
di: Chen, Jinming, et al.
Pubblicazione: (2025)
di: Chen, Jinming, et al.
Pubblicazione: (2025)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
di: Shakeel, Muhammad, et al.
Pubblicazione: (2024)
di: Shakeel, Muhammad, et al.
Pubblicazione: (2024)
Personalized Adversarial Data Augmentation for Dysarthric and Elderly Speech Recognition
di: Jin, Zengrui, et al.
Pubblicazione: (2022)
di: Jin, Zengrui, et al.
Pubblicazione: (2022)
Visual Speech Recognition for Languages with Limited Labeled Data using Automatic Labels from Whisper
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2023)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2023)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
di: Liu, Hexin, et al.
Pubblicazione: (2024)
di: Liu, Hexin, et al.
Pubblicazione: (2024)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
di: Sudo, Yui, et al.
Pubblicazione: (2024)
di: Sudo, Yui, et al.
Pubblicazione: (2024)
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition
di: Pan, Yu, et al.
Pubblicazione: (2024)
di: Pan, Yu, et al.
Pubblicazione: (2024)
Towards Robust Speech Representation Learning for Thousands of Languages
di: Chen, William, et al.
Pubblicazione: (2024)
di: Chen, William, et al.
Pubblicazione: (2024)
Beyond Silence: Bias Analysis through Loss and Asymmetric Approach in Audio Anti-Spoofing
di: Shim, Hye-jin, et al.
Pubblicazione: (2024)
di: Shim, Hye-jin, et al.
Pubblicazione: (2024)
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
di: Jiao, Xinxin, et al.
Pubblicazione: (2024)
di: Jiao, Xinxin, et al.
Pubblicazione: (2024)
Open Source State-Of-the-Art Solution for Romanian Speech Recognition
di: Pirlogeanu, Gabriel, et al.
Pubblicazione: (2025)
di: Pirlogeanu, Gabriel, et al.
Pubblicazione: (2025)
Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition
di: Pokel, Niclas, et al.
Pubblicazione: (2025)
di: Pokel, Niclas, et al.
Pubblicazione: (2025)
The X-LANCE Technical Report for Interspeech 2024 Speech Processing Using Discrete Speech Unit Challenge
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
TinyML for Speech Recognition
di: Barovic, Andrew, et al.
Pubblicazione: (2025)
di: Barovic, Andrew, et al.
Pubblicazione: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
End-to-End Speech Recognition with Pre-trained Masked Language Model
di: Higuchi, Yosuke, et al.
Pubblicazione: (2024)
di: Higuchi, Yosuke, et al.
Pubblicazione: (2024)
Gesture-Aware Zero-Shot Speech Recognition for Patients with Language Disorders
di: Kim, Seungbae, et al.
Pubblicazione: (2025)
di: Kim, Seungbae, et al.
Pubblicazione: (2025)
MixRep: Hidden Representation Mixup for Low-Resource Speech Recognition
di: Xie, Jiamin, et al.
Pubblicazione: (2023)
di: Xie, Jiamin, et al.
Pubblicazione: (2023)
AS-ASR: A Lightweight Framework for Aphasia-Specific Automatic Speech Recognition
di: Bao, Chen, et al.
Pubblicazione: (2025)
di: Bao, Chen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Robust Audiovisual Speech Recognition Models with Mixture-of-Experts
di: Wu, Yihan, et al.
Pubblicazione: (2024) -
SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition
di: Wu, Yihan, et al.
Pubblicazione: (2024) -
Neural Blind Source Separation and Diarization for Distant Speech Recognition
di: Bando, Yoshiaki, et al.
Pubblicazione: (2024) -
FastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model
di: Lu, Yichen, et al.
Pubblicazione: (2024) -
Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play
di: Shi, Jiatong, et al.
Pubblicazione: (2025)