Unified Speech Recognition: A Single Model for Auditory, Visual, and Audiovisual Inputs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Haliassos, Alexandros, Mira, Rodrigo, Chen, Honglie, Landgraf, Zoe, Petridis, Stavros, Pantic, Maja |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BRAVEn: Improving Self-Supervised Pre-training for Visual and Auditory Speech Recognition
par: Haliassos, Alexandros, et autres
Publié: (2024)
par: Haliassos, Alexandros, et autres
Publié: (2024)
Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition
par: Haliassos, Alexandros, et autres
Publié: (2026)
par: Haliassos, Alexandros, et autres
Publié: (2026)
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement
par: Chen, Honglie, et autres
Publié: (2024)
par: Chen, Honglie, et autres
Publié: (2024)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2026)
par: Cappellazzo, Umberto, et autres
Publié: (2026)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
par: Anand, et autres
Publié: (2025)
par: Anand, et autres
Publié: (2025)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
par: Cappellazzo, Umberto, et autres
Publié: (2024)
par: Cappellazzo, Umberto, et autres
Publié: (2024)
MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation
par: Seo, Junyoung, et autres
Publié: (2025)
par: Seo, Junyoung, et autres
Publié: (2025)
EMOPortraits: Emotion-enhanced Multimodal One-shot Head Avatars
par: Drobyshev, Nikita, et autres
Publié: (2024)
par: Drobyshev, Nikita, et autres
Publié: (2024)
KeyFace: Expressive Audio-Driven Facial Animation for Long Sequences via KeyFrame Interpolation
par: Bigata, Antoni, et autres
Publié: (2025)
par: Bigata, Antoni, et autres
Publié: (2025)
Full-Rank No More: Low-Rank Weight Training for Modern Speech Recognition Models
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
KeySync: A Robust Approach for Leakage-free Lip Synchronization in High Resolution
par: Bigata, Antoni, et autres
Publié: (2025)
par: Bigata, Antoni, et autres
Publié: (2025)
FaceCrafter: Identity-Conditional Diffusion with Disentangled Control over Facial Pose, Expression, and Emotion
par: Mishima, Kazuaki, et autres
Publié: (2025)
par: Mishima, Kazuaki, et autres
Publié: (2025)
FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs
par: Zinonos, Andreas, et autres
Publié: (2025)
par: Zinonos, Andreas, et autres
Publié: (2025)
Contextual Speech Extraction: Leveraging Textual History as an Implicit Cue for Target Speech Extraction
par: Kim, Minsu, et autres
Publié: (2025)
par: Kim, Minsu, et autres
Publié: (2025)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment
par: Hong, Joanna, et autres
Publié: (2025)
par: Hong, Joanna, et autres
Publié: (2025)
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
par: Zhang, Yiman, et autres
Publié: (2025)
par: Zhang, Yiman, et autres
Publié: (2025)
Robust Audiovisual Speech Recognition Models with Mixture-of-Experts
par: Wu, Yihan, et autres
Publié: (2024)
par: Wu, Yihan, et autres
Publié: (2024)
Revival with Voice: Multi-modal Controllable Text-to-Speech Synthesis
par: Kim, Minsu, et autres
Publié: (2025)
par: Kim, Minsu, et autres
Publié: (2025)
X-Streamer: Unified Human World Modeling with Audiovisual Interaction
par: Xie, You, et autres
Publié: (2025)
par: Xie, You, et autres
Publié: (2025)
Landmark Guided Visual Feature Extractor for Visual Speech Recognition with Limited Resource
par: Yang, Lei, et autres
Publié: (2025)
par: Yang, Lei, et autres
Publié: (2025)
Style-Aware Blending and Prototype-Based Cross-Contrast Consistency for Semi-Supervised Medical Image Segmentation
par: Chen, Chaowei, et autres
Publié: (2025)
par: Chen, Chaowei, et autres
Publié: (2025)
Speech2UnifiedExpressions: Synchronous Synthesis of Co-Speech Affective Face and Body Expressions from Affordable Inputs
par: Bhattacharya, Uttaran, et autres
Publié: (2024)
par: Bhattacharya, Uttaran, et autres
Publié: (2024)
Audio-visual video-to-speech synthesis with synthesized input audio
par: Kefalas, Triantafyllos, et autres
Publié: (2023)
par: Kefalas, Triantafyllos, et autres
Publié: (2023)
Large-scale unsupervised audio pre-training for video-to-speech synthesis
par: Kefalas, Triantafyllos, et autres
Publié: (2023)
par: Kefalas, Triantafyllos, et autres
Publié: (2023)
I Speak and You Find: Robust 3D Visual Grounding with Noisy and Ambiguous Speech Inputs
par: Qi, Yu, et autres
Publié: (2025)
par: Qi, Yu, et autres
Publié: (2025)
Extending Segment Anything Model into Auditory and Temporal Dimensions for Audio-Visual Segmentation
par: Seon, Juhyeong, et autres
Publié: (2024)
par: Seon, Juhyeong, et autres
Publié: (2024)
CNVSRC 2023: The First Chinese Continuous Visual Speech Recognition Challenge
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Survey on Hand Gesture Recognition from Visual Input
par: Linardakis, Manousos, et autres
Publié: (2025)
par: Linardakis, Manousos, et autres
Publié: (2025)
Tailored Design of Audio-Visual Speech Recognition Models using Branchformers
par: Gimeno-Gómez, David, et autres
Publié: (2024)
par: Gimeno-Gómez, David, et autres
Publié: (2024)
TRANSPORTER: Transferring Visual Semantics from VLM Manifolds
par: Stergiou, Alexandros
Publié: (2025)
par: Stergiou, Alexandros
Publié: (2025)
Transfer Learning from Visual Speech Recognition to Mouthing Recognition in German Sign Language
par: Pham, Dinh Nam, et autres
Publié: (2025)
par: Pham, Dinh Nam, et autres
Publié: (2025)
One Channel to Rule Them All: Rethinking Input Representation for Visual Place Recognition
par: Ismagilov, Timur, et autres
Publié: (2026)
par: Ismagilov, Timur, et autres
Publié: (2026)
GLip: A Global-Local Integrated Progressive Framework for Robust Visual Speech Recognition
par: Wang, Tianyue, et autres
Publié: (2025)
par: Wang, Tianyue, et autres
Publié: (2025)
Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction
par: Teng, Matthew Kit Khinn, et autres
Publié: (2025)
par: Teng, Matthew Kit Khinn, et autres
Publié: (2025)
UniFormer: Unifying Convolution and Self-attention for Visual Recognition
par: Li, Kunchang, et autres
Publié: (2022)
par: Li, Kunchang, et autres
Publié: (2022)
Documents similaires
-
BRAVEn: Improving Self-Supervised Pre-training for Visual and Auditory Speech Recognition
par: Haliassos, Alexandros, et autres
Publié: (2024) -
Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition
par: Haliassos, Alexandros, et autres
Publié: (2026) -
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement
par: Chen, Honglie, et autres
Publié: (2024) -
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025) -
Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2026)