Computation and Parameter Efficient Multi-Modal Fusion Transformer for Cued Speech Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Lei, Liu, Li, Li, Haizhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
di: Wang, Jinting, et al.
Pubblicazione: (2025)
di: Wang, Jinting, et al.
Pubblicazione: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge
di: Liu, Zehua, et al.
Pubblicazione: (2025)
di: Liu, Zehua, et al.
Pubblicazione: (2025)
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
di: Liu, Zehua, et al.
Pubblicazione: (2025)
di: Liu, Zehua, et al.
Pubblicazione: (2025)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
di: Kim, Minsu, et al.
Pubblicazione: (2024)
di: Kim, Minsu, et al.
Pubblicazione: (2024)
Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2026)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2026)
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
di: Li, Cancan, et al.
Pubblicazione: (2025)
di: Li, Cancan, et al.
Pubblicazione: (2025)
Exploring Multi-Modal Control in Music-Driven Dance Generation
di: Li, Ronghui, et al.
Pubblicazione: (2024)
di: Li, Ronghui, et al.
Pubblicazione: (2024)
VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
Enhancing CTC-Based Visual Speech Recognition
di: Laux, Hendrik, et al.
Pubblicazione: (2024)
di: Laux, Hendrik, et al.
Pubblicazione: (2024)
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
di: Park, Young-Hu, et al.
Pubblicazione: (2025)
di: Park, Young-Hu, et al.
Pubblicazione: (2025)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
di: Choi, Jeongsoo, et al.
Pubblicazione: (2024)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2024)
A Low-rank Matching Attention based Cross-modal Feature Fusion Method for Conversational Emotion Recognition
di: Shou, Yuntao, et al.
Pubblicazione: (2023)
di: Shou, Yuntao, et al.
Pubblicazione: (2023)
RTFS-Net: Recurrent Time-Frequency Modelling for Efficient Audio-Visual Speech Separation
di: Pegg, Samuel, et al.
Pubblicazione: (2023)
di: Pegg, Samuel, et al.
Pubblicazione: (2023)
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
di: Liang, Yifan, et al.
Pubblicazione: (2025)
di: Liang, Yifan, et al.
Pubblicazione: (2025)
Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
Global-Local Distillation Network-Based Audio-Visual Speaker Tracking with Incomplete Modalities
di: Li, Yidi, et al.
Pubblicazione: (2024)
di: Li, Yidi, et al.
Pubblicazione: (2024)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
di: Li, Kai, et al.
Pubblicazione: (2023)
di: Li, Kai, et al.
Pubblicazione: (2023)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
di: Anand, et al.
Pubblicazione: (2025)
di: Anand, et al.
Pubblicazione: (2025)
Cued-Agent: A Collaborative Multi-Agent System for Automatic Cued Speech Recognition
di: Huang, Guanjie, et al.
Pubblicazione: (2025)
di: Huang, Guanjie, et al.
Pubblicazione: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)
MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues
di: Li, Junjie, et al.
Pubblicazione: (2024)
di: Li, Junjie, et al.
Pubblicazione: (2024)
Multi-modal Speech Transformer Decoders: When Do Multiple Modalities Improve Accuracy?
di: Guan, Yiwen, et al.
Pubblicazione: (2024)
di: Guan, Yiwen, et al.
Pubblicazione: (2024)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
Oceanship: A Large-Scale Dataset for Underwater Audio Target Recognition
di: Li, Zeyu, et al.
Pubblicazione: (2024)
di: Li, Zeyu, et al.
Pubblicazione: (2024)
Spiking Structured State Space Model for Monaural Speech Enhancement
di: Du, Yu, et al.
Pubblicazione: (2023)
di: Du, Yu, et al.
Pubblicazione: (2023)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
di: Du, Jiarong, et al.
Pubblicazione: (2025)
di: Du, Jiarong, et al.
Pubblicazione: (2025)
Sheet Music Transformer: End-To-End Optical Music Recognition Beyond Monophonic Transcription
di: Ríos-Vila, Antonio, et al.
Pubblicazione: (2024)
di: Ríos-Vila, Antonio, et al.
Pubblicazione: (2024)
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
di: Li, Feng, et al.
Pubblicazione: (2024)
di: Li, Feng, et al.
Pubblicazione: (2024)
Multimodal Emotion Recognition and Sentiment Analysis in Multi-Party Conversation Contexts
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
di: Low, Chetwin, et al.
Pubblicazione: (2025)
di: Low, Chetwin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
di: Wang, Jinting, et al.
Pubblicazione: (2025) -
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024) -
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge
di: Liu, Zehua, et al.
Pubblicazione: (2025) -
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024) -
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
di: Liu, Zehua, et al.
Pubblicazione: (2025)