Comparison of Conventional Hybrid and CTC/Attention Decoders for Continuous Visual Speech Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Gimeno-Gómez, David, Martínez-Hinarejos, Carlos-D. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Tailored Design of Audio-Visual Speech Recognition Models using Branchformers
by: Gimeno-Gómez, David, et al.
Published: (2024)
by: Gimeno-Gómez, David, et al.
Published: (2024)
Evaluation of End-to-End Continuous Spanish Lipreading in Different Data Conditions
by: Gimeno-Gómez, David, et al.
Published: (2025)
by: Gimeno-Gómez, David, et al.
Published: (2025)
AnnoTheia: A Semi-Automatic Annotation Toolkit for Audio-Visual Speech Technologies
by: Acosta-Triana, José-M., et al.
Published: (2024)
by: Acosta-Triana, José-M., et al.
Published: (2024)
Unveiling Interpretability in Self-Supervised Speech Representations for Parkinson's Diagnosis
by: Gimeno-Gómez, David, et al.
Published: (2024)
by: Gimeno-Gómez, David, et al.
Published: (2024)
Enhancing CTC-Based Visual Speech Recognition
by: Laux, Hendrik, et al.
Published: (2024)
by: Laux, Hendrik, et al.
Published: (2024)
Reading Between the Frames: Multi-Modal Depression Detection in Videos from Non-Verbal Cues
by: Gimeno-Gómez, David, et al.
Published: (2024)
by: Gimeno-Gómez, David, et al.
Published: (2024)
Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition
by: Haliassos, Alexandros, et al.
Published: (2026)
by: Haliassos, Alexandros, et al.
Published: (2026)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
by: Burchi, Maxime, et al.
Published: (2024)
by: Burchi, Maxime, et al.
Published: (2024)
SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text Recognition
by: Du, Yongkun, et al.
Published: (2024)
by: Du, Yongkun, et al.
Published: (2024)
CNVSRC 2023: The First Chinese Continuous Visual Speech Recognition Challenge
by: Chen, Chen, et al.
Published: (2024)
by: Chen, Chen, et al.
Published: (2024)
Reading Order Independent Metrics for Information Extraction in Handwritten Documents
by: Villanova-Aparisi, David, et al.
Published: (2024)
by: Villanova-Aparisi, David, et al.
Published: (2024)
EDTformer: An Efficient Decoder Transformer for Visual Place Recognition
by: Jin, Tong, et al.
Published: (2024)
by: Jin, Tong, et al.
Published: (2024)
Landmark Guided Visual Feature Extractor for Visual Speech Recognition with Limited Resource
by: Yang, Lei, et al.
Published: (2025)
by: Yang, Lei, et al.
Published: (2025)
Transfer Learning from Visual Speech Recognition to Mouthing Recognition in German Sign Language
by: Pham, Dinh Nam, et al.
Published: (2025)
by: Pham, Dinh Nam, et al.
Published: (2025)
The NPU-ASLP System Description for Visual Speech Recognition in CNVSRC 2024
by: Wang, He, et al.
Published: (2024)
by: Wang, He, et al.
Published: (2024)
Head-Pose-Aware Visual Speech Recognition with FiLM Modulation
by: Teng, Matthew Kit Khinn, et al.
Published: (2026)
by: Teng, Matthew Kit Khinn, et al.
Published: (2026)
Long-Tailed Continual Learning For Visual Food Recognition
by: He, Jiangpeng, et al.
Published: (2023)
by: He, Jiangpeng, et al.
Published: (2023)
Cross-Attention is Not Always Needed: Dynamic Cross-Attention for Audio-Visual Dimensional Emotion Recognition
by: Praveen, R. Gnana, et al.
Published: (2024)
by: Praveen, R. Gnana, et al.
Published: (2024)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
by: Anand, et al.
Published: (2025)
by: Anand, et al.
Published: (2025)
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge
by: Liu, Zehua, et al.
Published: (2025)
by: Liu, Zehua, et al.
Published: (2025)
BRAVEn: Improving Self-Supervised Pre-training for Visual and Auditory Speech Recognition
by: Haliassos, Alexandros, et al.
Published: (2024)
by: Haliassos, Alexandros, et al.
Published: (2024)
Unified Speech Recognition: A Single Model for Auditory, Visual, and Audiovisual Inputs
by: Haliassos, Alexandros, et al.
Published: (2024)
by: Haliassos, Alexandros, et al.
Published: (2024)
VALLR-Pin: Uncertainty-Factorized Visual Speech Recognition for Mandarin with Pinyin Guidance
by: Sun, Chang, et al.
Published: (2025)
by: Sun, Chang, et al.
Published: (2025)
Inconsistency-Aware Cross-Attention for Audio-Visual Fusion in Dimensional Emotion Recognition
by: Rajasekhar, G, et al.
Published: (2024)
by: Rajasekhar, G, et al.
Published: (2024)
Learning Sequence Descriptor based on Spatio-Temporal Attention for Visual Place Recognition
by: Zhao, Junqiao, et al.
Published: (2023)
by: Zhao, Junqiao, et al.
Published: (2023)
A2Mamba: Attention-augmented State Space Models for Visual Recognition
by: Lou, Meng, et al.
Published: (2025)
by: Lou, Meng, et al.
Published: (2025)
GLip: A Global-Local Integrated Progressive Framework for Robust Visual Speech Recognition
by: Wang, Tianyue, et al.
Published: (2025)
by: Wang, Tianyue, et al.
Published: (2025)
InfoSyncNet: Information Synchronization Temporal Convolutional Network for Visual Speech Recognition
by: Xue, Junxiao, et al.
Published: (2025)
by: Xue, Junxiao, et al.
Published: (2025)
CTC Transcription Alignment of the Bullinger Letters: Automatic Improvement of Annotation Quality
by: Peer, Marco, et al.
Published: (2025)
by: Peer, Marco, et al.
Published: (2025)
Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction
by: Teng, Matthew Kit Khinn, et al.
Published: (2025)
by: Teng, Matthew Kit Khinn, et al.
Published: (2025)
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
by: Yang, Lei, et al.
Published: (2026)
by: Yang, Lei, et al.
Published: (2026)
Improving the Multi-label Atomic Activity Recognition by Robust Visual Feature and Advanced Attention @ ROAD++ Atomic Activity Recognition 2024
by: Cao, Jiamin, et al.
Published: (2024)
by: Cao, Jiamin, et al.
Published: (2024)
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
by: Liu, Zehua, et al.
Published: (2025)
by: Liu, Zehua, et al.
Published: (2025)
Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
by: Cappellazzo, Umberto, et al.
Published: (2026)
by: Cappellazzo, Umberto, et al.
Published: (2026)
STARK: Spatio-Temporal Attention for Representation of Keypoints for Continuous Sign Language Recognition
by: Patra, Suvajit, et al.
Published: (2026)
by: Patra, Suvajit, et al.
Published: (2026)
Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model
by: Zhuang, Jiedong, et al.
Published: (2026)
by: Zhuang, Jiedong, et al.
Published: (2026)
Do You See What I Say? Generalizable Deepfake Detection based on Visual Speech Recognition
by: Bora, Maheswar, et al.
Published: (2025)
by: Bora, Maheswar, et al.
Published: (2025)
Lightweight Operations for Visual Speech Recognition
by: Panagos, Iason Ioannis, et al.
Published: (2025)
by: Panagos, Iason Ioannis, et al.
Published: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
by: Hao, Bowen, et al.
Published: (2025)
by: Hao, Bowen, et al.
Published: (2025)
Designing Practical Models for Isolated Word Visual Speech Recognition
by: Panagos, Iason Ioannis, et al.
Published: (2025)
by: Panagos, Iason Ioannis, et al.
Published: (2025)
Similar Items
-
Tailored Design of Audio-Visual Speech Recognition Models using Branchformers
by: Gimeno-Gómez, David, et al.
Published: (2024) -
Evaluation of End-to-End Continuous Spanish Lipreading in Different Data Conditions
by: Gimeno-Gómez, David, et al.
Published: (2025) -
AnnoTheia: A Semi-Automatic Annotation Toolkit for Audio-Visual Speech Technologies
by: Acosta-Triana, José-M., et al.
Published: (2024) -
Unveiling Interpretability in Self-Supervised Speech Representations for Parkinson's Diagnosis
by: Gimeno-Gómez, David, et al.
Published: (2024) -
Enhancing CTC-Based Visual Speech Recognition
by: Laux, Hendrik, et al.
Published: (2024)