Evaluation of End-to-End Continuous Spanish Lipreading in Different Data Conditions
Fuente:
arXiv
Salvato in:
| Autori principali: | Gimeno-Gómez, David, Martínez-Hinarejos, Carlos-D. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Comparison of Conventional Hybrid and CTC/Attention Decoders for Continuous Visual Speech Recognition
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)
Tailored Design of Audio-Visual Speech Recognition Models using Branchformers
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)
AnnoTheia: A Semi-Automatic Annotation Toolkit for Audio-Visual Speech Technologies
di: Acosta-Triana, José-M., et al.
Pubblicazione: (2024)
di: Acosta-Triana, José-M., et al.
Pubblicazione: (2024)
Unveiling Interpretability in Self-Supervised Speech Representations for Parkinson's Diagnosis
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)
Reading Between the Frames: Multi-Modal Depression Detection in Videos from Non-Verbal Cues
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)
Learning Speaker-Invariant Visual Features for Lipreading
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
MA-LipNet: Multi-Dimensional Attention Networks for Robust Lipreading
di: Rossi, Matteo
Pubblicazione: (2026)
di: Rossi, Matteo
Pubblicazione: (2026)
PAVE: An End-to-End Dataset for Production Autonomous Vehicle Evaluation
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
RAL:Redundancy-Aware Lipreading Model Based on Differential Learning with Symmetric Views
di: gu, Zejun, et al.
Pubblicazione: (2024)
di: gu, Zejun, et al.
Pubblicazione: (2024)
End-to-End Driving with Online Trajectory Evaluation via BEV World Model
di: Li, Yingyan, et al.
Pubblicazione: (2025)
di: Li, Yingyan, et al.
Pubblicazione: (2025)
Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
Conditional Diffusion Model with Anatomical-Dose Dual Constraints for End-to-End Multi-Tumor Dose Prediction
di: Xie, Hui, et al.
Pubblicazione: (2025)
di: Xie, Hui, et al.
Pubblicazione: (2025)
An End-to-End Robust Point Cloud Semantic Segmentation Network with Single-Step Conditional Diffusion Models
di: Qu, Wentao, et al.
Pubblicazione: (2024)
di: Qu, Wentao, et al.
Pubblicazione: (2024)
Beyond Imperfections: A Conditional Inpainting Approach for End-to-End Artifact Removal in VTON and Pose Transfer
di: Tabatabaei, Aref, et al.
Pubblicazione: (2024)
di: Tabatabaei, Aref, et al.
Pubblicazione: (2024)
End-to-End Chess Recognition
di: Masouris, Athanasios, et al.
Pubblicazione: (2023)
di: Masouris, Athanasios, et al.
Pubblicazione: (2023)
Unraveling the Effects of Synthetic Data on End-to-End Autonomous Driving
di: Ge, Junhao, et al.
Pubblicazione: (2025)
di: Ge, Junhao, et al.
Pubblicazione: (2025)
End-to-End Vision Tokenizer Tuning
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
Enhancing Maritime Situational Awareness through End-to-End Onboard Raw Data Analysis
di: Del Prete, Roberto, et al.
Pubblicazione: (2024)
di: Del Prete, Roberto, et al.
Pubblicazione: (2024)
Cross-Attention Fusion of Visual and Geometric Features for Large Vocabulary Arabic Lipreading
di: Daou, Samar, et al.
Pubblicazione: (2024)
di: Daou, Samar, et al.
Pubblicazione: (2024)
Manipulation Facing Threats: Evaluating Physical Vulnerabilities in End-to-End Vision Language Action Models
di: Cheng, Hao, et al.
Pubblicazione: (2024)
di: Cheng, Hao, et al.
Pubblicazione: (2024)
End-to-End Implicit Neural Representations for Classification
di: Gielisse, Alexander, et al.
Pubblicazione: (2025)
di: Gielisse, Alexander, et al.
Pubblicazione: (2025)
Masks and Manuscripts: Advancing Medical Pre-training with End-to-End Masking and Narrative Structuring
di: Gowda, Shreyank N, et al.
Pubblicazione: (2024)
di: Gowda, Shreyank N, et al.
Pubblicazione: (2024)
End-to-End Full-Page Optical Music Recognition for Pianoform Sheet Music
di: Ríos-Vila, Antonio, et al.
Pubblicazione: (2024)
di: Ríos-Vila, Antonio, et al.
Pubblicazione: (2024)
Data Agent: Learning to Select Data via End-to-End Dynamic Optimization
di: Yang, Suorong, et al.
Pubblicazione: (2026)
di: Yang, Suorong, et al.
Pubblicazione: (2026)
End-to-End Learning of Multi-Organ Implicit Surfaces from 3D Medical Imaging Data
di: Zarin, Farahdiba, et al.
Pubblicazione: (2025)
di: Zarin, Farahdiba, et al.
Pubblicazione: (2025)
An Effective End-to-End Solution for Multimodal Action Recognition
di: Wang, Songping, et al.
Pubblicazione: (2025)
di: Wang, Songping, et al.
Pubblicazione: (2025)
End-to-End Facial Expression Detection in Long Videos
di: Fang, Yini, et al.
Pubblicazione: (2025)
di: Fang, Yini, et al.
Pubblicazione: (2025)
DLAFormer: An End-to-End Transformer For Document Layout Analysis
di: Wang, Jiawei, et al.
Pubblicazione: (2024)
di: Wang, Jiawei, et al.
Pubblicazione: (2024)
DEYO: DETR with YOLO for End-to-End Object Detection
di: Ouyang, Haodong
Pubblicazione: (2024)
di: Ouyang, Haodong
Pubblicazione: (2024)
CREPE: Coordinate-Aware End-to-End Document Parser
di: Okamoto, Yamato, et al.
Pubblicazione: (2024)
di: Okamoto, Yamato, et al.
Pubblicazione: (2024)
GenAD: Generative End-to-End Autonomous Driving
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
Towards Fully Decoupled End-to-End Person Search
di: Zhang, Pengcheng, et al.
Pubblicazione: (2023)
di: Zhang, Pengcheng, et al.
Pubblicazione: (2023)
End-to-End Optimization of Polarimetric Measurement and Material Classifier
di: Maeda, Ryota, et al.
Pubblicazione: (2026)
di: Maeda, Ryota, et al.
Pubblicazione: (2026)
Generative Scenario Rollouts for End-to-End Autonomous Driving
di: Yasarla, Rajeev, et al.
Pubblicazione: (2026)
di: Yasarla, Rajeev, et al.
Pubblicazione: (2026)
SDformer: Efficient End-to-End Transformer for Depth Completion
di: Qian, Jian, et al.
Pubblicazione: (2024)
di: Qian, Jian, et al.
Pubblicazione: (2024)
Puzzles: Unbounded Video-Depth Augmentation for Scalable End-to-End 3D Reconstruction
di: Ma, Jiahao, et al.
Pubblicazione: (2025)
di: Ma, Jiahao, et al.
Pubblicazione: (2025)
Data Scaling Laws for End-to-End Autonomous Driving
di: Naumann, Alexander, et al.
Pubblicazione: (2025)
di: Naumann, Alexander, et al.
Pubblicazione: (2025)
Augmenting End-to-End Steering Angle Prediction with CAN Bus Data
di: Singh, Amit
Pubblicazione: (2023)
di: Singh, Amit
Pubblicazione: (2023)
Reading Order Independent Metrics for Information Extraction in Handwritten Documents
di: Villanova-Aparisi, David, et al.
Pubblicazione: (2024)
di: Villanova-Aparisi, David, et al.
Pubblicazione: (2024)
LMVC: An End-to-End Learned Multiview Video Coding Framework
di: Sheng, Xihua, et al.
Pubblicazione: (2025)
di: Sheng, Xihua, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Comparison of Conventional Hybrid and CTC/Attention Decoders for Continuous Visual Speech Recognition
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024) -
Tailored Design of Audio-Visual Speech Recognition Models using Branchformers
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024) -
AnnoTheia: A Semi-Automatic Annotation Toolkit for Audio-Visual Speech Technologies
di: Acosta-Triana, José-M., et al.
Pubblicazione: (2024) -
Unveiling Interpretability in Self-Supervised Speech Representations for Parkinson's Diagnosis
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024) -
Reading Between the Frames: Multi-Modal Depression Detection in Videos from Non-Verbal Cues
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)