Landmark Guided Visual Feature Extractor for Visual Speech Recognition with Limited Resource
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Lei, Jin, Junshan, Zhang, Mingyuan, He, Yi, Chen, Bofan, Wang, Shilin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
di: Yang, Lei, et al.
Pubblicazione: (2026)
di: Yang, Lei, et al.
Pubblicazione: (2026)
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
di: He, Yi, et al.
Pubblicazione: (2025)
di: He, Yi, et al.
Pubblicazione: (2025)
The NPU-ASLP System Description for Visual Speech Recognition in CNVSRC 2024
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
CQVPR: Landmark-aware Contextual Queries for Visual Place Recognition
di: Li, Dongyue, et al.
Pubblicazione: (2025)
di: Li, Dongyue, et al.
Pubblicazione: (2025)
Feature Complementation Architecture for Visual Place Recognition
di: Wang, Weiwei, et al.
Pubblicazione: (2025)
di: Wang, Weiwei, et al.
Pubblicazione: (2025)
Facial Landmark Visualization and Emotion Recognition Through Neural Networks
di: Juárez-Jiménez, Israel, et al.
Pubblicazione: (2025)
di: Juárez-Jiménez, Israel, et al.
Pubblicazione: (2025)
GLip: A Global-Local Integrated Progressive Framework for Robust Visual Speech Recognition
di: Wang, Tianyue, et al.
Pubblicazione: (2025)
di: Wang, Tianyue, et al.
Pubblicazione: (2025)
Enhancing Fitness Movement Recognition with Attention Mechanism and Pre-Trained Feature Extractors
di: Nishat, Shanjid Hasan, et al.
Pubblicazione: (2025)
di: Nishat, Shanjid Hasan, et al.
Pubblicazione: (2025)
Adversarial Patch for 3D Local Feature Extractor
di: Pao, Yu Wen, et al.
Pubblicazione: (2024)
di: Pao, Yu Wen, et al.
Pubblicazione: (2024)
Feature-Based Dual Visual Feature Extraction Model for Compound Multimodal Emotion Recognition
di: Liu, Ran, et al.
Pubblicazione: (2025)
di: Liu, Ran, et al.
Pubblicazione: (2025)
A Visually Attentive Splice Localization Network with Multi-Domain Feature Extractor and Multi-Receptive Field Upsampler
di: Yadav, Ankit, et al.
Pubblicazione: (2024)
di: Yadav, Ankit, et al.
Pubblicazione: (2024)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
di: Hao, Bowen, et al.
Pubblicazione: (2025)
di: Hao, Bowen, et al.
Pubblicazione: (2025)
SVIPTR: Fast and Efficient Scene Text Recognition with Vision Permutable Extractor
di: Cheng, Xianfu, et al.
Pubblicazione: (2024)
di: Cheng, Xianfu, et al.
Pubblicazione: (2024)
ULF-Loc: Unbiased Landmark Feature for Robust Visual Localization with 3D Gaussian Splatting
di: Gu, Yingdong, et al.
Pubblicazione: (2026)
di: Gu, Yingdong, et al.
Pubblicazione: (2026)
Explainable Pathomics Feature Visualization via Correlation-aware Conditional Feature Editing
di: Yang, Yuechen, et al.
Pubblicazione: (2026)
di: Yang, Yuechen, et al.
Pubblicazione: (2026)
CNVSRC 2023: The First Chinese Continuous Visual Speech Recognition Challenge
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
VOOM: Robust Visual Object Odometry and Mapping using Hierarchical Landmarks
di: Wang, Yutong, et al.
Pubblicazione: (2024)
di: Wang, Yutong, et al.
Pubblicazione: (2024)
SuperPlace: The Renaissance of Classical Feature Aggregation for Visual Place Recognition in the Era of Foundation Models
di: Liu, Bingxi, et al.
Pubblicazione: (2025)
di: Liu, Bingxi, et al.
Pubblicazione: (2025)
Head-Pose-Aware Visual Speech Recognition with FiLM Modulation
di: Teng, Matthew Kit Khinn, et al.
Pubblicazione: (2026)
di: Teng, Matthew Kit Khinn, et al.
Pubblicazione: (2026)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)
Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction
di: Teng, Matthew Kit Khinn, et al.
Pubblicazione: (2025)
di: Teng, Matthew Kit Khinn, et al.
Pubblicazione: (2025)
Distillation Improves Visual Place Recognition for Low Quality Images
di: Yang, Anbang, et al.
Pubblicazione: (2023)
di: Yang, Anbang, et al.
Pubblicazione: (2023)
Improving Visual Recognition with Hyperbolical Visual Hierarchy Mapping
di: Kwon, Hyeongjun, et al.
Pubblicazione: (2024)
di: Kwon, Hyeongjun, et al.
Pubblicazione: (2024)
Hierarchical Graph Feature Enhancement with Adaptive Frequency Modulation for Visual Recognition
di: Zhao, Feiyue, et al.
Pubblicazione: (2025)
di: Zhao, Feiyue, et al.
Pubblicazione: (2025)
EmbodiedPlace: Learning Mixture-of-Features with Embodied Constraints for Visual Place Recognition
di: Liu, Bingxi, et al.
Pubblicazione: (2025)
di: Liu, Bingxi, et al.
Pubblicazione: (2025)
Trustworthy Hate Speech Detection Through Visual Augmentation
di: Yang, Ziyuan, et al.
Pubblicazione: (2024)
di: Yang, Ziyuan, et al.
Pubblicazione: (2024)
VALLR-Pin: Uncertainty-Factorized Visual Speech Recognition for Mandarin with Pinyin Guidance
di: Sun, Chang, et al.
Pubblicazione: (2025)
di: Sun, Chang, et al.
Pubblicazione: (2025)
Toward Next-generation Medical Vision Backbones: Modeling Finer-grained Long-range Visual Dependency
di: Meng, Mingyuan
Pubblicazione: (2025)
di: Meng, Mingyuan
Pubblicazione: (2025)
Improving the Multi-label Atomic Activity Recognition by Robust Visual Feature and Advanced Attention @ ROAD++ Atomic Activity Recognition 2024
di: Cao, Jiamin, et al.
Pubblicazione: (2024)
di: Cao, Jiamin, et al.
Pubblicazione: (2024)
Feature Fusion from Head to Tail for Long-Tailed Visual Recognition
di: Li, Mengke, et al.
Pubblicazione: (2023)
di: Li, Mengke, et al.
Pubblicazione: (2023)
Unified Speech Recognition: A Single Model for Auditory, Visual, and Audiovisual Inputs
di: Haliassos, Alexandros, et al.
Pubblicazione: (2024)
di: Haliassos, Alexandros, et al.
Pubblicazione: (2024)
Optimal-Landmark-Guided Image Blending for Face Morphing Attacks
di: He, Qiaoyun, et al.
Pubblicazione: (2024)
di: He, Qiaoyun, et al.
Pubblicazione: (2024)
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
di: Kim, Minsu, et al.
Pubblicazione: (2024)
di: Kim, Minsu, et al.
Pubblicazione: (2024)
Transfer Learning from Visual Speech Recognition to Mouthing Recognition in German Sign Language
di: Pham, Dinh Nam, et al.
Pubblicazione: (2025)
di: Pham, Dinh Nam, et al.
Pubblicazione: (2025)
TCFormer: Visual Recognition via Token Clustering Transformer
di: Zeng, Wang, et al.
Pubblicazione: (2024)
di: Zeng, Wang, et al.
Pubblicazione: (2024)
Analyzing the Feature Extractor Networks for Face Image Synthesis
di: Sarıtaş, Erdi, et al.
Pubblicazione: (2024)
di: Sarıtaş, Erdi, et al.
Pubblicazione: (2024)
Adaptive Deep Iris Feature Extractor at Arbitrary Resolutions
di: Shoji, Yuho, et al.
Pubblicazione: (2024)
di: Shoji, Yuho, et al.
Pubblicazione: (2024)
LoDisc: Learning Global-Local Discriminative Features for Self-Supervised Fine-Grained Visual Recognition
di: Shi, Jialu, et al.
Pubblicazione: (2024)
di: Shi, Jialu, et al.
Pubblicazione: (2024)
Visual Prompting in LLMs for Enhancing Emotion Recognition
di: Zhang, Qixuan, et al.
Pubblicazione: (2024)
di: Zhang, Qixuan, et al.
Pubblicazione: (2024)
UGNA-VPR: A Novel Training Paradigm for Visual Place Recognition Based on Uncertainty-Guided NeRF Augmentation
di: Shen, Yehui, et al.
Pubblicazione: (2025)
di: Shen, Yehui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
di: Yang, Lei, et al.
Pubblicazione: (2026) -
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
di: He, Yi, et al.
Pubblicazione: (2025) -
The NPU-ASLP System Description for Visual Speech Recognition in CNVSRC 2024
di: Wang, He, et al.
Pubblicazione: (2024) -
CQVPR: Landmark-aware Contextual Queries for Visual Place Recognition
di: Li, Dongyue, et al.
Pubblicazione: (2025) -
Feature Complementation Architecture for Visual Place Recognition
di: Wang, Weiwei, et al.
Pubblicazione: (2025)