Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Lei, He, Yi, Wu, Fei, Wang, Shilin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Landmark Guided Visual Feature Extractor for Visual Speech Recognition with Limited Resource
par: Yang, Lei, et autres
Publié: (2025)
par: Yang, Lei, et autres
Publié: (2025)
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
par: He, Yi, et autres
Publié: (2025)
par: He, Yi, et autres
Publié: (2025)
VALLR-Pin: Uncertainty-Factorized Visual Speech Recognition for Mandarin with Pinyin Guidance
par: Sun, Chang, et autres
Publié: (2025)
par: Sun, Chang, et autres
Publié: (2025)
Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment
par: Zhao, Pengfei, et autres
Publié: (2025)
par: Zhao, Pengfei, et autres
Publié: (2025)
The NPU-ASLP System Description for Visual Speech Recognition in CNVSRC 2024
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
Large Language Model-Guided Semantic Alignment for Human Activity Recognition
par: Yan, Hua, et autres
Publié: (2024)
par: Yan, Hua, et autres
Publié: (2024)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
par: He, Xiang, et autres
Publié: (2025)
par: He, Xiang, et autres
Publié: (2025)
Semantic-Space-Intervened Diffusive Alignment for Visual Classification
par: Li, Zixuan, et autres
Publié: (2025)
par: Li, Zixuan, et autres
Publié: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
Improving Human Image Animation via Semantic Representation Alignment
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
InfoSyncNet: Information Synchronization Temporal Convolutional Network for Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
Cross-Block Fine-Grained Semantic Cascade for Skeleton-Based Sports Action Recognition
par: Liu, Zhendong, et autres
Publié: (2024)
par: Liu, Zhendong, et autres
Publié: (2024)
MOSA: Motion-Guided Semantic Alignment for Dynamic Scene Graph Generation
par: Wang, Xuejiao, et autres
Publié: (2026)
par: Wang, Xuejiao, et autres
Publié: (2026)
Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models
par: He, Hulingxiao, et autres
Publié: (2026)
par: He, Hulingxiao, et autres
Publié: (2026)
LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning
par: Yang, Kang, et autres
Publié: (2025)
par: Yang, Kang, et autres
Publié: (2025)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
par: Li, Yunheng, et autres
Publié: (2024)
par: Li, Yunheng, et autres
Publié: (2024)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
par: Li, Cancan, et autres
Publié: (2025)
par: Li, Cancan, et autres
Publié: (2025)
DAGait: Generalized Skeleton-Guided Data Alignment for Gait Recognition
par: Wu, Zhengxian, et autres
Publié: (2025)
par: Wu, Zhengxian, et autres
Publié: (2025)
Closing the Confusion Loop: CLIP-Guided Alignment for Source-Free Domain Adaptation
par: Wang, Shanshan, et autres
Publié: (2026)
par: Wang, Shanshan, et autres
Publié: (2026)
Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning
par: Wang, Linge, et autres
Publié: (2026)
par: Wang, Linge, et autres
Publié: (2026)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
LVLM-empowered Multi-modal Representation Learning for Visual Place Recognition
par: Wang, Teng, et autres
Publié: (2024)
par: Wang, Teng, et autres
Publié: (2024)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
par: Zheng, Yuze, et autres
Publié: (2024)
par: Zheng, Yuze, et autres
Publié: (2024)
It Takes Two: Accurate Gait Recognition in the Wild via Cross-granularity Alignment
par: Zheng, Jinkai, et autres
Publié: (2024)
par: Zheng, Jinkai, et autres
Publié: (2024)
DINOv3-Guided Cross Fusion Framework for Semantic-aware CT generation from MRI and CBCT
par: Zhou, Xianhao, et autres
Publié: (2025)
par: Zhou, Xianhao, et autres
Publié: (2025)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
par: E, Shaojun, et autres
Publié: (2025)
par: E, Shaojun, et autres
Publié: (2025)
Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers
par: Zhong, Yunshan, et autres
Publié: (2024)
par: Zhong, Yunshan, et autres
Publié: (2024)
Learning Semantic-Aware Representation in Visual-Language Models for Multi-Label Recognition with Partial Labels
par: Ruan, Haoxian, et autres
Publié: (2024)
par: Ruan, Haoxian, et autres
Publié: (2024)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
par: Hao, Bowen, et autres
Publié: (2025)
par: Hao, Bowen, et autres
Publié: (2025)
Cross Paradigm Representation and Alignment Transformer for Image Deraining
par: Zou, Shun, et autres
Publié: (2025)
par: Zou, Shun, et autres
Publié: (2025)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
par: Chen, Yaru, et autres
Publié: (2025)
par: Chen, Yaru, et autres
Publié: (2025)
SGC-VQGAN: Towards Complex Scene Representation via Semantic Guided Clustering Codebook
par: Ding, Chenjing, et autres
Publié: (2024)
par: Ding, Chenjing, et autres
Publié: (2024)
Zero-Shot Skeleton-Based Action Recognition With Prototype-Guided Feature Alignment
par: Zhou, Kai, et autres
Publié: (2025)
par: Zhou, Kai, et autres
Publié: (2025)
Object Affordance Recognition and Grounding via Multi-scale Cross-modal Representation Learning
par: Wan, Xinhang, et autres
Publié: (2025)
par: Wan, Xinhang, et autres
Publié: (2025)
Free-Grained Hierarchical Visual Recognition
par: Park, Seulki, et autres
Publié: (2025)
par: Park, Seulki, et autres
Publié: (2025)
Training-Free Representation Guidance for Diffusion Models with a Representation Alignment Projector
par: Zu, Wenqiang, et autres
Publié: (2026)
par: Zu, Wenqiang, et autres
Publié: (2026)
Lightweight Cross-Spectral Face Recognition via Contrastive Alignment and Distillation
par: George, Anjith, et autres
Publié: (2026)
par: George, Anjith, et autres
Publié: (2026)
RefAlign: Representation Alignment for Reference-to-Video Generation
par: Wang, Lei, et autres
Publié: (2026)
par: Wang, Lei, et autres
Publié: (2026)
Semantic Alignment for Multimodal Large Language Models
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
Documents similaires
-
Landmark Guided Visual Feature Extractor for Visual Speech Recognition with Limited Resource
par: Yang, Lei, et autres
Publié: (2025) -
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
par: He, Yi, et autres
Publié: (2025) -
VALLR-Pin: Uncertainty-Factorized Visual Speech Recognition for Mandarin with Pinyin Guidance
par: Sun, Chang, et autres
Publié: (2025) -
Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment
par: Zhao, Pengfei, et autres
Publié: (2025) -
The NPU-ASLP System Description for Visual Speech Recognition in CNVSRC 2024
par: Wang, He, et autres
Publié: (2024)