CNVSRC 2023: The First Chinese Continuous Visual Speech Recognition Challenge
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Chen, Liu, Zehua, Li, Xiaolou, Li, Lantian, Wang, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge
por: Liu, Zehua, et al.
Publicado: (2025)
por: Liu, Zehua, et al.
Publicado: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
por: Liu, Zehua, et al.
Publicado: (2024)
por: Liu, Zehua, et al.
Publicado: (2024)
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
por: Liu, Zehua, et al.
Publicado: (2025)
por: Liu, Zehua, et al.
Publicado: (2025)
The NPU-ASLP System Description for Visual Speech Recognition in CNVSRC 2024
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
Quantitative Analysis of Audio-Visual Tasks: An Information-Theoretic Perspective
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Tailored Design of Audio-Visual Speech Recognition Models using Branchformers
por: Gimeno-Gómez, David, et al.
Publicado: (2024)
por: Gimeno-Gómez, David, et al.
Publicado: (2024)
Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction
por: Teng, Matthew Kit Khinn, et al.
Publicado: (2025)
por: Teng, Matthew Kit Khinn, et al.
Publicado: (2025)
ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition
por: Nguyen, Thai-Binh, et al.
Publicado: (2025)
por: Nguyen, Thai-Binh, et al.
Publicado: (2025)
Designing Practical Models for Isolated Word Visual Speech Recognition
por: Panagos, Iason Ioannis, et al.
Publicado: (2025)
por: Panagos, Iason Ioannis, et al.
Publicado: (2025)
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Beyond Words: Enhancing Desire, Emotion, and Sentiment Recognition with Non-Verbal Cues
por: Chen, Wei, et al.
Publicado: (2025)
por: Chen, Wei, et al.
Publicado: (2025)
Lightweight Operations for Visual Speech Recognition
por: Panagos, Iason Ioannis, et al.
Publicado: (2025)
por: Panagos, Iason Ioannis, et al.
Publicado: (2025)
VAEER: Visual Attention-Inspired Emotion Elicitation Reasoning
por: Man, Fanhang, et al.
Publicado: (2025)
por: Man, Fanhang, et al.
Publicado: (2025)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
por: Dong, Shuai, et al.
Publicado: (2025)
por: Dong, Shuai, et al.
Publicado: (2025)
Generative Sign-description Prompts with Multi-positive Contrastive Learning for Sign Language Recognition
por: Liang, Siyu, et al.
Publicado: (2025)
por: Liang, Siyu, et al.
Publicado: (2025)
Grounding Language Models for Visual Entity Recognition
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
por: Song, Wei, et al.
Publicado: (2025)
por: Song, Wei, et al.
Publicado: (2025)
Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
por: Li, Sifan, et al.
Publicado: (2025)
por: Li, Sifan, et al.
Publicado: (2025)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
por: Ma, Yubo, et al.
Publicado: (2024)
por: Ma, Yubo, et al.
Publicado: (2024)
Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering
por: Li, Yangfu, et al.
Publicado: (2025)
por: Li, Yangfu, et al.
Publicado: (2025)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
por: Chen, Peiyuan, et al.
Publicado: (2024)
por: Chen, Peiyuan, et al.
Publicado: (2024)
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
por: Li, Jinyuan, et al.
Publicado: (2024)
por: Li, Jinyuan, et al.
Publicado: (2024)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
por: Chung, Jiwan, et al.
Publicado: (2024)
por: Chung, Jiwan, et al.
Publicado: (2024)
A Comparative Study of Continuous Sign Language Recognition Techniques
por: Alyami, Sarah, et al.
Publicado: (2024)
por: Alyami, Sarah, et al.
Publicado: (2024)
SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token Synchronization
por: Ahn, Young Jin, et al.
Publicado: (2024)
por: Ahn, Young Jin, et al.
Publicado: (2024)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
por: Wang, Jinting, et al.
Publicado: (2025)
por: Wang, Jinting, et al.
Publicado: (2025)
You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
por: Lawrence, Logan, et al.
Publicado: (2025)
por: Lawrence, Logan, et al.
Publicado: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
por: Luo, Fuwen, et al.
Publicado: (2024)
por: Luo, Fuwen, et al.
Publicado: (2024)
Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling
por: Nortje, Leanne
Publicado: (2024)
por: Nortje, Leanne
Publicado: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
por: Wang, Yanling, et al.
Publicado: (2025)
por: Wang, Yanling, et al.
Publicado: (2025)
Defining and Evaluating Visual Language Models' Basic Spatial Abilities: A Perspective from Psychometrics
por: Xu, Wenrui, et al.
Publicado: (2025)
por: Xu, Wenrui, et al.
Publicado: (2025)
TransLPRNet: Lite Vision-Language Network for Single/Dual-line Chinese License Plate Recognition
por: Xu, Guangzhu, et al.
Publicado: (2025)
por: Xu, Guangzhu, et al.
Publicado: (2025)
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
por: He, Zongtao, et al.
Publicado: (2023)
por: He, Zongtao, et al.
Publicado: (2023)
OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models
por: Dong, Xuanzhao, et al.
Publicado: (2026)
por: Dong, Xuanzhao, et al.
Publicado: (2026)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
por: Jiang, Houcheng, et al.
Publicado: (2026)
por: Jiang, Houcheng, et al.
Publicado: (2026)
Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning
por: Dong, Qihua, et al.
Publicado: (2026)
por: Dong, Qihua, et al.
Publicado: (2026)
Ejemplares similares
-
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge
por: Liu, Zehua, et al.
Publicado: (2025) -
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
por: Liu, Zehua, et al.
Publicado: (2024) -
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
por: Liu, Zehua, et al.
Publicado: (2025) -
The NPU-ASLP System Description for Visual Speech Recognition in CNVSRC 2024
por: Wang, He, et al.
Publicado: (2024) -
Quantitative Analysis of Audio-Visual Tasks: An Information-Theoretic Perspective
por: Chen, Chen, et al.
Publicado: (2024)