Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Tian, Wenjie, Shao, Mingchen, Mu, Bingshen, Geng, Xuelong, Wang, Chengyou, Liao, Yujie, Zhao, Zhixian, Zhang, Ziyu, Hu, Jingbin, Wei, Mengqi, Xie, Lei
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!