MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shan, Bin, Fei, Xiang, Shi, Wei, Wang, An-Lan, Tang, Guozhi, Liao, Lei, Tang, Jingqun, Bai, Xiang, Huang, Can |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ParGo: Bridging Vision-Language with Partial and Global Views
par: Wang, An-Lan, et autres
Publié: (2024)
par: Wang, An-Lan, et autres
Publié: (2024)
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
par: Zhu, Hanshen, et autres
Publié: (2026)
par: Zhu, Hanshen, et autres
Publié: (2026)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
par: Fu, Ling, et autres
Publié: (2024)
par: Fu, Ling, et autres
Publié: (2024)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
par: Tang, Jingqun, et autres
Publié: (2024)
par: Tang, Jingqun, et autres
Publié: (2024)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
par: Tang, Jingqun, et autres
Publié: (2024)
par: Tang, Jingqun, et autres
Publié: (2024)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
par: Wang, An-Lan, et autres
Publié: (2025)
par: Wang, An-Lan, et autres
Publié: (2025)
Harmonizing Visual Text Comprehension and Generation
par: Zhao, Zhen, et autres
Publié: (2024)
par: Zhao, Zhen, et autres
Publié: (2024)
Multi-modal In-Context Learning Makes an Ego-evolving Scene Text Recognizer
par: Zhao, Zhen, et autres
Publié: (2023)
par: Zhao, Zhen, et autres
Publié: (2023)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
par: Nie, Yuxiang, et autres
Publié: (2025)
par: Nie, Yuxiang, et autres
Publié: (2025)
Partial Scene Text Retrieval
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
par: Feng, Hao, et autres
Publié: (2026)
par: Feng, Hao, et autres
Publié: (2026)
Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
par: Feng, Hao, et autres
Publié: (2025)
par: Feng, Hao, et autres
Publié: (2025)
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering
par: Maryam, Hiba, et autres
Publié: (2024)
par: Maryam, Hiba, et autres
Publié: (2024)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
par: Li, Bohao, et autres
Publié: (2024)
par: Li, Bohao, et autres
Publié: (2024)
Class-Aware Mask-Guided Feature Refinement for Scene Text Recognition
par: Yang, Mingkun, et autres
Publié: (2024)
par: Yang, Mingkun, et autres
Publié: (2024)
TabPedia: Towards Comprehensive Visual Table Understanding with Concept Synergy
par: Zhao, Weichao, et autres
Publié: (2024)
par: Zhao, Weichao, et autres
Publié: (2024)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
par: Feng, Hao, et autres
Publié: (2023)
par: Feng, Hao, et autres
Publié: (2023)
TextSculptor: Training and Benchmarking Scene Text Editing
par: Lin, Yiheng, et autres
Publié: (2026)
par: Lin, Yiheng, et autres
Publié: (2026)
Sequential Visual and Semantic Consistency for Semi-supervised Text Recognition
par: Yang, Mingkun, et autres
Publié: (2024)
par: Yang, Mingkun, et autres
Publié: (2024)
Therapeutic strategies for aberrant splicing in cancer and genetic disorders
par: Wenhua Shi, et autres
Publié: (2024)
par: Wenhua Shi, et autres
Publié: (2024)
Progressive Evolution from Single-Point to Polygon for Scene Text
par: Deng, Linger, et autres
Publié: (2023)
par: Deng, Linger, et autres
Publié: (2023)
TextBoost: Boosting Scene Text Fidelity in Ultra-low Bitrate Image Compression
par: Wang, Bingxin, et autres
Publié: (2026)
par: Wang, Bingxin, et autres
Publié: (2026)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
par: Luo, Chuwei, et autres
Publié: (2022)
par: Luo, Chuwei, et autres
Publié: (2022)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
par: Yu, Wenwen, et autres
Publié: (2025)
par: Yu, Wenwen, et autres
Publié: (2025)
ZeroScene: A Zero-Shot Framework for 3D Scene Generation from a Single Image and Controllable Texture Editing
par: Tang, Xiang, et autres
Publié: (2025)
par: Tang, Xiang, et autres
Publié: (2025)
Advancing Sequential Numerical Prediction in Autoregressive Models
par: Fei, Xiang, et autres
Publié: (2025)
par: Fei, Xiang, et autres
Publié: (2025)
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
par: Tang, Yolo Y., et autres
Publié: (2025)
par: Tang, Yolo Y., et autres
Publié: (2025)
NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
par: Xu, Wei, et autres
Publié: (2025)
par: Xu, Wei, et autres
Publié: (2025)
Harnessing Webpage UIs for Text-Rich Visual Understanding
par: Liu, Junpeng, et autres
Publié: (2024)
par: Liu, Junpeng, et autres
Publié: (2024)
The First Swahili Language Scene Text Detection and Recognition Dataset
par: Douamba, Fadila Wendigoundi, et autres
Publié: (2024)
par: Douamba, Fadila Wendigoundi, et autres
Publié: (2024)
PathVG: A New Benchmark and Dataset for Pathology Visual Grounding
par: Zhong, Chunlin, et autres
Publié: (2025)
par: Zhong, Chunlin, et autres
Publié: (2025)
Recent Advances in 3D Object and Scene Generation: A Survey
par: Tang, Xiang, et autres
Publié: (2025)
par: Tang, Xiang, et autres
Publié: (2025)
MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
par: Yin, Liang, et autres
Publié: (2025)
par: Yin, Liang, et autres
Publié: (2025)
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
par: Huang, Mingxin, et autres
Publié: (2024)
par: Huang, Mingxin, et autres
Publié: (2024)
Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective
par: Yu, Xinmiao, et autres
Publié: (2024)
par: Yu, Xinmiao, et autres
Publié: (2024)
A Unified Framework for 3D Scene Understanding
par: Xu, Wei, et autres
Publié: (2024)
par: Xu, Wei, et autres
Publié: (2024)
Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
par: Yu, Haiyang, et autres
Publié: (2025)
par: Yu, Haiyang, et autres
Publié: (2025)
Benchmarking Robustness of Multimodal Image-Text Models under Distribution Shift
par: Qiu, Jielin, et autres
Publié: (2022)
par: Qiu, Jielin, et autres
Publié: (2022)
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
Attention Mechanism based Cognition-level Scene Understanding
par: Tang, Xuejiao, et autres
Publié: (2022)
par: Tang, Xuejiao, et autres
Publié: (2022)
Documents similaires
-
ParGo: Bridging Vision-Language with Partial and Global Views
par: Wang, An-Lan, et autres
Publié: (2024) -
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
par: Zhu, Hanshen, et autres
Publié: (2026) -
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
par: Fu, Ling, et autres
Publié: (2024) -
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
par: Tang, Jingqun, et autres
Publié: (2024) -
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
par: Tang, Jingqun, et autres
Publié: (2024)