TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Ya-Qi, Liao, Minghui, Zhang, Jiwen, Wu, Jihao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
par: Chen, Shimin, et autres
Publié: (2024)
par: Chen, Shimin, et autres
Publié: (2024)
Enhancing Vision-Language Model with Unmasked Token Alignment
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
par: Ye, Maoyuan, et autres
Publié: (2025)
par: Ye, Maoyuan, et autres
Publié: (2025)
MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
par: Chen, Feilong, et autres
Publié: (2025)
par: Chen, Feilong, et autres
Publié: (2025)
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
par: Guo, Yangyang, et autres
Publié: (2023)
par: Guo, Yangyang, et autres
Publié: (2023)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
par: He, Zhentao, et autres
Publié: (2025)
par: He, Zhentao, et autres
Publié: (2025)
Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See
par: Zhang, Zeliang, et autres
Publié: (2024)
par: Zhang, Zeliang, et autres
Publié: (2024)
How Do Large Vision-Language Models See Text in Image? Unveiling the Distinctive Role of OCR Heads
par: Baek, Ingeol, et autres
Publié: (2025)
par: Baek, Ingeol, et autres
Publié: (2025)
Exploring OCR-augmented Generation for Bilingual VQA
par: Lee, JoonHo, et autres
Publié: (2025)
par: Lee, JoonHo, et autres
Publié: (2025)
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
par: Xu, Longwei, et autres
Publié: (2026)
par: Xu, Longwei, et autres
Publié: (2026)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
par: Luo, Junwei, et autres
Publié: (2025)
par: Luo, Junwei, et autres
Publié: (2025)
Grounding Everything in Tokens for Multimodal Large Language Models
par: Ren, Xiangxuan, et autres
Publié: (2025)
par: Ren, Xiangxuan, et autres
Publié: (2025)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
par: Li, Jianjian, et autres
Publié: (2025)
par: Li, Jianjian, et autres
Publié: (2025)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
par: Cao, Jianjian, et autres
Publié: (2024)
par: Cao, Jianjian, et autres
Publié: (2024)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
par: Chen, Song, et autres
Publié: (2025)
par: Chen, Song, et autres
Publié: (2025)
Can Large Vision-Language Models Correct Semantic Grounding Errors By Themselves?
par: Liao, Yuan-Hong, et autres
Publié: (2024)
par: Liao, Yuan-Hong, et autres
Publié: (2024)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
par: Ma, Kexin, et autres
Publié: (2026)
par: Ma, Kexin, et autres
Publié: (2026)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
par: Li, Zejun, et autres
Publié: (2024)
par: Li, Zejun, et autres
Publié: (2024)
From Plausibility to Verifiability: Risk-Controlled Generative OCR with Vision-Language Models
par: Gong, Weile, et autres
Publié: (2026)
par: Gong, Weile, et autres
Publié: (2026)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
par: Ma, Chuofan, et autres
Publié: (2024)
par: Ma, Chuofan, et autres
Publié: (2024)
Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective
par: Yu, Xinmiao, et autres
Publié: (2024)
par: Yu, Xinmiao, et autres
Publié: (2024)
Q-VLM: Post-training Quantization for Large Vision-Language Models
par: Wang, Changyuan, et autres
Publié: (2024)
par: Wang, Changyuan, et autres
Publié: (2024)
iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models
par: Hu, Lianyu, et autres
Publié: (2024)
par: Hu, Lianyu, et autres
Publié: (2024)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
par: Vesalainen, Ari, et autres
Publié: (2026)
par: Vesalainen, Ari, et autres
Publié: (2026)
AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models
par: Momayiz, Imane, et autres
Publié: (2026)
par: Momayiz, Imane, et autres
Publié: (2026)
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
par: Taghadouini, Said, et autres
Publié: (2026)
par: Taghadouini, Said, et autres
Publié: (2026)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
par: Fan, Rong, et autres
Publié: (2026)
par: Fan, Rong, et autres
Publié: (2026)
Android in the Zoo: Chain-of-Action-Thought for GUI Agents
par: Zhang, Jiwen, et autres
Publié: (2024)
par: Zhang, Jiwen, et autres
Publié: (2024)
GutenOCR: A Grounded Vision-Language Front-End for Documents
par: Heidenreich, Hunter, et autres
Publié: (2026)
par: Heidenreich, Hunter, et autres
Publié: (2026)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
par: Zhong, Yufeng, et autres
Publié: (2026)
par: Zhong, Yufeng, et autres
Publié: (2026)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
par: Chen, Junjie, et autres
Publié: (2025)
par: Chen, Junjie, et autres
Publié: (2025)
Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models
par: Nützel, Felix, et autres
Publié: (2025)
par: Nützel, Felix, et autres
Publié: (2025)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
par: Zhao, Shiyu, et autres
Publié: (2024)
par: Zhao, Shiyu, et autres
Publié: (2024)
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
par: Cao, Sihan, et autres
Publié: (2026)
par: Cao, Sihan, et autres
Publié: (2026)
Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions
par: Karamolegkou, Antonia, et autres
Publié: (2026)
par: Karamolegkou, Antonia, et autres
Publié: (2026)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
Rethinking Token Reduction for Large Vision-Language Models
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
Documents similaires
-
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
par: Yu, Ya-Qi, et autres
Publié: (2024) -
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
par: Chen, Shimin, et autres
Publié: (2024) -
Enhancing Vision-Language Model with Unmasked Token Alignment
par: Liu, Jihao, et autres
Publié: (2024) -
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
par: Ye, Maoyuan, et autres
Publié: (2025) -
MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
par: Chen, Feilong, et autres
Publié: (2025)