TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Ya-Qi, Liao, Minghui, Wu, Jihao, Liao, Yongxin, Zheng, Xiaoyu, Zeng, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
por: Yu, Ya-Qi, et al.
Publicado: (2024)
por: Yu, Ya-Qi, et al.
Publicado: (2024)
MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
por: Chen, Feilong, et al.
Publicado: (2025)
por: Chen, Feilong, et al.
Publicado: (2025)
VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning
por: Yan, Hao, et al.
Publicado: (2025)
por: Yan, Hao, et al.
Publicado: (2025)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
por: Zhao, Fufangchen, et al.
Publicado: (2025)
por: Zhao, Fufangchen, et al.
Publicado: (2025)
Text-guided Fine-Grained Video Anomaly Understanding
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
por: He, Xin, et al.
Publicado: (2025)
por: He, Xin, et al.
Publicado: (2025)
Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective
por: Yu, Xinmiao, et al.
Publicado: (2024)
por: Yu, Xinmiao, et al.
Publicado: (2024)
ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding
por: Peng, Yi-Xing, et al.
Publicado: (2025)
por: Peng, Yi-Xing, et al.
Publicado: (2025)
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
por: Tao, Zhou, et al.
Publicado: (2025)
por: Tao, Zhou, et al.
Publicado: (2025)
MCFNet: A Multimodal Collaborative Fusion Network for Fine-Grained Semantic Classification
por: Qiao, Yang, et al.
Publicado: (2025)
por: Qiao, Yang, et al.
Publicado: (2025)
UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models
por: Pan, Hewen, et al.
Publicado: (2025)
por: Pan, Hewen, et al.
Publicado: (2025)
MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception
por: Wang, Yuhao, et al.
Publicado: (2024)
por: Wang, Yuhao, et al.
Publicado: (2024)
FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions
por: Zhao, Peisen, et al.
Publicado: (2026)
por: Zhao, Peisen, et al.
Publicado: (2026)
Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval
por: Lu, Xuan, et al.
Publicado: (2026)
por: Lu, Xuan, et al.
Publicado: (2026)
MARINER: A 3E-Driven Benchmark for Fine-Grained Perception and Complex Reasoning in Open-Water Environments
por: Liao, Xingming, et al.
Publicado: (2026)
por: Liao, Xingming, et al.
Publicado: (2026)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
por: Li, Hongyu, et al.
Publicado: (2025)
por: Li, Hongyu, et al.
Publicado: (2025)
MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation
por: Wang, Jia, et al.
Publicado: (2025)
por: Wang, Jia, et al.
Publicado: (2025)
Partial Scene Text Retrieval
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Visual Preference Optimization with Rubric Rewards
por: Yu, Ya-Qi, et al.
Publicado: (2026)
por: Yu, Ya-Qi, et al.
Publicado: (2026)
Reinforcement Learning with Robust Rubric Rewards
por: Yu, Ya-Qi, et al.
Publicado: (2026)
por: Yu, Ya-Qi, et al.
Publicado: (2026)
ConsistentID: Portrait Generation with Multimodal Fine-Grained Identity Preserving
por: Huang, Jiehui, et al.
Publicado: (2024)
por: Huang, Jiehui, et al.
Publicado: (2024)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
por: Liu, Peng, et al.
Publicado: (2025)
por: Liu, Peng, et al.
Publicado: (2025)
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
por: Lan, Long, et al.
Publicado: (2024)
por: Lan, Long, et al.
Publicado: (2024)
MotionAgent: Fine-grained Controllable Video Generation via Motion Field Agent
por: Liao, Xinyao, et al.
Publicado: (2025)
por: Liao, Xinyao, et al.
Publicado: (2025)
SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design
por: Yu, Yunjie, et al.
Publicado: (2025)
por: Yu, Yunjie, et al.
Publicado: (2025)
Sequential Visual and Semantic Consistency for Semi-supervised Text Recognition
por: Yang, Mingkun, et al.
Publicado: (2024)
por: Yang, Mingkun, et al.
Publicado: (2024)
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
por: Jin, Weiyang, et al.
Publicado: (2025)
por: Jin, Weiyang, et al.
Publicado: (2025)
Class-Aware Mask-Guided Feature Refinement for Scene Text Recognition
por: Yang, Mingkun, et al.
Publicado: (2024)
por: Yang, Mingkun, et al.
Publicado: (2024)
Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model
por: Dong, Jihao, et al.
Publicado: (2024)
por: Dong, Jihao, et al.
Publicado: (2024)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
por: Liao, Wenhui, et al.
Publicado: (2024)
por: Liao, Wenhui, et al.
Publicado: (2024)
SGIA: Enhancing Fine-Grained Visual Classification with Sequence Generative Image Augmentation
por: Liao, Qiyu, et al.
Publicado: (2024)
por: Liao, Qiyu, et al.
Publicado: (2024)
FineXtrol: Controllable Motion Generation via Fine-Grained Text
por: Shen, Keming, et al.
Publicado: (2025)
por: Shen, Keming, et al.
Publicado: (2025)
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
por: Qian, Long, et al.
Publicado: (2024)
por: Qian, Long, et al.
Publicado: (2024)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
por: Yu, Hong-Tao, et al.
Publicado: (2025)
por: Yu, Hong-Tao, et al.
Publicado: (2025)
Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning
por: Liao, Xinyao, et al.
Publicado: (2025)
por: Liao, Xinyao, et al.
Publicado: (2025)
Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning
por: Yang, Siqi, et al.
Publicado: (2025)
por: Yang, Siqi, et al.
Publicado: (2025)
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
por: Xie, Xudong, et al.
Publicado: (2024)
por: Xie, Xudong, et al.
Publicado: (2024)
Safety of Multimodal Large Language Models on Images and Texts
por: Liu, Xin, et al.
Publicado: (2024)
por: Liu, Xin, et al.
Publicado: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
Exploring Fine-Grained Image-Text Alignment for Referring Remote Sensing Image Segmentation
por: Lei, Sen, et al.
Publicado: (2024)
por: Lei, Sen, et al.
Publicado: (2024)
Ejemplares similares
-
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
por: Yu, Ya-Qi, et al.
Publicado: (2024) -
MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
por: Chen, Feilong, et al.
Publicado: (2025) -
VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning
por: Yan, Hao, et al.
Publicado: (2025) -
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
por: Zhao, Fufangchen, et al.
Publicado: (2025) -
Text-guided Fine-Grained Video Anomaly Understanding
por: Gu, Jihao, et al.
Publicado: (2025)