Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Zhang, Yang, Biao, Liu, Qiang, Ma, Zhiyin, Zhang, Shuo, Yang, Jingxu, Sun, Yabo, Liu, Yuliang, Bai, Xiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
von: Liu, Yuliang, et al.
Veröffentlicht: (2024)
von: Liu, Yuliang, et al.
Veröffentlicht: (2024)
LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance
von: Li, Zhang, et al.
Veröffentlicht: (2025)
von: Li, Zhang, et al.
Veröffentlicht: (2025)
Exploring the Capabilities of Large Multimodal Models on Dense Text
von: Zhang, Shuo, et al.
Veröffentlicht: (2024)
von: Zhang, Shuo, et al.
Veröffentlicht: (2024)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
von: Li, Zhang, et al.
Veröffentlicht: (2025)
von: Li, Zhang, et al.
Veröffentlicht: (2025)
Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid
von: Huang, Mingxin, et al.
Veröffentlicht: (2024)
von: Huang, Mingxin, et al.
Veröffentlicht: (2024)
MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
von: Yin, Liang, et al.
Veröffentlicht: (2025)
von: Yin, Liang, et al.
Veröffentlicht: (2025)
Liquid: Language Models are Scalable and Unified Multi-modal Generators
von: Wu, Junfeng, et al.
Veröffentlicht: (2024)
von: Wu, Junfeng, et al.
Veröffentlicht: (2024)
LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching
von: Tian, Mengxiao, et al.
Veröffentlicht: (2025)
von: Tian, Mengxiao, et al.
Veröffentlicht: (2025)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
von: Yu, Wenwen, et al.
Veröffentlicht: (2025)
von: Yu, Wenwen, et al.
Veröffentlicht: (2025)
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
von: Liu, Yuliang, et al.
Veröffentlicht: (2023)
von: Liu, Yuliang, et al.
Veröffentlicht: (2023)
Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning
von: Zhang, Zijian, et al.
Veröffentlicht: (2024)
von: Zhang, Zijian, et al.
Veröffentlicht: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
von: Zhang, Kaichen, et al.
Veröffentlicht: (2024)
von: Zhang, Kaichen, et al.
Veröffentlicht: (2024)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
von: Yu, Wenwen, et al.
Veröffentlicht: (2025)
von: Yu, Wenwen, et al.
Veröffentlicht: (2025)
MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
von: Zhang, Jiarui, et al.
Veröffentlicht: (2025)
von: Zhang, Jiarui, et al.
Veröffentlicht: (2025)
Toward Real Text Manipulation Detection: New Dataset and New Solution
von: Luo, Dongliang, et al.
Veröffentlicht: (2023)
von: Luo, Dongliang, et al.
Veröffentlicht: (2023)
Text-Region Matching for Multi-Label Image Recognition with Missing Labels
von: Ma, Leilei, et al.
Veröffentlicht: (2024)
von: Ma, Leilei, et al.
Veröffentlicht: (2024)
MSSDF: Modality-Shared Self-supervised Distillation for High-Resolution Multi-modal Remote Sensing Image Learning
von: Wang, Tong, et al.
Veröffentlicht: (2025)
von: Wang, Tong, et al.
Veröffentlicht: (2025)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
von: Ma, Zehong, et al.
Veröffentlicht: (2025)
von: Ma, Zehong, et al.
Veröffentlicht: (2025)
Sequential Visual and Semantic Consistency for Semi-supervised Text Recognition
von: Yang, Mingkun, et al.
Veröffentlicht: (2024)
von: Yang, Mingkun, et al.
Veröffentlicht: (2024)
Class-Aware Mask-Guided Feature Refinement for Scene Text Recognition
von: Yang, Mingkun, et al.
Veröffentlicht: (2024)
von: Yang, Mingkun, et al.
Veröffentlicht: (2024)
Bridging the Gap Between End-to-End and Two-Step Text Spotting
von: Huang, Mingxin, et al.
Veröffentlicht: (2024)
von: Huang, Mingxin, et al.
Veröffentlicht: (2024)
Q-Ground: Image Quality Grounding with Large Multi-modality Models
von: Chen, Chaofeng, et al.
Veröffentlicht: (2024)
von: Chen, Chaofeng, et al.
Veröffentlicht: (2024)
Training-free Geometric Image Editing on Diffusion Models
von: Zhu, Hanshen, et al.
Veröffentlicht: (2025)
von: Zhu, Hanshen, et al.
Veröffentlicht: (2025)
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
von: Li, Zhang, et al.
Veröffentlicht: (2026)
von: Li, Zhang, et al.
Veröffentlicht: (2026)
Labeled-to-Unlabeled Distribution Alignment for Partially-Supervised Multi-Organ Medical Image Segmentation
von: Jiang, Xixi, et al.
Veröffentlicht: (2024)
von: Jiang, Xixi, et al.
Veröffentlicht: (2024)
PromptCharm: Text-to-Image Generation through Multi-modal Prompting and Refinement
von: Wang, Zhijie, et al.
Veröffentlicht: (2024)
von: Wang, Zhijie, et al.
Veröffentlicht: (2024)
The First Swahili Language Scene Text Detection and Recognition Dataset
von: Douamba, Fadila Wendigoundi, et al.
Veröffentlicht: (2024)
von: Douamba, Fadila Wendigoundi, et al.
Veröffentlicht: (2024)
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
von: Zhu, Mengdan, et al.
Veröffentlicht: (2025)
von: Zhu, Mengdan, et al.
Veröffentlicht: (2025)
On the Multi-modal Vulnerability of Diffusion Models
von: Yang, Dingcheng, et al.
Veröffentlicht: (2024)
von: Yang, Dingcheng, et al.
Veröffentlicht: (2024)
Progressively Label Enhancement for Large Language Model Alignment
von: Liu, Biao, et al.
Veröffentlicht: (2024)
von: Liu, Biao, et al.
Veröffentlicht: (2024)
SemiETS: Integrating Spatial and Content Consistencies for Semi-Supervised End-to-end Text Spotting
von: Luo, Dongliang, et al.
Veröffentlicht: (2025)
von: Luo, Dongliang, et al.
Veröffentlicht: (2025)
Progressive Evolution from Single-Point to Polygon for Scene Text
von: Deng, Linger, et al.
Veröffentlicht: (2023)
von: Deng, Linger, et al.
Veröffentlicht: (2023)
SpatialLock: Precise Spatial Control in Text-to-Image Synthesis
von: Liu, Biao, et al.
Veröffentlicht: (2025)
von: Liu, Biao, et al.
Veröffentlicht: (2025)
GIT-Mol: A Multi-modal Large Language Model for Molecular Science with Graph, Image, and Text
von: Liu, Pengfei, et al.
Veröffentlicht: (2023)
von: Liu, Pengfei, et al.
Veröffentlicht: (2023)
OTTER: Open-Tagging via Text-Image Representation for Multi-modal Understanding
von: Ouyang, Jieer, et al.
Veröffentlicht: (2025)
von: Ouyang, Jieer, et al.
Veröffentlicht: (2025)
PSALM: Pixelwise SegmentAtion with Large Multi-Modal Model
von: Zhang, Zheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zheng, et al.
Veröffentlicht: (2024)
OmniFit: Multi-modal 3D Body Fitting via Scale-agnostic Dense Landmark Prediction
von: Cai, Zeyu, et al.
Veröffentlicht: (2026)
von: Cai, Zeyu, et al.
Veröffentlicht: (2026)
TAI++: Text as Image for Multi-Label Image Classification by Co-Learning Transferable Prompt
von: Wu, Xiangyu, et al.
Veröffentlicht: (2024)
von: Wu, Xiangyu, et al.
Veröffentlicht: (2024)
Novel Object Synthesis via Adaptive Text-Image Harmony
von: Xiong, Zeren, et al.
Veröffentlicht: (2024)
von: Xiong, Zeren, et al.
Veröffentlicht: (2024)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
von: Sun, Yanpeng, et al.
Veröffentlicht: (2024)
von: Sun, Yanpeng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
von: Liu, Yuliang, et al.
Veröffentlicht: (2024) -
LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance
von: Li, Zhang, et al.
Veröffentlicht: (2025) -
Exploring the Capabilities of Large Multimodal Models on Dense Text
von: Zhang, Shuo, et al.
Veröffentlicht: (2024) -
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
von: Li, Zhang, et al.
Veröffentlicht: (2025) -
Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid
von: Huang, Mingxin, et al.
Veröffentlicht: (2024)