InstructOCR: Instruction Boosting Scene Text Spotting
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Duan, Chen, Jiang, Qianyi, Fu, Pei, Chen, Jiamin, Li, Shengxi, Wang, Zining, Guo, Shan, Luo, Junfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
par: Duan, Chen, et autres
Publié: (2024)
par: Duan, Chen, et autres
Publié: (2024)
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
par: Wang, Zining, et autres
Publié: (2025)
par: Wang, Zining, et autres
Publié: (2025)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
par: Fu, Pei, et autres
Publié: (2025)
par: Fu, Pei, et autres
Publié: (2025)
PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration
par: Duan, Chen, et autres
Publié: (2026)
par: Duan, Chen, et autres
Publié: (2026)
InstructTable: Improving Table Structure Recognition Through Instructions
par: Chen, Boming, et autres
Publié: (2026)
par: Chen, Boming, et autres
Publié: (2026)
A Token-level Text Image Foundation Model for Document Understanding
par: Guan, Tongkun, et autres
Publié: (2025)
par: Guan, Tongkun, et autres
Publié: (2025)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
par: Shen, Zhixuan, et autres
Publié: (2024)
par: Shen, Zhixuan, et autres
Publié: (2024)
InstructBooth: Instruction-following Personalized Text-to-Image Generation
par: Chae, Daewon, et autres
Publié: (2023)
par: Chae, Daewon, et autres
Publié: (2023)
TIGER: Text-Instructed 3D Gaussian Retrieval and Coherent Editing
par: Xu, Teng, et autres
Publié: (2024)
par: Xu, Teng, et autres
Publié: (2024)
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
par: Duan, Zhongjie, et autres
Publié: (2024)
par: Duan, Zhongjie, et autres
Publié: (2024)
InstructAvatar: Text-Guided Emotion and Motion Control for Avatar Generation
par: Wang, Yuchi, et autres
Publié: (2024)
par: Wang, Yuchi, et autres
Publié: (2024)
InstructDET: Diversifying Referring Object Detection with Generalized Instructions
par: Dang, Ronghao, et autres
Publié: (2023)
par: Dang, Ronghao, et autres
Publié: (2023)
Instruction-Guided Scene Text Recognition
par: Du, Yongkun, et autres
Publié: (2024)
par: Du, Yongkun, et autres
Publié: (2024)
InstructEngine: Instruction-driven Text-to-Image Alignment
par: Lu, Xingyu, et autres
Publié: (2025)
par: Lu, Xingyu, et autres
Publié: (2025)
DNTextSpotter: Arbitrary-Shaped Scene Text Spotting via Improved Denoising Training
par: Xie, Yu, et autres
Publié: (2024)
par: Xie, Yu, et autres
Publié: (2024)
Learning to Instruct for Visual Instruction Tuning
par: Zhou, Zhihan, et autres
Publié: (2025)
par: Zhou, Zhihan, et autres
Publié: (2025)
Instruct-Imagen: Image Generation with Multi-modal Instruction
par: Hu, Hexiang, et autres
Publié: (2024)
par: Hu, Hexiang, et autres
Publié: (2024)
WeCromCL: Weakly Supervised Cross-Modality Contrastive Learning for Transcription-only Supervised Text Spotting
par: Wu, Jingjing, et autres
Publié: (2024)
par: Wu, Jingjing, et autres
Publié: (2024)
CLIPDrag: Combining Text-based and Drag-based Instructions for Image Editing
par: Jiang, Ziqi, et autres
Publié: (2024)
par: Jiang, Ziqi, et autres
Publié: (2024)
HetScene: Heterogeneity-Aware Diffusion for Dense Indoor Scene Generation
par: Chen, Zini, et autres
Publié: (2026)
par: Chen, Zini, et autres
Publié: (2026)
TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis
par: Xie, Yu, et autres
Publié: (2025)
par: Xie, Yu, et autres
Publié: (2025)
InstructScene: Instruction-Driven 3D Indoor Scene Synthesis with Semantic Graph Prior
par: Lin, Chenguo, et autres
Publié: (2024)
par: Lin, Chenguo, et autres
Publié: (2024)
Diff-Instruct++: Training One-step Text-to-image Generator Model to Align with Human Preferences
par: Luo, Weijian
Publié: (2024)
par: Luo, Weijian
Publié: (2024)
Text2Street: Controllable Text-to-image Generation for Street Views
par: Su, Jinming, et autres
Publié: (2024)
par: Su, Jinming, et autres
Publié: (2024)
InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation
par: Xiao, Jinqi, et autres
Publié: (2025)
par: Xiao, Jinqi, et autres
Publié: (2025)
Instruct 4D-to-4D: Editing 4D Scenes as Pseudo-3D Scenes Using 2D Diffusion
par: Mou, Linzhan, et autres
Publié: (2024)
par: Mou, Linzhan, et autres
Publié: (2024)
Hear the Scene: Audio-Enhanced Text Spotting
par: Li, Jing, et autres
Publié: (2024)
par: Li, Jing, et autres
Publié: (2024)
VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search
par: Jia, Yiming, et autres
Publié: (2025)
par: Jia, Yiming, et autres
Publié: (2025)
HunyuanOCR Technical Report
par: Hunyuan Vision Team, et autres
Publié: (2025)
par: Hunyuan Vision Team, et autres
Publié: (2025)
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
par: Xu, Longwei, et autres
Publié: (2026)
par: Xu, Longwei, et autres
Publié: (2026)
Autonomous Character-Scene Interaction Synthesis from Text Instruction
par: Jiang, Nan, et autres
Publié: (2024)
par: Jiang, Nan, et autres
Publié: (2024)
Parrot Captions Teach CLIP to Spot Text
par: Lin, Yiqi, et autres
Publié: (2023)
par: Lin, Yiqi, et autres
Publié: (2023)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
par: Liu, Yuliang, et autres
Publié: (2024)
par: Liu, Yuliang, et autres
Publié: (2024)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
par: Qin, Bosheng, et autres
Publié: (2023)
par: Qin, Bosheng, et autres
Publié: (2023)
LatentEditor: Text Driven Local Editing of 3D Scenes
par: Khalid, Umar, et autres
Publié: (2023)
par: Khalid, Umar, et autres
Publié: (2023)
Efficiently Leveraging Linguistic Priors for Scene Text Spotting
par: Nguyen, Nguyen, et autres
Publié: (2024)
par: Nguyen, Nguyen, et autres
Publié: (2024)
Text-Enhanced Panoptic Symbol Spotting in CAD Drawings
par: Liu, Xianlin, et autres
Publié: (2025)
par: Liu, Xianlin, et autres
Publié: (2025)
GloTSFormer: Global Video Text Spotting Transformer
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
ParkingScenes: A Structured Dataset for End-to-End Autonomous Parking in Simulation Scenes
par: Chen, Haonan, et autres
Publié: (2026)
par: Chen, Haonan, et autres
Publié: (2026)
Documents similaires
-
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
par: Duan, Chen, et autres
Publié: (2024) -
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
par: Wang, Zining, et autres
Publié: (2025) -
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
par: Fu, Pei, et autres
Publié: (2025) -
PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration
par: Duan, Chen, et autres
Publié: (2026) -
InstructTable: Improving Table Structure Recognition Through Instructions
par: Chen, Boming, et autres
Publié: (2026)