Instruction-Guided Scene Text Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Yongkun, Chen, Zhineng, Su, Yuchen, Jia, Caiyan, Jiang, Yu-Gang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text Recognition
par: Du, Yongkun, et autres
Publié: (2024)
par: Du, Yongkun, et autres
Publié: (2024)
MDiff4STR: Mask Diffusion Model for Scene Text Recognition
par: Du, Yongkun, et autres
Publié: (2025)
par: Du, Yongkun, et autres
Publié: (2025)
Out of Length Text Recognition with Sub-String Matching
par: Du, Yongkun, et autres
Publié: (2024)
par: Du, Yongkun, et autres
Publié: (2024)
Decoder Pre-Training with only Text for Scene Text Recognition
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
TextSSR: Diffusion-based Data Synthesis for Scene Text Recognition
par: Ye, Xingsong, et autres
Publié: (2024)
par: Ye, Xingsong, et autres
Publié: (2024)
LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting
par: Su, Yuchen, et autres
Publié: (2025)
par: Su, Yuchen, et autres
Publié: (2025)
Explicit Relational Reasoning Network for Scene Text Detection
par: Su, Yuchen, et autres
Publié: (2024)
par: Su, Yuchen, et autres
Publié: (2024)
What Is Wrong with Synthetic Data for Scene Text Recognition? A Strong Synthetic Engine with Diverse Simulations and Self-Evolution
par: Ye, Xingsong, et autres
Publié: (2026)
par: Ye, Xingsong, et autres
Publié: (2026)
UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters
par: Du, Yongkun, et autres
Publié: (2025)
par: Du, Yongkun, et autres
Publié: (2025)
Complex Mathematical Expression Recognition: Benchmark, Large-Scale Dataset and Strong Baseline
par: Bai, Weikang, et autres
Publié: (2025)
par: Bai, Weikang, et autres
Publié: (2025)
LRANet: Towards Accurate and Efficient Scene Text Detection with Low-Rank Approximation Network
par: Su, Yuchen, et autres
Publié: (2023)
par: Su, Yuchen, et autres
Publié: (2023)
DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation
par: Du, Yongkun, et autres
Publié: (2025)
par: Du, Yongkun, et autres
Publié: (2025)
CWT-Net: Super-resolution of Histopathology Images Using a Cross-scale Wavelet-based Transformer
par: Jia, Feiyang, et autres
Publié: (2024)
par: Jia, Feiyang, et autres
Publié: (2024)
Autonomous Character-Scene Interaction Synthesis from Text Instruction
par: Jiang, Nan, et autres
Publié: (2024)
par: Jiang, Nan, et autres
Publié: (2024)
Recognition-Synergistic Scene Text Editing
par: Fang, Zhengyao, et autres
Publié: (2025)
par: Fang, Zhengyao, et autres
Publié: (2025)
Class-Aware Mask-Guided Feature Refinement for Scene Text Recognition
par: Yang, Mingkun, et autres
Publié: (2024)
par: Yang, Mingkun, et autres
Publié: (2024)
AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning
par: Wang, Xin, et autres
Publié: (2024)
par: Wang, Xin, et autres
Publié: (2024)
DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
par: Yang, Haibo, et autres
Publié: (2024)
par: Yang, Haibo, et autres
Publié: (2024)
Learning to Rank Patches for Unbiased Image Redundancy Reduction
par: Luo, Yang, et autres
Publié: (2024)
par: Luo, Yang, et autres
Publié: (2024)
Infinite Motion: Extended Motion Generation via Long Text Instructions
par: Li, Mengtian, et autres
Publié: (2024)
par: Li, Mengtian, et autres
Publié: (2024)
InstructOCR: Instruction Boosting Scene Text Spotting
par: Duan, Chen, et autres
Publié: (2024)
par: Duan, Chen, et autres
Publié: (2024)
Masked Next-Scale Prediction for Self-supervised Scene Text Recognition
par: Chen, Zhuohao, et autres
Publié: (2026)
par: Chen, Zhuohao, et autres
Publié: (2026)
Masked and Permuted Implicit Context Learning for Scene Text Recognition
par: Yang, Xiaomeng, et autres
Publié: (2023)
par: Yang, Xiaomeng, et autres
Publié: (2023)
IPAD: Iterative, Parallel, and Diffusion-based Network for Scene Text Recognition
par: Yang, Xiaomeng, et autres
Publié: (2023)
par: Yang, Xiaomeng, et autres
Publié: (2023)
TEACH: Text Encoding as Curriculum Hints for Scene Text Recognition
par: Yang, Xiahan, et autres
Publié: (2025)
par: Yang, Xiahan, et autres
Publié: (2025)
GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
par: Liu, Lin, et autres
Publié: (2025)
par: Liu, Lin, et autres
Publié: (2025)
Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition
par: Lin, Tiancheng, et autres
Publié: (2024)
par: Lin, Tiancheng, et autres
Publié: (2024)
IGD: Instructional Graphic Design with Multimodal Layer Generation
par: Qu, Yadong, et autres
Publié: (2025)
par: Qu, Yadong, et autres
Publié: (2025)
ICPR 2026 Competition on Low-Resolution License Plate Recognition
par: Laroca, Rayson, et autres
Publié: (2026)
par: Laroca, Rayson, et autres
Publié: (2026)
Aggregated Text Transformer for Scene Text Detection
par: Zhou, Zhao, et autres
Publié: (2022)
par: Zhou, Zhao, et autres
Publié: (2022)
CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition
par: Zheng, Jinzhi, et autres
Publié: (2024)
par: Zheng, Jinzhi, et autres
Publié: (2024)
Reading in the Dark: Low-light Scene Text Recognition
par: Fu, Xuanshuo, et autres
Publié: (2026)
par: Fu, Xuanshuo, et autres
Publié: (2026)
Efficient and Accurate Scene Text Recognition with Cascaded-Transformers
par: Ozkan, Savas, et autres
Publié: (2025)
par: Ozkan, Savas, et autres
Publié: (2025)
Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition
par: Zhang, Yifei, et autres
Publié: (2025)
par: Zhang, Yifei, et autres
Publié: (2025)
SVIPTR: Fast and Efficient Scene Text Recognition with Vision Permutable Extractor
par: Cheng, Xianfu, et autres
Publié: (2024)
par: Cheng, Xianfu, et autres
Publié: (2024)
Watch Your Steps: Local Image and Scene Editing by Text Instructions
par: Mirzaei, Ashkan, et autres
Publié: (2023)
par: Mirzaei, Ashkan, et autres
Publié: (2023)
The First Swahili Language Scene Text Detection and Recognition Dataset
par: Douamba, Fadila Wendigoundi, et autres
Publié: (2024)
par: Douamba, Fadila Wendigoundi, et autres
Publié: (2024)
FreeEnhance: Tuning-Free Image Enhancement via Content-Consistent Noising-and-Denoising Process
par: Luo, Yang, et autres
Publié: (2024)
par: Luo, Yang, et autres
Publié: (2024)
HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images
par: Yang, Yuchen, et autres
Publié: (2024)
par: Yang, Yuchen, et autres
Publié: (2024)
RGE-GS: Reward-Guided Expansive Driving Scene Reconstruction via Diffusion Priors
par: Du, Sicong, et autres
Publié: (2025)
par: Du, Sicong, et autres
Publié: (2025)
Documents similaires
-
SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text Recognition
par: Du, Yongkun, et autres
Publié: (2024) -
MDiff4STR: Mask Diffusion Model for Scene Text Recognition
par: Du, Yongkun, et autres
Publié: (2025) -
Out of Length Text Recognition with Sub-String Matching
par: Du, Yongkun, et autres
Publié: (2024) -
Decoder Pre-Training with only Text for Scene Text Recognition
par: Zhao, Shuai, et autres
Publié: (2024) -
TextSSR: Diffusion-based Data Synthesis for Scene Text Recognition
par: Ye, Xingsong, et autres
Publié: (2024)