MDiff4STR: Mask Diffusion Model for Scene Text Recognition
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Du, Yongkun, Zhao, Miaomiao, Fan, Songlin, Chen, Zhineng, Jia, Caiyan, Jiang, Yu-Gang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Instruction-Guided Scene Text Recognition
von: Du, Yongkun, et al.
Veröffentlicht: (2024)
von: Du, Yongkun, et al.
Veröffentlicht: (2024)
SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text Recognition
von: Du, Yongkun, et al.
Veröffentlicht: (2024)
von: Du, Yongkun, et al.
Veröffentlicht: (2024)
Out of Length Text Recognition with Sub-String Matching
von: Du, Yongkun, et al.
Veröffentlicht: (2024)
von: Du, Yongkun, et al.
Veröffentlicht: (2024)
Decoder Pre-Training with only Text for Scene Text Recognition
von: Zhao, Shuai, et al.
Veröffentlicht: (2024)
von: Zhao, Shuai, et al.
Veröffentlicht: (2024)
TextSSR: Diffusion-based Data Synthesis for Scene Text Recognition
von: Ye, Xingsong, et al.
Veröffentlicht: (2024)
von: Ye, Xingsong, et al.
Veröffentlicht: (2024)
What Is Wrong with Synthetic Data for Scene Text Recognition? A Strong Synthetic Engine with Diverse Simulations and Self-Evolution
von: Ye, Xingsong, et al.
Veröffentlicht: (2026)
von: Ye, Xingsong, et al.
Veröffentlicht: (2026)
LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting
von: Su, Yuchen, et al.
Veröffentlicht: (2025)
von: Su, Yuchen, et al.
Veröffentlicht: (2025)
Explicit Relational Reasoning Network for Scene Text Detection
von: Su, Yuchen, et al.
Veröffentlicht: (2024)
von: Su, Yuchen, et al.
Veröffentlicht: (2024)
UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters
von: Du, Yongkun, et al.
Veröffentlicht: (2025)
von: Du, Yongkun, et al.
Veröffentlicht: (2025)
DiffSTR: Controlled Diffusion Models for Scene Text Removal
von: Pathak, Sanhita, et al.
Veröffentlicht: (2024)
von: Pathak, Sanhita, et al.
Veröffentlicht: (2024)
CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model
von: Zhao, Shuai, et al.
Veröffentlicht: (2023)
von: Zhao, Shuai, et al.
Veröffentlicht: (2023)
Complex Mathematical Expression Recognition: Benchmark, Large-Scale Dataset and Strong Baseline
von: Bai, Weikang, et al.
Veröffentlicht: (2025)
von: Bai, Weikang, et al.
Veröffentlicht: (2025)
IndicSTR12: A Dataset for Indic Scene Text Recognition
von: Lunia, Harsh, et al.
Veröffentlicht: (2024)
von: Lunia, Harsh, et al.
Veröffentlicht: (2024)
DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation
von: Du, Yongkun, et al.
Veröffentlicht: (2025)
von: Du, Yongkun, et al.
Veröffentlicht: (2025)
LRANet: Towards Accurate and Efficient Scene Text Detection with Low-Rank Approximation Network
von: Su, Yuchen, et al.
Veröffentlicht: (2023)
von: Su, Yuchen, et al.
Veröffentlicht: (2023)
SwiMDiff: Scene-wide Matching Contrastive Learning with Diffusion Constraint for Remote Sensing Image
von: Tian, Jiayuan, et al.
Veröffentlicht: (2024)
von: Tian, Jiayuan, et al.
Veröffentlicht: (2024)
EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition
von: Lin, Tiancheng, et al.
Veröffentlicht: (2024)
von: Lin, Tiancheng, et al.
Veröffentlicht: (2024)
Masked Next-Scale Prediction for Self-supervised Scene Text Recognition
von: Chen, Zhuohao, et al.
Veröffentlicht: (2026)
von: Chen, Zhuohao, et al.
Veröffentlicht: (2026)
Masked and Permuted Implicit Context Learning for Scene Text Recognition
von: Yang, Xiaomeng, et al.
Veröffentlicht: (2023)
von: Yang, Xiaomeng, et al.
Veröffentlicht: (2023)
Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition
von: Zhang, Yifei, et al.
Veröffentlicht: (2025)
von: Zhang, Yifei, et al.
Veröffentlicht: (2025)
CWT-Net: Super-resolution of Histopathology Images Using a Cross-scale Wavelet-based Transformer
von: Jia, Feiyang, et al.
Veröffentlicht: (2024)
von: Jia, Feiyang, et al.
Veröffentlicht: (2024)
Class-Aware Mask-Guided Feature Refinement for Scene Text Recognition
von: Yang, Mingkun, et al.
Veröffentlicht: (2024)
von: Yang, Mingkun, et al.
Veröffentlicht: (2024)
TextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution
von: Liu, Baolin, et al.
Veröffentlicht: (2023)
von: Liu, Baolin, et al.
Veröffentlicht: (2023)
IPAD: Iterative, Parallel, and Diffusion-based Network for Scene Text Recognition
von: Yang, Xiaomeng, et al.
Veröffentlicht: (2023)
von: Yang, Xiaomeng, et al.
Veröffentlicht: (2023)
MDiff-FMT: Morphology-aware Diffusion Model for Fluorescence Molecular Tomography with Small-scale Datasets
von: Zhang, Peng, et al.
Veröffentlicht: (2024)
von: Zhang, Peng, et al.
Veröffentlicht: (2024)
Leveraging Text Localization for Scene Text Removal via Text-aware Masked Image Modeling
von: Wang, Zixiao, et al.
Veröffentlicht: (2024)
von: Wang, Zixiao, et al.
Veröffentlicht: (2024)
Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models
von: Gong, Chao, et al.
Veröffentlicht: (2024)
von: Gong, Chao, et al.
Veröffentlicht: (2024)
GaitSTR: Gait Recognition with Sequential Two-stream Refinement
von: Zheng, Wanrong, et al.
Veröffentlicht: (2024)
von: Zheng, Wanrong, et al.
Veröffentlicht: (2024)
Recognition-Synergistic Scene Text Editing
von: Fang, Zhengyao, et al.
Veröffentlicht: (2025)
von: Fang, Zhengyao, et al.
Veröffentlicht: (2025)
Layout Agnostic Scene Text Image Synthesis with Diffusion Models
von: Zhangli, Qilong, et al.
Veröffentlicht: (2024)
von: Zhangli, Qilong, et al.
Veröffentlicht: (2024)
DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
von: Yang, Haibo, et al.
Veröffentlicht: (2024)
von: Yang, Haibo, et al.
Veröffentlicht: (2024)
AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning
von: Wang, Xin, et al.
Veröffentlicht: (2024)
von: Wang, Xin, et al.
Veröffentlicht: (2024)
STR-Cert: Robustness Certification for Deep Text Recognition on Deep Learning Pipelines and Vision Transformers
von: Shao, Daqian, et al.
Veröffentlicht: (2023)
von: Shao, Daqian, et al.
Veröffentlicht: (2023)
Text-driven Human Motion Generation with Motion Masked Diffusion Model
von: Chen, Xingyu
Veröffentlicht: (2024)
von: Chen, Xingyu
Veröffentlicht: (2024)
GenRec: Unifying Video Generation and Recognition with Diffusion Models
von: Weng, Zejia, et al.
Veröffentlicht: (2024)
von: Weng, Zejia, et al.
Veröffentlicht: (2024)
Aggregated Text Transformer for Scene Text Detection
von: Zhou, Zhao, et al.
Veröffentlicht: (2022)
von: Zhou, Zhao, et al.
Veröffentlicht: (2022)
Stochasticity-aware No-Reference Point Cloud Quality Assessment
von: Fan, Songlin, et al.
Veröffentlicht: (2024)
von: Fan, Songlin, et al.
Veröffentlicht: (2024)
CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition
von: Zheng, Jinzhi, et al.
Veröffentlicht: (2024)
von: Zheng, Jinzhi, et al.
Veröffentlicht: (2024)
SceneGlue: Scene-Aware Transformer for Feature Matching without Scene-Level Annotation
von: Du, Songlin, et al.
Veröffentlicht: (2026)
von: Du, Songlin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Instruction-Guided Scene Text Recognition
von: Du, Yongkun, et al.
Veröffentlicht: (2024) -
SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text Recognition
von: Du, Yongkun, et al.
Veröffentlicht: (2024) -
Out of Length Text Recognition with Sub-String Matching
von: Du, Yongkun, et al.
Veröffentlicht: (2024) -
Decoder Pre-Training with only Text for Scene Text Recognition
von: Zhao, Shuai, et al.
Veröffentlicht: (2024) -
TextSSR: Diffusion-based Data Synthesis for Scene Text Recognition
von: Ye, Xingsong, et al.
Veröffentlicht: (2024)