Class-Aware Mask-Guided Feature Refinement for Scene Text Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Mingkun, Yang, Biao, Liao, Minghui, Zhu, Yingying, Bai, Xiang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Sequential Visual and Semantic Consistency for Semi-supervised Text Recognition
by: Yang, Mingkun, et al.
Published: (2024)
by: Yang, Mingkun, et al.
Published: (2024)
Partial Scene Text Retrieval
by: Wang, Hao, et al.
Published: (2024)
by: Wang, Hao, et al.
Published: (2024)
Masked and Permuted Implicit Context Learning for Scene Text Recognition
by: Yang, Xiaomeng, et al.
Published: (2023)
by: Yang, Xiaomeng, et al.
Published: (2023)
Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition
by: Zhang, Yifei, et al.
Published: (2025)
by: Zhang, Yifei, et al.
Published: (2025)
Instruction-Guided Scene Text Recognition
by: Du, Yongkun, et al.
Published: (2024)
by: Du, Yongkun, et al.
Published: (2024)
TextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution
by: Liu, Baolin, et al.
Published: (2023)
by: Liu, Baolin, et al.
Published: (2023)
The First Swahili Language Scene Text Detection and Recognition Dataset
by: Douamba, Fadila Wendigoundi, et al.
Published: (2024)
by: Douamba, Fadila Wendigoundi, et al.
Published: (2024)
Enhancing Image Matting in Real-World Scenes with Mask-Guided Iterative Refinement
by: Liu, Rui
Published: (2025)
by: Liu, Rui
Published: (2025)
Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition
by: Lin, Tiancheng, et al.
Published: (2024)
by: Lin, Tiancheng, et al.
Published: (2024)
MDiff4STR: Mask Diffusion Model for Scene Text Recognition
by: Du, Yongkun, et al.
Published: (2025)
by: Du, Yongkun, et al.
Published: (2025)
Masked Next-Scale Prediction for Self-supervised Scene Text Recognition
by: Chen, Zhuohao, et al.
Published: (2026)
by: Chen, Zhuohao, et al.
Published: (2026)
TEACH: Text Encoding as Curriculum Hints for Scene Text Recognition
by: Yang, Xiahan, et al.
Published: (2025)
by: Yang, Xiahan, et al.
Published: (2025)
Text-Guided Video Masked Autoencoder
by: Fan, David, et al.
Published: (2024)
by: Fan, David, et al.
Published: (2024)
Uncertainty-Aware Diffusion Guided Refinement of 3D Scenes
by: Bose, Sarosij, et al.
Published: (2025)
by: Bose, Sarosij, et al.
Published: (2025)
SAM-Guided Masked Token Prediction for 3D Scene Understanding
by: Chen, Zhimin, et al.
Published: (2024)
by: Chen, Zhimin, et al.
Published: (2024)
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering
by: Maryam, Hiba, et al.
Published: (2024)
by: Maryam, Hiba, et al.
Published: (2024)
Gradient-Attention Guided Dual-Masking Synergetic Framework for Robust Text-based Person Retrieval
by: Zheng, Tianlu, et al.
Published: (2025)
by: Zheng, Tianlu, et al.
Published: (2025)
Real-Time Text Detection with Similar Mask in Traffic, Industrial, and Natural Scenes
by: Han, Xu, et al.
Published: (2024)
by: Han, Xu, et al.
Published: (2024)
Generating Human Motion in 3D Scenes from Text Descriptions
by: Cen, Zhi, et al.
Published: (2024)
by: Cen, Zhi, et al.
Published: (2024)
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
by: Shan, Bin, et al.
Published: (2024)
by: Shan, Bin, et al.
Published: (2024)
SVIPTR: Fast and Efficient Scene Text Recognition with Vision Permutable Extractor
by: Cheng, Xianfu, et al.
Published: (2024)
by: Cheng, Xianfu, et al.
Published: (2024)
IPAD: Iterative, Parallel, and Diffusion-based Network for Scene Text Recognition
by: Yang, Xiaomeng, et al.
Published: (2023)
by: Yang, Xiaomeng, et al.
Published: (2023)
MultiMAE-DER: Multimodal Masked Autoencoder for Dynamic Emotion Recognition
by: Xiang, Peihao, et al.
Published: (2024)
by: Xiang, Peihao, et al.
Published: (2024)
Global-Local Aware Scene Text Editing
by: Yang, Fuxiang, et al.
Published: (2025)
by: Yang, Fuxiang, et al.
Published: (2025)
AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner
by: Zheng, Haojie, et al.
Published: (2025)
by: Zheng, Haojie, et al.
Published: (2025)
CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model
by: Zhao, Shuai, et al.
Published: (2023)
by: Zhao, Shuai, et al.
Published: (2023)
SceneAware: Scene-Constrained Pedestrian Trajectory Prediction with LLM-Guided Walkability
by: Bai, Juho, et al.
Published: (2025)
by: Bai, Juho, et al.
Published: (2025)
Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation
by: Yang, Yuanbo, et al.
Published: (2024)
by: Yang, Yuanbo, et al.
Published: (2024)
MAPRPose: Mask-Aware Proposal and Amodal Refinement for Multi-Object 6D Pose Estimation
by: Luo, Yang, et al.
Published: (2026)
by: Luo, Yang, et al.
Published: (2026)
Recognition-Synergistic Scene Text Editing
by: Fang, Zhengyao, et al.
Published: (2025)
by: Fang, Zhengyao, et al.
Published: (2025)
SceneNAT: Masked Generative Modeling for Language-Guided Indoor Scene Synthesis
by: Choi, Jeongjun, et al.
Published: (2026)
by: Choi, Jeongjun, et al.
Published: (2026)
DGRNet: Disagreement-Guided Refinement for Uncertainty-Aware Brain Tumor Segmentation
by: Mohammadi, Bahram, et al.
Published: (2026)
by: Mohammadi, Bahram, et al.
Published: (2026)
Data-Free Class-Incremental Gesture Recognition with Prototype-Guided Pseudo Feature Replay
by: Wang, Hongsong, et al.
Published: (2025)
by: Wang, Hongsong, et al.
Published: (2025)
Uncertainty-Aware Label Refinement on Hypergraphs for Personalized Federated Facial Expression Recognition
by: Ding, Hu, et al.
Published: (2025)
by: Ding, Hu, et al.
Published: (2025)
Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens
by: Kim, Dongwon, et al.
Published: (2025)
by: Kim, Dongwon, et al.
Published: (2025)
Leveraging Text Localization for Scene Text Removal via Text-aware Masked Image Modeling
by: Wang, Zixiao, et al.
Published: (2024)
by: Wang, Zixiao, et al.
Published: (2024)
ICFRNet: Image Complexity Prior Guided Feature Refinement for Real-time Semantic Segmentation
by: Zhang, Xin, et al.
Published: (2024)
by: Zhang, Xin, et al.
Published: (2024)
OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video Recognition
by: Chen, Tongjia, et al.
Published: (2023)
by: Chen, Tongjia, et al.
Published: (2023)
Decoder Pre-Training with only Text for Scene Text Recognition
by: Zhao, Shuai, et al.
Published: (2024)
by: Zhao, Shuai, et al.
Published: (2024)
TextBoost: Boosting Scene Text Fidelity in Ultra-low Bitrate Image Compression
by: Wang, Bingxin, et al.
Published: (2026)
by: Wang, Bingxin, et al.
Published: (2026)
Similar Items
-
Sequential Visual and Semantic Consistency for Semi-supervised Text Recognition
by: Yang, Mingkun, et al.
Published: (2024) -
Partial Scene Text Retrieval
by: Wang, Hao, et al.
Published: (2024) -
Masked and Permuted Implicit Context Learning for Scene Text Recognition
by: Yang, Xiaomeng, et al.
Published: (2023) -
Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition
by: Zhang, Yifei, et al.
Published: (2025) -
Instruction-Guided Scene Text Recognition
by: Du, Yongkun, et al.
Published: (2024)