The Devil is in Fine-tuning and Long-tailed Problems:A New Benchmark for Scene Text Detection
Fuente:
arXiv
Saved in:
| Main Authors: | Cao, Tianjiao, Lyu, Jiahao, Zeng, Weichao, Mu, Weimin, Zhou, Yu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
by: Lyu, Jiahao, et al.
Published: (2024)
by: Lyu, Jiahao, et al.
Published: (2024)
TextCtrl: Diffusion-based Scene Text Editing with Prior Guidance Control
by: Zeng, Weichao, et al.
Published: (2024)
by: Zeng, Weichao, et al.
Published: (2024)
First Creating Backgrounds Then Rendering Texts: A New Paradigm for Visual Text Blending
by: Li, Zhenhang, et al.
Published: (2024)
by: Li, Zhenhang, et al.
Published: (2024)
Arbitrary Reading Order Scene Text Spotter with Local Semantics Guidance
by: Lyu, Jiahao, et al.
Published: (2024)
by: Lyu, Jiahao, et al.
Published: (2024)
Semantic-guided Fine-tuning of Foundation Model for Long-tailed Visual Recognition
by: Peng, Yufei, et al.
Published: (2025)
by: Peng, Yufei, et al.
Published: (2025)
IMTBench: A Multi-Scenario Cross-Modal Collaborative Evaluation Benchmark for In-Image Machine Translation
by: Lyu, Jiahao, et al.
Published: (2026)
by: Lyu, Jiahao, et al.
Published: (2026)
Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts
by: Li, Gengluo, et al.
Published: (2025)
by: Li, Gengluo, et al.
Published: (2025)
LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations
by: Yang, Zhichao, et al.
Published: (2025)
by: Yang, Zhichao, et al.
Published: (2025)
TextSculptor: Training and Benchmarking Scene Text Editing
by: Lin, Yiheng, et al.
Published: (2026)
by: Lin, Yiheng, et al.
Published: (2026)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
by: Zhong, Yangyang, et al.
Published: (2025)
by: Zhong, Yangyang, et al.
Published: (2025)
Self-supervised Anomaly Detection Pretraining Enhances Long-tail ECG Diagnosis
by: Jiang, Aofan, et al.
Published: (2024)
by: Jiang, Aofan, et al.
Published: (2024)
SciLT: Long-tailed Image Classification under Scientific Image Domains
by: Chen, Jiahao, et al.
Published: (2026)
by: Chen, Jiahao, et al.
Published: (2026)
LoFT: Parameter-Efficient Fine-Tuning for Long-tailed Semi-Supervised Learning in Open-World Scenarios
by: Huang, Zhiyuan, et al.
Published: (2025)
by: Huang, Zhiyuan, et al.
Published: (2025)
Visual Text Meets Low-level Vision: A Comprehensive Survey on Visual Text Processing
by: Shu, Yan, et al.
Published: (2024)
by: Shu, Yan, et al.
Published: (2024)
Aggregated Text Transformer for Scene Text Detection
by: Zhou, Zhao, et al.
Published: (2022)
by: Zhou, Zhao, et al.
Published: (2022)
Beyond Detection: A Structure-Aware Framework for Scene Text Tracking
by: Yu, Chenmin, et al.
Published: (2026)
by: Yu, Chenmin, et al.
Published: (2026)
Coffee: Controllable Diffusion Fine-tuning
by: Zeng, Ziyao, et al.
Published: (2025)
by: Zeng, Ziyao, et al.
Published: (2025)
Toward Real Text Manipulation Detection: New Dataset and New Solution
by: Luo, Dongliang, et al.
Published: (2023)
by: Luo, Dongliang, et al.
Published: (2023)
The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation
by: Gao, Bingjie, et al.
Published: (2025)
by: Gao, Bingjie, et al.
Published: (2025)
LET-US: Long Event-Text Understanding of Scenes
by: Chen, Rui, et al.
Published: (2025)
by: Chen, Rui, et al.
Published: (2025)
SeaS: Few-shot Industrial Anomaly Image Generation with Separation and Sharing Fine-tuning
by: Dai, Zhewei, et al.
Published: (2024)
by: Dai, Zhewei, et al.
Published: (2024)
Recognition-Synergistic Scene Text Editing
by: Fang, Zhengyao, et al.
Published: (2025)
by: Fang, Zhengyao, et al.
Published: (2025)
Masked Next-Scale Prediction for Self-supervised Scene Text Recognition
by: Chen, Zhuohao, et al.
Published: (2026)
by: Chen, Zhuohao, et al.
Published: (2026)
HUGS: Holistic Urban 3D Scene Understanding via Gaussian Splatting
by: Zhou, Hongyu, et al.
Published: (2024)
by: Zhou, Hongyu, et al.
Published: (2024)
PerpetualWonder: Long-Horizon Action-Conditioned 4D Scene Generation
by: Zhan, Jiahao, et al.
Published: (2026)
by: Zhan, Jiahao, et al.
Published: (2026)
DiffuseKronA: A Parameter Efficient Fine-tuning Method for Personalized Diffusion Models
by: Marjit, Shyam, et al.
Published: (2024)
by: Marjit, Shyam, et al.
Published: (2024)
MONICA: Benchmarking on Long-tailed Medical Image Classification
by: Ju, Lie, et al.
Published: (2024)
by: Ju, Lie, et al.
Published: (2024)
Char-SAM: Turning Segment Anything Model into Scene Text Segmentation Annotator with Character-level Visual Prompts
by: Xie, Enze, et al.
Published: (2024)
by: Xie, Enze, et al.
Published: (2024)
The Devil is in the Distributions: Explicit Modeling of Scene Content is Key in Zero-Shot Video Captioning
by: Tian, Mingkai, et al.
Published: (2025)
by: Tian, Mingkai, et al.
Published: (2025)
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering
by: Maryam, Hiba, et al.
Published: (2024)
by: Maryam, Hiba, et al.
Published: (2024)
KhmerST: A Low-Resource Khmer Scene Text Detection and Recognition Benchmark
by: Nom, Vannkinh, et al.
Published: (2024)
by: Nom, Vannkinh, et al.
Published: (2024)
Unveiling Perceptual Artifacts: A Fine-Grained Benchmark for Interpretable AI-Generated Image Detection
by: Xiao, Yao, et al.
Published: (2026)
by: Xiao, Yao, et al.
Published: (2026)
MVSFormer++: Revealing the Devil in Transformer's Details for Multi-View Stereo
by: Cao, Chenjie, et al.
Published: (2024)
by: Cao, Chenjie, et al.
Published: (2024)
TASeg: Text-aware RGB-T Semantic Segmentation based on Fine-tuning Vision Foundation Models
by: Yu, Meng, et al.
Published: (2025)
by: Yu, Meng, et al.
Published: (2025)
Beyond Flat Text: Dual Self-inherited Guidance for Visual Text Generation
by: Luo, Minxing, et al.
Published: (2025)
by: Luo, Minxing, et al.
Published: (2025)
Frequency-based Matcher for Long-tailed Semantic Segmentation
by: Li, Shan, et al.
Published: (2024)
by: Li, Shan, et al.
Published: (2024)
Region Prompt Tuning: Fine-grained Scene Text Detection Utilizing Region Text Prompt
by: Lin, Xingtao, et al.
Published: (2024)
by: Lin, Xingtao, et al.
Published: (2024)
Rethinking the Bias of Foundation Model under Long-tailed Distribution
by: Chen, Jiahao, et al.
Published: (2025)
by: Chen, Jiahao, et al.
Published: (2025)
SAN: Structure-Aware Network for Complex and Long-tailed Chinese Text Recognition
by: Zhang, Junyi, et al.
Published: (2024)
by: Zhang, Junyi, et al.
Published: (2024)
Fine-Tuning Impairs the Balancedness of Foundation Models in Long-tailed Personalized Federated Learning
by: Hou, Shihao, et al.
Published: (2026)
by: Hou, Shihao, et al.
Published: (2026)
Similar Items
-
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
by: Lyu, Jiahao, et al.
Published: (2024) -
TextCtrl: Diffusion-based Scene Text Editing with Prior Guidance Control
by: Zeng, Weichao, et al.
Published: (2024) -
First Creating Backgrounds Then Rendering Texts: A New Paradigm for Visual Text Blending
by: Li, Zhenhang, et al.
Published: (2024) -
Arbitrary Reading Order Scene Text Spotter with Local Semantics Guidance
by: Lyu, Jiahao, et al.
Published: (2024) -
Semantic-guided Fine-tuning of Foundation Model for Long-tailed Visual Recognition
by: Peng, Yufei, et al.
Published: (2025)