TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Hanshen, Liu, Yuliang, Wu, Xuecheng, Wang, An-Lan, Feng, Hao, Yang, Dingkang, Feng, Chao, Huang, Can, Tang, Jingqun, Bai, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SemiETS: Integrating Spatial and Content Consistencies for Semi-Supervised End-to-end Text Spotting
di: Luo, Dongliang, et al.
Pubblicazione: (2025)
di: Luo, Dongliang, et al.
Pubblicazione: (2025)
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
di: Shan, Bin, et al.
Pubblicazione: (2024)
di: Shan, Bin, et al.
Pubblicazione: (2024)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
Harmonizing Visual Text Comprehension and Generation
di: Zhao, Zhen, et al.
Pubblicazione: (2024)
di: Zhao, Zhen, et al.
Pubblicazione: (2024)
Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
di: Feng, Hao, et al.
Pubblicazione: (2026)
di: Feng, Hao, et al.
Pubblicazione: (2026)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
di: Xue, Wei, et al.
Pubblicazione: (2026)
di: Xue, Wei, et al.
Pubblicazione: (2026)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
di: Fu, Ling, et al.
Pubblicazione: (2024)
di: Fu, Ling, et al.
Pubblicazione: (2024)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
di: Wang, An-Lan, et al.
Pubblicazione: (2025)
di: Wang, An-Lan, et al.
Pubblicazione: (2025)
TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards
di: Cui, Mingxuan, et al.
Pubblicazione: (2026)
di: Cui, Mingxuan, et al.
Pubblicazione: (2026)
Training-free Geometric Image Editing on Diffusion Models
di: Zhu, Hanshen, et al.
Pubblicazione: (2025)
di: Zhu, Hanshen, et al.
Pubblicazione: (2025)
Pecker: Bug Localization Framework for Sequential Designs via Causal Chain Reconstruction
di: Tang, Jiaping, et al.
Pubblicazione: (2026)
di: Tang, Jiaping, et al.
Pubblicazione: (2026)
Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
TERGAD: Structure-Aware Text-Enhanced Representations for Graph Anomaly Detection
di: Shi, Wen, et al.
Pubblicazione: (2026)
di: Shi, Wen, et al.
Pubblicazione: (2026)
RepText: Rendering Visual Text via Replicating
di: Wang, Haofan, et al.
Pubblicazione: (2025)
di: Wang, Haofan, et al.
Pubblicazione: (2025)
Advancing Sequential Numerical Prediction in Autoregressive Models
di: Fei, Xiang, et al.
Pubblicazione: (2025)
di: Fei, Xiang, et al.
Pubblicazione: (2025)
Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
Multi-modal In-Context Learning Makes an Ego-evolving Scene Text Recognizer
di: Zhao, Zhen, et al.
Pubblicazione: (2023)
di: Zhao, Zhen, et al.
Pubblicazione: (2023)
Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control
di: Han, Minghao, et al.
Pubblicazione: (2025)
di: Han, Minghao, et al.
Pubblicazione: (2025)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models
di: Sun, Zhengyang, et al.
Pubblicazione: (2026)
di: Sun, Zhengyang, et al.
Pubblicazione: (2026)
VimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-domain Generalization
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
di: Lu, Jinghui, et al.
Pubblicazione: (2024)
di: Lu, Jinghui, et al.
Pubblicazione: (2024)
Bridging the Gap Between End-to-End and Two-Step Text Spotting
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
di: Feng, Hao, et al.
Pubblicazione: (2023)
di: Feng, Hao, et al.
Pubblicazione: (2023)
Text-ADBench: Text Anomaly Detection Benchmark based on LLMs Embedding
di: Xiao, Feng, et al.
Pubblicazione: (2025)
di: Xiao, Feng, et al.
Pubblicazione: (2025)
More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
di: Lin, Hongkai, et al.
Pubblicazione: (2025)
di: Lin, Hongkai, et al.
Pubblicazione: (2025)
Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
di: Liu, Zeyu, et al.
Pubblicazione: (2024)
di: Liu, Zeyu, et al.
Pubblicazione: (2024)
Progressive Evolution from Single-Point to Polygon for Scene Text
di: Deng, Linger, et al.
Pubblicazione: (2023)
di: Deng, Linger, et al.
Pubblicazione: (2023)
MoE Jetpack: From Dense Checkpoints to Adaptive Mixture of Experts for Vision Tasks
di: Zhu, Xingkui, et al.
Pubblicazione: (2024)
di: Zhu, Xingkui, et al.
Pubblicazione: (2024)
Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering
di: Wang, Xu, et al.
Pubblicazione: (2025)
di: Wang, Xu, et al.
Pubblicazione: (2025)
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering
di: Maryam, Hiba, et al.
Pubblicazione: (2024)
di: Maryam, Hiba, et al.
Pubblicazione: (2024)
ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations
di: Jiang, Bowen, et al.
Pubblicazione: (2025)
di: Jiang, Bowen, et al.
Pubblicazione: (2025)
Ragged Blocks: Rendering Structured Text with Style
di: Cohen, Sam, et al.
Pubblicazione: (2025)
di: Cohen, Sam, et al.
Pubblicazione: (2025)
AMO Sampler: Enhancing Text Rendering with Overshooting
di: Hu, Xixi, et al.
Pubblicazione: (2024)
di: Hu, Xixi, et al.
Pubblicazione: (2024)
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
Enhancing Weakly Supervised Multimodal Video Anomaly Detection through Text Guidance
di: Sun, Shengyang, et al.
Pubblicazione: (2026)
di: Sun, Shengyang, et al.
Pubblicazione: (2026)
The First Swahili Language Scene Text Detection and Recognition Dataset
di: Douamba, Fadila Wendigoundi, et al.
Pubblicazione: (2024)
di: Douamba, Fadila Wendigoundi, et al.
Pubblicazione: (2024)
MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
di: Yin, Liang, et al.
Pubblicazione: (2025)
di: Yin, Liang, et al.
Pubblicazione: (2025)
First Creating Backgrounds Then Rendering Texts: A New Paradigm for Visual Text Blending
di: Li, Zhenhang, et al.
Pubblicazione: (2024)
di: Li, Zhenhang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SemiETS: Integrating Spatial and Content Consistencies for Semi-Supervised End-to-end Text Spotting
di: Luo, Dongliang, et al.
Pubblicazione: (2025) -
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
di: Shan, Bin, et al.
Pubblicazione: (2024) -
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
di: Tang, Jingqun, et al.
Pubblicazione: (2024) -
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
di: Tang, Jingqun, et al.
Pubblicazione: (2024) -
Harmonizing Visual Text Comprehension and Generation
di: Zhao, Zhen, et al.
Pubblicazione: (2024)