Recognition-Synergistic Scene Text Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fang, Zhengyao, Lyu, Pengyuan, Wu, Jingjing, Zhang, Chengquan, Yu, Jun, Lu, Guangming, Pei, Wenjie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
par: Fang, Zhengyao, et autres
Publié: (2026)
par: Fang, Zhengyao, et autres
Publié: (2026)
WeCromCL: Weakly Supervised Cross-Modality Contrastive Learning for Transcription-only Supervised Text Spotting
par: Wu, Jingjing, et autres
Publié: (2024)
par: Wu, Jingjing, et autres
Publié: (2024)
EditInfinity: Image Editing with Binary-Quantized Generative Models
par: Wang, Jiahuan, et autres
Publié: (2025)
par: Wang, Jiahuan, et autres
Publié: (2025)
Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity
par: Fang, Zhengyao, et autres
Publié: (2026)
par: Fang, Zhengyao, et autres
Publié: (2026)
D$^2$ST-Adapter: Disentangled-and-Deformable Spatio-Temporal Adapter for Few-shot Action Recognition
par: Pei, Wenjie, et autres
Publié: (2023)
par: Pei, Wenjie, et autres
Publié: (2023)
UniVoxel: Fast Inverse Rendering by Unified Voxelization of Scene Representation
par: Wu, Shuang, et autres
Publié: (2024)
par: Wu, Shuang, et autres
Publié: (2024)
Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
par: Li, Gengluo, et autres
Publié: (2026)
par: Li, Gengluo, et autres
Publié: (2026)
Video-ToC: Video Tree-of-Cue Reasoning
par: Tan, Qizhong, et autres
Publié: (2026)
par: Tan, Qizhong, et autres
Publié: (2026)
Towards Unified Multi-granularity Text Detection with Interactive Attention
par: Wan, Xingyu, et autres
Publié: (2024)
par: Wan, Xingyu, et autres
Publié: (2024)
DiffTrans: Differentiable Geometry-Materials Decomposition for Reconstructing Transparent Objects
par: Li, Changpu, et autres
Publié: (2026)
par: Li, Changpu, et autres
Publié: (2026)
StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond
par: Lyu, Pengyuan, et autres
Publié: (2024)
par: Lyu, Pengyuan, et autres
Publié: (2024)
Beyond Heuristics: Learnable Density Control for 3D Gaussian Splatting
par: Ning, Zhenhua, et autres
Publié: (2026)
par: Ning, Zhenhua, et autres
Publié: (2026)
TextSculptor: Training and Benchmarking Scene Text Editing
par: Lin, Yiheng, et autres
Publié: (2026)
par: Lin, Yiheng, et autres
Publié: (2026)
MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation
par: Li, Gengluo, et autres
Publié: (2026)
par: Li, Gengluo, et autres
Publié: (2026)
Choose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing
par: Zhang, Boqiang, et autres
Publié: (2024)
par: Zhang, Boqiang, et autres
Publié: (2024)
Towards Training-Free Scene Text Editing
par: Li, Yubo, et autres
Publié: (2026)
par: Li, Yubo, et autres
Publié: (2026)
Global-Local Aware Scene Text Editing
par: Yang, Fuxiang, et autres
Publié: (2025)
par: Yang, Fuxiang, et autres
Publié: (2025)
Learning Compatible Multi-Prize Subnetworks for Asymmetric Retrieval
par: Sun, Yushuai, et autres
Publié: (2025)
par: Sun, Yushuai, et autres
Publié: (2025)
Instruction-Guided Scene Text Recognition
par: Du, Yongkun, et autres
Publié: (2024)
par: Du, Yongkun, et autres
Publié: (2024)
DreamScene: 3D Gaussian-based Text-to-3D Scene Generation via Formation Pattern Sampling
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
TextCtrl: Diffusion-based Scene Text Editing with Prior Guidance Control
par: Zeng, Weichao, et autres
Publié: (2024)
par: Zeng, Weichao, et autres
Publié: (2024)
Global-Local Stepwise Generative Network for Ultra High-Resolution Image Restoration
par: Feng, Xin, et autres
Publié: (2022)
par: Feng, Xin, et autres
Publié: (2022)
Domain-Rectifying Adapter for Cross-Domain Few-Shot Segmentation
par: Su, Jiapeng, et autres
Publié: (2024)
par: Su, Jiapeng, et autres
Publié: (2024)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
par: Wen, Junwei, et autres
Publié: (2026)
par: Wen, Junwei, et autres
Publié: (2026)
Decoder Pre-Training with only Text for Scene Text Recognition
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Doubly Abductive Counterfactual Inference for Text-based Image Editing
par: Song, Xue, et autres
Publié: (2024)
par: Song, Xue, et autres
Publié: (2024)
CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition
par: Zheng, Jinzhi, et autres
Publié: (2024)
par: Zheng, Jinzhi, et autres
Publié: (2024)
Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes
par: Lv, Feng, et autres
Publié: (2025)
par: Lv, Feng, et autres
Publié: (2025)
Masked Next-Scale Prediction for Self-supervised Scene Text Recognition
par: Chen, Zhuohao, et autres
Publié: (2026)
par: Chen, Zhuohao, et autres
Publié: (2026)
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
par: Wang, Tong, et autres
Publié: (2025)
par: Wang, Tong, et autres
Publié: (2025)
Masked and Permuted Implicit Context Learning for Scene Text Recognition
par: Yang, Xiaomeng, et autres
Publié: (2023)
par: Yang, Xiaomeng, et autres
Publié: (2023)
IPAD: Iterative, Parallel, and Diffusion-based Network for Scene Text Recognition
par: Yang, Xiaomeng, et autres
Publié: (2023)
par: Yang, Xiaomeng, et autres
Publié: (2023)
TEACH: Text Encoding as Curriculum Hints for Scene Text Recognition
par: Yang, Xiahan, et autres
Publié: (2025)
par: Yang, Xiahan, et autres
Publié: (2025)
Chat-Edit-3D: Interactive 3D Scene Editing via Text Prompts
par: Fang, Shuangkang, et autres
Publié: (2024)
par: Fang, Shuangkang, et autres
Publié: (2024)
What Is Wrong with Synthetic Data for Scene Text Recognition? A Strong Synthetic Engine with Diverse Simulations and Self-Evolution
par: Ye, Xingsong, et autres
Publié: (2026)
par: Ye, Xingsong, et autres
Publié: (2026)
Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition
par: Zhang, Yifei, et autres
Publié: (2025)
par: Zhang, Yifei, et autres
Publié: (2025)
FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing
par: Lan, Rui, et autres
Publié: (2025)
par: Lan, Rui, et autres
Publié: (2025)
TextMastero: Mastering High-Quality Scene Text Editing in Diverse Languages and Styles
par: Wang, Tong, et autres
Publié: (2024)
par: Wang, Tong, et autres
Publié: (2024)
Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning
par: Li, Hongxi, et autres
Publié: (2026)
par: Li, Hongxi, et autres
Publié: (2026)
Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition
par: Lin, Tiancheng, et autres
Publié: (2024)
par: Lin, Tiancheng, et autres
Publié: (2024)
Documents similaires
-
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
par: Fang, Zhengyao, et autres
Publié: (2026) -
WeCromCL: Weakly Supervised Cross-Modality Contrastive Learning for Transcription-only Supervised Text Spotting
par: Wu, Jingjing, et autres
Publié: (2024) -
EditInfinity: Image Editing with Binary-Quantized Generative Models
par: Wang, Jiahuan, et autres
Publié: (2025) -
Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity
par: Fang, Zhengyao, et autres
Publié: (2026) -
D$^2$ST-Adapter: Disentangled-and-Deformable Spatio-Temporal Adapter for Few-shot Action Recognition
par: Pei, Wenjie, et autres
Publié: (2023)