TextSculptor: Training and Benchmarking Scene Text Editing
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Yiheng, Jiao, Siyu, Lan, Xiaohan, Zhou, Wei, She, Qi, Yu, Fei, Chen, Heyun, Wang, Zhengwei, Chen, Jinghuan, Li, Moran, Yu, Yingchen, Feng, Zijian, Zhao, Yao, Wei, Yunchao, Zhong, Yujie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ThinkGen: Generalized Thinking for Visual Generation
por: Jiao, Siyu, et al.
Publicado: (2025)
por: Jiao, Siyu, et al.
Publicado: (2025)
Let ViT Speak: Generative Language-Image Pre-training
por: Fang, Yan, et al.
Publicado: (2026)
por: Fang, Yan, et al.
Publicado: (2026)
Flux-Sculptor: Text-Driven Rich-Attribute Portrait Editing through Decomposed Spatial Flow Control
por: He, Tianyao, et al.
Publicado: (2025)
por: He, Tianyao, et al.
Publicado: (2025)
Collaborative Vision-Text Representation Optimizing for Open-Vocabulary Segmentation
por: Jiao, Siyu, et al.
Publicado: (2024)
por: Jiao, Siyu, et al.
Publicado: (2024)
Collaborative Feature-Logits Contrastive Learning for Open-Set Semi-Supervised Object Detection
por: Zhong, Xinhao, et al.
Publicado: (2024)
por: Zhong, Xinhao, et al.
Publicado: (2024)
M4V: Multi-Modal Mamba for Text-to-Video Generation
por: Huang, Jiancheng, et al.
Publicado: (2025)
por: Huang, Jiancheng, et al.
Publicado: (2025)
Recognition-Synergistic Scene Text Editing
por: Fang, Zhengyao, et al.
Publicado: (2025)
por: Fang, Zhengyao, et al.
Publicado: (2025)
PromptSculptor: Multi-Agent Based Text-to-Image Prompt Optimization
por: Xiang, Dawei, et al.
Publicado: (2025)
por: Xiang, Dawei, et al.
Publicado: (2025)
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
por: Shan, Bin, et al.
Publicado: (2024)
por: Shan, Bin, et al.
Publicado: (2024)
TextCtrl: Diffusion-based Scene Text Editing with Prior Guidance Control
por: Zeng, Weichao, et al.
Publicado: (2024)
por: Zeng, Weichao, et al.
Publicado: (2024)
Global-Local Aware Scene Text Editing
por: Yang, Fuxiang, et al.
Publicado: (2025)
por: Yang, Fuxiang, et al.
Publicado: (2025)
FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing
por: Lan, Rui, et al.
Publicado: (2025)
por: Lan, Rui, et al.
Publicado: (2025)
TIGER: Text-Instructed 3D Gaussian Retrieval and Coherent Editing
por: Xu, Teng, et al.
Publicado: (2024)
por: Xu, Teng, et al.
Publicado: (2024)
DreamLCM: Towards High-Quality Text-to-3D Generation via Latent Consistency Model
por: Zhong, Yiming, et al.
Publicado: (2024)
por: Zhong, Yiming, et al.
Publicado: (2024)
Arbitrary Reading Order Scene Text Spotter with Local Semantics Guidance
por: Lyu, Jiahao, et al.
Publicado: (2024)
por: Lyu, Jiahao, et al.
Publicado: (2024)
From Words to Structured Visuals: A Benchmark and Framework for Text-to-Diagram Generation and Editing
por: Wei, Jingxuan, et al.
Publicado: (2024)
por: Wei, Jingxuan, et al.
Publicado: (2024)
LatentEditor: Text Driven Local Editing of 3D Scenes
por: Khalid, Umar, et al.
Publicado: (2023)
por: Khalid, Umar, et al.
Publicado: (2023)
StyleTextGen: Style-Conditioned Multilingual Scene Text Generation
por: Chen, Zeyu, et al.
Publicado: (2026)
por: Chen, Zeyu, et al.
Publicado: (2026)
Decoder Pre-Training with only Text for Scene Text Recognition
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
Free-Editor: Zero-shot Text-driven 3D Scene Editing
por: Karim, Nazmul, et al.
Publicado: (2023)
por: Karim, Nazmul, et al.
Publicado: (2023)
TiP4GEN: Text to Immersive Panorama 4D Scene Generation
por: Xing, Ke, et al.
Publicado: (2025)
por: Xing, Ke, et al.
Publicado: (2025)
Towards Training-Free Scene Text Editing
por: Li, Yubo, et al.
Publicado: (2026)
por: Li, Yubo, et al.
Publicado: (2026)
Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
por: Lan, Mengcheng, et al.
Publicado: (2025)
por: Lan, Mengcheng, et al.
Publicado: (2025)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
por: Zhong, Yangyang, et al.
Publicado: (2025)
por: Zhong, Yangyang, et al.
Publicado: (2025)
GaussEdit: Adaptive 3D Scene Editing with Text and Image Prompts
por: Shu, Zhenyu, et al.
Publicado: (2025)
por: Shu, Zhenyu, et al.
Publicado: (2025)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
por: Wang, Jiarui, et al.
Publicado: (2025)
por: Wang, Jiarui, et al.
Publicado: (2025)
Instruction-Guided Scene Text Recognition
por: Du, Yongkun, et al.
Publicado: (2024)
por: Du, Yongkun, et al.
Publicado: (2024)
LET-US: Long Event-Text Understanding of Scenes
por: Chen, Rui, et al.
Publicado: (2025)
por: Chen, Rui, et al.
Publicado: (2025)
SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design
por: Yu, Yunjie, et al.
Publicado: (2025)
por: Yu, Yunjie, et al.
Publicado: (2025)
TripleFDS: Triple Feature Disentanglement and Synthesis for Scene Text Editing
por: Bao, Yuchen, et al.
Publicado: (2025)
por: Bao, Yuchen, et al.
Publicado: (2025)
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
por: Lyu, Jiahao, et al.
Publicado: (2024)
por: Lyu, Jiahao, et al.
Publicado: (2024)
Debiasing Text-to-Image Diffusion Models
por: He, Ruifei, et al.
Publicado: (2024)
por: He, Ruifei, et al.
Publicado: (2024)
Masked and Permuted Implicit Context Learning for Scene Text Recognition
por: Yang, Xiaomeng, et al.
Publicado: (2023)
por: Yang, Xiaomeng, et al.
Publicado: (2023)
Beyond Detection: A Structure-Aware Framework for Scene Text Tracking
por: Yu, Chenmin, et al.
Publicado: (2026)
por: Yu, Chenmin, et al.
Publicado: (2026)
TextMastero: Mastering High-Quality Scene Text Editing in Diverse Languages and Styles
por: Wang, Tong, et al.
Publicado: (2024)
por: Wang, Tong, et al.
Publicado: (2024)
Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes
por: Lv, Feng, et al.
Publicado: (2025)
por: Lv, Feng, et al.
Publicado: (2025)
Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning
por: Zhang, Zijian, et al.
Publicado: (2024)
por: Zhang, Zijian, et al.
Publicado: (2024)
TIE: Revolutionizing Text-based Image Editing for Complex-Prompt Following and High-Fidelity Editing
por: Zhang, Xinyu, et al.
Publicado: (2024)
por: Zhang, Xinyu, et al.
Publicado: (2024)
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
por: Duan, Chen, et al.
Publicado: (2024)
por: Duan, Chen, et al.
Publicado: (2024)
Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning
por: Su, DiJia, et al.
Publicado: (2025)
por: Su, DiJia, et al.
Publicado: (2025)
Ejemplares similares
-
ThinkGen: Generalized Thinking for Visual Generation
por: Jiao, Siyu, et al.
Publicado: (2025) -
Let ViT Speak: Generative Language-Image Pre-training
por: Fang, Yan, et al.
Publicado: (2026) -
Flux-Sculptor: Text-Driven Rich-Attribute Portrait Editing through Decomposed Spatial Flow Control
por: He, Tianyao, et al.
Publicado: (2025) -
Collaborative Vision-Text Representation Optimizing for Open-Vocabulary Segmentation
por: Jiao, Siyu, et al.
Publicado: (2024) -
Collaborative Feature-Logits Contrastive Learning for Open-Set Semi-Supervised Object Detection
por: Zhong, Xinhao, et al.
Publicado: (2024)