Towards Training-Free Scene Text Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yubo, Qin, Xugong, Zhang, Peng, Lin, Hailun, Zeng, Gangyan, Zhang, Kexin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark
di: Guo, Hao, et al.
Pubblicazione: (2025)
di: Guo, Hao, et al.
Pubblicazione: (2025)
Focus, Distinguish, and Prompt: Unleashing CLIP for Efficient and Flexible Scene Text Retrieval
di: Zeng, Gangyan, et al.
Pubblicazione: (2024)
di: Zeng, Gangyan, et al.
Pubblicazione: (2024)
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
di: Lyu, Jiahao, et al.
Pubblicazione: (2024)
di: Lyu, Jiahao, et al.
Pubblicazione: (2024)
Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
di: Li, Gengluo, et al.
Pubblicazione: (2026)
di: Li, Gengluo, et al.
Pubblicazione: (2026)
TextSculptor: Training and Benchmarking Scene Text Editing
di: Lin, Yiheng, et al.
Pubblicazione: (2026)
di: Lin, Yiheng, et al.
Pubblicazione: (2026)
Towards a Training Free Approach for 3D Scene Editing
di: Madhavaram, Vivek, et al.
Pubblicazione: (2024)
di: Madhavaram, Vivek, et al.
Pubblicazione: (2024)
Edit Fidelity Field: Semantics-Aware Region Isolation for Training-Free Scene Text Editing
di: Li, Guandong, et al.
Pubblicazione: (2026)
di: Li, Guandong, et al.
Pubblicazione: (2026)
When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing
di: Li, Guangzhao, et al.
Pubblicazione: (2025)
di: Li, Guangzhao, et al.
Pubblicazione: (2025)
Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues
di: Zhang, Yan, et al.
Pubblicazione: (2024)
di: Zhang, Yan, et al.
Pubblicazione: (2024)
TextCtrl: Diffusion-based Scene Text Editing with Prior Guidance Control
di: Zeng, Weichao, et al.
Pubblicazione: (2024)
di: Zeng, Weichao, et al.
Pubblicazione: (2024)
Recognition-Synergistic Scene Text Editing
di: Fang, Zhengyao, et al.
Pubblicazione: (2025)
di: Fang, Zhengyao, et al.
Pubblicazione: (2025)
Towards Generalized and Training-Free Text-Guided Semantic Manipulation
di: Hong, Yu, et al.
Pubblicazione: (2025)
di: Hong, Yu, et al.
Pubblicazione: (2025)
From Competition to Coopetition: Coopetitive Training-Free Image Editing Based on Text Guidance
di: Shen, Jinhao, et al.
Pubblicazione: (2026)
di: Shen, Jinhao, et al.
Pubblicazione: (2026)
Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes
di: Lv, Feng, et al.
Pubblicazione: (2025)
di: Lv, Feng, et al.
Pubblicazione: (2025)
Reversible Inversion for Training-Free Exemplar-guided Image Editing
di: Li, Yuke, et al.
Pubblicazione: (2025)
di: Li, Yuke, et al.
Pubblicazione: (2025)
Free-Editor: Zero-shot Text-driven 3D Scene Editing
di: Karim, Nazmul, et al.
Pubblicazione: (2023)
di: Karim, Nazmul, et al.
Pubblicazione: (2023)
FreeSim: Toward Free-viewpoint Camera Simulation in Driving Scenes
di: Fan, Lue, et al.
Pubblicazione: (2024)
di: Fan, Lue, et al.
Pubblicazione: (2024)
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
Towards 3D Object-Centric Feature Learning for Semantic Scene Completion
di: Wang, Weihua, et al.
Pubblicazione: (2025)
di: Wang, Weihua, et al.
Pubblicazione: (2025)
SyncNoise: Geometrically Consistent Noise Prediction for Text-based 3D Scene Editing
di: Li, Ruihuang, et al.
Pubblicazione: (2024)
di: Li, Ruihuang, et al.
Pubblicazione: (2024)
Global-Local Aware Scene Text Editing
di: Yang, Fuxiang, et al.
Pubblicazione: (2025)
di: Yang, Fuxiang, et al.
Pubblicazione: (2025)
SpecEdit: Training-Free Acceleration for Diffusion based Image Editing via Semantic Locking
di: Yan, Zhengan, et al.
Pubblicazione: (2026)
di: Yan, Zhengan, et al.
Pubblicazione: (2026)
OphEdit: Training-Free Text-Guided Editing of Ophthalmic Surgical Videos
di: Jangir, Ritul, et al.
Pubblicazione: (2026)
di: Jangir, Ritul, et al.
Pubblicazione: (2026)
LOVECon: Text-driven Training-Free Long Video Editing with ControlNet
di: Liao, Zhenyi, et al.
Pubblicazione: (2023)
di: Liao, Zhenyi, et al.
Pubblicazione: (2023)
$\text{PKS}^4$:Parallel Kinematic Selective State Space Scanners for Efficient Video Understanding
di: Zeng, Lingjie, et al.
Pubblicazione: (2026)
di: Zeng, Lingjie, et al.
Pubblicazione: (2026)
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
di: Zhang, Yan, et al.
Pubblicazione: (2025)
di: Zhang, Yan, et al.
Pubblicazione: (2025)
Training-Free Hierarchical Scene Understanding for Gaussian Splatting with Superpoint Graphs
di: Dai, Shaohui, et al.
Pubblicazione: (2025)
di: Dai, Shaohui, et al.
Pubblicazione: (2025)
Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
di: Lee, Dong In, et al.
Pubblicazione: (2025)
di: Lee, Dong In, et al.
Pubblicazione: (2025)
FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing
di: Lan, Rui, et al.
Pubblicazione: (2025)
di: Lan, Rui, et al.
Pubblicazione: (2025)
Training-Free Text-Guided Image Editing with Visual Autoregressive Model
di: Wang, Yufei, et al.
Pubblicazione: (2025)
di: Wang, Yufei, et al.
Pubblicazione: (2025)
Training-Free Image Editing with Visual Context Integration and Concept Alignment
di: Song, Rui, et al.
Pubblicazione: (2026)
di: Song, Rui, et al.
Pubblicazione: (2026)
Training-Free Disentangled Text-Guided Image Editing via Sparse Latent Constraints
di: Shabrina, Mutiara, et al.
Pubblicazione: (2025)
di: Shabrina, Mutiara, et al.
Pubblicazione: (2025)
Choose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing
di: Zhang, Boqiang, et al.
Pubblicazione: (2024)
di: Zhang, Boqiang, et al.
Pubblicazione: (2024)
FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
di: Chen, Shijie, et al.
Pubblicazione: (2025)
di: Chen, Shijie, et al.
Pubblicazione: (2025)
KV-Edit: Training-Free Image Editing for Precise Background Preservation
di: Zhu, Tianrui, et al.
Pubblicazione: (2025)
di: Zhu, Tianrui, et al.
Pubblicazione: (2025)
TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis
di: Xie, Yu, et al.
Pubblicazione: (2025)
di: Xie, Yu, et al.
Pubblicazione: (2025)
PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models
di: He, Qingdong, et al.
Pubblicazione: (2024)
di: He, Qingdong, et al.
Pubblicazione: (2024)
A Lightweight Context-Driven Training-Free Network for Scene Text Segmentation and Recognition
di: Chakraborty, Ritabrata, et al.
Pubblicazione: (2025)
di: Chakraborty, Ritabrata, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark
di: Guo, Hao, et al.
Pubblicazione: (2025) -
Focus, Distinguish, and Prompt: Unleashing CLIP for Efficient and Flexible Scene Text Retrieval
di: Zeng, Gangyan, et al.
Pubblicazione: (2024) -
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
di: Lyu, Jiahao, et al.
Pubblicazione: (2024) -
Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
di: Li, Gengluo, et al.
Pubblicazione: (2026) -
TextSculptor: Training and Benchmarking Scene Text Editing
di: Lin, Yiheng, et al.
Pubblicazione: (2026)