AnyText: Multilingual Visual Text Generation And Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Tuo, Yuxiang, Xiang, Wangmeng, He, Jun-Yan, Geng, Yifeng, Xie, Xuansong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AnyText2: Visual Text Generation and Editing With Customizable Attributes
di: Tuo, Yuxiang, et al.
Pubblicazione: (2024)
di: Tuo, Yuxiang, et al.
Pubblicazione: (2024)
AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation
di: He, Junjie, et al.
Pubblicazione: (2025)
di: He, Junjie, et al.
Pubblicazione: (2025)
VirtualModel: Generating Object-ID-retentive Human-object Interaction Image by Diffusion Model for E-commerce Marketing
di: Chen, Binghui, et al.
Pubblicazione: (2024)
di: Chen, Binghui, et al.
Pubblicazione: (2024)
AnyTrans: Translate AnyText in the Image with Large Scale Models
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
ShoeModel: Learning to Wear on the User-specified Shoes via Diffusion Model
di: Chen, Binghui, et al.
Pubblicazione: (2024)
di: Chen, Binghui, et al.
Pubblicazione: (2024)
VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models
di: Zhang, Yabo, et al.
Pubblicazione: (2024)
di: Zhang, Yabo, et al.
Pubblicazione: (2024)
Refined Temporal Pyramidal Compression-and-Amplification Transformer for 3D Human Pose Estimation
di: Liu, Hanbing, et al.
Pubblicazione: (2023)
di: Liu, Hanbing, et al.
Pubblicazione: (2023)
SmartControl: Enhancing ControlNet for Handling Rough Visual Conditions
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
ACE: Anti-Editing Concept Erasure in Text-to-Image Models
di: Wang, Zihao, et al.
Pubblicazione: (2025)
di: Wang, Zihao, et al.
Pubblicazione: (2025)
Overcoming Topology Agnosticism: Enhancing Skeleton-Based Action Recognition through Redefined Skeletal Topology Awareness
di: Zhou, Yuxuan, et al.
Pubblicazione: (2023)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2023)
DreamView: Injecting View-specific Text Guidance into Text-to-3D Generation
di: Yan, Junkai, et al.
Pubblicazione: (2024)
di: Yan, Junkai, et al.
Pubblicazione: (2024)
How Control Information Influences Multilingual Text Image Generation and Editing?
di: Zhang, Boqiang, et al.
Pubblicazione: (2024)
di: Zhang, Boqiang, et al.
Pubblicazione: (2024)
Strictly-ID-Preserved and Controllable Accessory Advertising Image Generation
di: Xue, Youze, et al.
Pubblicazione: (2024)
di: Xue, Youze, et al.
Pubblicazione: (2024)
MasterWeaver: Taming Editability and Face Identity for Personalized Text-to-Image Generation
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
Tracking with Human-Intent Reasoning
di: Zhu, Jiawen, et al.
Pubblicazione: (2023)
di: Zhu, Jiawen, et al.
Pubblicazione: (2023)
DiffusionGAN3D: Boosting Text-guided 3D Generation and Domain Adaptation by Combining 3D GANs and Diffusion Priors
di: Lei, Biwen, et al.
Pubblicazione: (2023)
di: Lei, Biwen, et al.
Pubblicazione: (2023)
Responsible Visual Editing
di: Ni, Minheng, et al.
Pubblicazione: (2024)
di: Ni, Minheng, et al.
Pubblicazione: (2024)
GAP: Gaussianize Any Point Clouds with Text Guidance
di: Zhang, Weiqi, et al.
Pubblicazione: (2025)
di: Zhang, Weiqi, et al.
Pubblicazione: (2025)
StyleTextGen: Style-Conditioned Multilingual Scene Text Generation
di: Chen, Zeyu, et al.
Pubblicazione: (2026)
di: Chen, Zeyu, et al.
Pubblicazione: (2026)
WordArt Designer API: User-Driven Artistic Typography Synthesis with Large Language Models on ModelScope
di: He, Jun-Yan, et al.
Pubblicazione: (2024)
di: He, Jun-Yan, et al.
Pubblicazione: (2024)
SceneVTG++: Controllable Multilingual Visual Text Generation in the Wild
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation
di: Wang, Zihao, et al.
Pubblicazione: (2026)
di: Wang, Zihao, et al.
Pubblicazione: (2026)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
di: Li, Xiaoming, et al.
Pubblicazione: (2025)
di: Li, Xiaoming, et al.
Pubblicazione: (2025)
JoyType: A Robust Design for Multilingual Visual Text Creation
di: Li, Chao, et al.
Pubblicazione: (2024)
di: Li, Chao, et al.
Pubblicazione: (2024)
Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception
di: He, Junwen, et al.
Pubblicazione: (2024)
di: He, Junwen, et al.
Pubblicazione: (2024)
Text-Animator: Controllable Visual Text Video Generation
di: Liu, Lin, et al.
Pubblicazione: (2024)
di: Liu, Lin, et al.
Pubblicazione: (2024)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
di: Ma, Lichen, et al.
Pubblicazione: (2026)
di: Ma, Lichen, et al.
Pubblicazione: (2026)
GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts
di: He, Junwen, et al.
Pubblicazione: (2024)
di: He, Junwen, et al.
Pubblicazione: (2024)
Temporal Consistency-Aware Text-to-Motion Generation
di: Wang, Hongsong, et al.
Pubblicazione: (2026)
di: Wang, Hongsong, et al.
Pubblicazione: (2026)
Investigating Text Insulation and Attention Mechanisms for Complex Visual Text Generation
di: Tai, Ying, et al.
Pubblicazione: (2025)
di: Tai, Ying, et al.
Pubblicazione: (2025)
Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation
di: Wang, Wenjing, et al.
Pubblicazione: (2023)
di: Wang, Wenjing, et al.
Pubblicazione: (2023)
Recognition-Synergistic Scene Text Editing
di: Fang, Zhengyao, et al.
Pubblicazione: (2025)
di: Fang, Zhengyao, et al.
Pubblicazione: (2025)
Bridging Geometry-Coherent Text-to-3D Generation with Multi-View Diffusion Priors and Gaussian Splatting
di: Yang, Feng, et al.
Pubblicazione: (2025)
di: Yang, Feng, et al.
Pubblicazione: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
di: Atuhurra, Jesse, et al.
Pubblicazione: (2024)
di: Atuhurra, Jesse, et al.
Pubblicazione: (2024)
Text to Image Generation and Editing: A Survey
di: Yang, Pengfei, et al.
Pubblicazione: (2025)
di: Yang, Pengfei, et al.
Pubblicazione: (2025)
Harmonizing Visual Text Comprehension and Generation
di: Zhao, Zhen, et al.
Pubblicazione: (2024)
di: Zhao, Zhen, et al.
Pubblicazione: (2024)
TextCtrl: Diffusion-based Scene Text Editing with Prior Guidance Control
di: Zeng, Weichao, et al.
Pubblicazione: (2024)
di: Zeng, Weichao, et al.
Pubblicazione: (2024)
TextField3D: Towards Enhancing Open-Vocabulary 3D Generation with Noisy Text Fields
di: Huang, Tianyu, et al.
Pubblicazione: (2023)
di: Huang, Tianyu, et al.
Pubblicazione: (2023)
Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes
di: Lv, Feng, et al.
Pubblicazione: (2025)
di: Lv, Feng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AnyText2: Visual Text Generation and Editing With Customizable Attributes
di: Tuo, Yuxiang, et al.
Pubblicazione: (2024) -
AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation
di: He, Junjie, et al.
Pubblicazione: (2025) -
VirtualModel: Generating Object-ID-retentive Human-object Interaction Image by Diffusion Model for E-commerce Marketing
di: Chen, Binghui, et al.
Pubblicazione: (2024) -
AnyTrans: Translate AnyText in the Image with Large Scale Models
di: Qian, Zhipeng, et al.
Pubblicazione: (2024) -
ShoeModel: Learning to Wear on the User-specified Shoes via Diffusion Model
di: Chen, Binghui, et al.
Pubblicazione: (2024)