JoyType: A Robust Design for Multilingual Visual Text Creation
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Chao, Jiang, Chen, Liu, Xiaolong, Zhao, Jun, Wang, Guoxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
JoyHallo: Digital human model for Mandarin
por: Shi, Sheng, et al.
Publicado: (2024)
por: Shi, Sheng, et al.
Publicado: (2024)
JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation
por: Cao, Xuyang, et al.
Publicado: (2024)
por: Cao, Xuyang, et al.
Publicado: (2024)
AnyText: Multilingual Visual Text Generation And Editing
por: Tuo, Yuxiang, et al.
Publicado: (2023)
por: Tuo, Yuxiang, et al.
Publicado: (2023)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
por: Tang, Jingqun, et al.
Publicado: (2024)
por: Tang, Jingqun, et al.
Publicado: (2024)
Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering
por: Liu, Zeyu, et al.
Publicado: (2024)
por: Liu, Zeyu, et al.
Publicado: (2024)
SceneVTG++: Controllable Multilingual Visual Text Generation in the Wild
por: Liu, Jiawei, et al.
Publicado: (2025)
por: Liu, Jiawei, et al.
Publicado: (2025)
JoyStreamer: Unlocking Highly Expressive Avatars via Harmonized Text-Audio Conditioning
por: Wang, Ruikui, et al.
Publicado: (2026)
por: Wang, Ruikui, et al.
Publicado: (2026)
StyleTextGen: Style-Conditioned Multilingual Scene Text Generation
por: Chen, Zeyu, et al.
Publicado: (2026)
por: Chen, Zeyu, et al.
Publicado: (2026)
Semantic Draw Engineering for Text-to-Image Creation
por: Li, Yang, et al.
Publicado: (2023)
por: Li, Yang, et al.
Publicado: (2023)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
por: Atuhurra, Jesse, et al.
Publicado: (2024)
por: Atuhurra, Jesse, et al.
Publicado: (2024)
Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation
por: Li, Niantong, et al.
Publicado: (2026)
por: Li, Niantong, et al.
Publicado: (2026)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
por: Ma, Lichen, et al.
Publicado: (2026)
por: Ma, Lichen, et al.
Publicado: (2026)
EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering
por: Lu, Runnan, et al.
Publicado: (2025)
por: Lu, Runnan, et al.
Publicado: (2025)
Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs
por: Cheng, Dabing, et al.
Publicado: (2025)
por: Cheng, Dabing, et al.
Publicado: (2025)
DeepMesh: Auto-Regressive Artist-mesh Creation with Reinforcement Learning
por: Zhao, Ruowen, et al.
Publicado: (2025)
por: Zhao, Ruowen, et al.
Publicado: (2025)
JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing
por: Wang, Qili, et al.
Publicado: (2025)
por: Wang, Qili, et al.
Publicado: (2025)
DiffChat: Learning to Chat with Text-to-Image Synthesis Models for Interactive Image Creation
por: Wang, Jiapeng, et al.
Publicado: (2024)
por: Wang, Jiapeng, et al.
Publicado: (2024)
VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning
por: Ji, Yuheng, et al.
Publicado: (2025)
por: Ji, Yuheng, et al.
Publicado: (2025)
StyleBlend: Enhancing Style-Specific Content Creation in Text-to-Image Diffusion Models
por: Chen, Zichong, et al.
Publicado: (2025)
por: Chen, Zichong, et al.
Publicado: (2025)
From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs
por: Li, Mingxiao, et al.
Publicado: (2025)
por: Li, Mingxiao, et al.
Publicado: (2025)
RepText: Rendering Visual Text via Replicating
por: Wang, Haofan, et al.
Publicado: (2025)
por: Wang, Haofan, et al.
Publicado: (2025)
DanceText: A Training-Free Layered Framework for Controllable Multilingual Text Transformation in Images
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
Exploring Robust Face-Voice Matching in Multilingual Environments
por: Tang, Jiehui, et al.
Publicado: (2024)
por: Tang, Jiehui, et al.
Publicado: (2024)
TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis
por: Xie, Yu, et al.
Publicado: (2025)
por: Xie, Yu, et al.
Publicado: (2025)
Diffusion-Based Visual Art Creation: A Survey and New Perspectives
por: Wang, Bingyuan, et al.
Publicado: (2024)
por: Wang, Bingyuan, et al.
Publicado: (2024)
ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation
por: Yang, Songlin, et al.
Publicado: (2026)
por: Yang, Songlin, et al.
Publicado: (2026)
Robustness-Aware 3D Object Detection in Autonomous Driving: A Review and Outlook
por: Song, Ziying, et al.
Publicado: (2024)
por: Song, Ziying, et al.
Publicado: (2024)
Research on Multilingual Natural Scene Text Detection Algorithm
por: Wang, Tao
Publicado: (2023)
por: Wang, Tao
Publicado: (2023)
Text-Guided Coarse-to-Fine Fusion Network for Robust Remote Sensing Visual Question Answering
por: Zhao, Zhicheng, et al.
Publicado: (2024)
por: Zhao, Zhicheng, et al.
Publicado: (2024)
VisionCreator: A Native Visual-Generation Agentic Model with Understanding, Thinking, Planning and Creation
por: Lai, Jinxiang, et al.
Publicado: (2026)
por: Lai, Jinxiang, et al.
Publicado: (2026)
EfficientDreamer: High-Fidelity and Robust 3D Creation via Orthogonal-view Diffusion Prior
por: Hu, Zhipeng, et al.
Publicado: (2023)
por: Hu, Zhipeng, et al.
Publicado: (2023)
Investigating Text Insulation and Attention Mechanisms for Complex Visual Text Generation
por: Tai, Ying, et al.
Publicado: (2025)
por: Tai, Ying, et al.
Publicado: (2025)
PTTA: A Pure Text-to-Animation Framework for High-Quality Creation
por: Chen, Ruiqi, et al.
Publicado: (2025)
por: Chen, Ruiqi, et al.
Publicado: (2025)
DeepSolo++: Let Transformer Decoder with Explicit Points Solo for Multilingual Text Spotting
por: Ye, Maoyuan, et al.
Publicado: (2023)
por: Ye, Maoyuan, et al.
Publicado: (2023)
Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation
por: Yuan, Chao, et al.
Publicado: (2026)
por: Yuan, Chao, et al.
Publicado: (2026)
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
por: Zhu, Hanshen, et al.
Publicado: (2026)
por: Zhu, Hanshen, et al.
Publicado: (2026)
A Comprehensive Survey on Visual Concept Mining in Text-to-image Diffusion Models
por: Li, Ziqiang, et al.
Publicado: (2025)
por: Li, Ziqiang, et al.
Publicado: (2025)
3SHNet: Boosting Image-Sentence Retrieval via Visual Semantic-Spatial Self-Highlighting
por: Ge, Xuri, et al.
Publicado: (2024)
por: Ge, Xuri, et al.
Publicado: (2024)
Video Creation by Demonstration
por: Sun, Yihong, et al.
Publicado: (2024)
por: Sun, Yihong, et al.
Publicado: (2024)
Visual Text Generation in the Wild
por: Zhu, Yuanzhi, et al.
Publicado: (2024)
por: Zhu, Yuanzhi, et al.
Publicado: (2024)
Ejemplares similares
-
JoyHallo: Digital human model for Mandarin
por: Shi, Sheng, et al.
Publicado: (2024) -
JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation
por: Cao, Xuyang, et al.
Publicado: (2024) -
AnyText: Multilingual Visual Text Generation And Editing
por: Tuo, Yuxiang, et al.
Publicado: (2023) -
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
por: Tang, Jingqun, et al.
Publicado: (2024) -
Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering
por: Liu, Zeyu, et al.
Publicado: (2024)