WordArt Designer API: User-Driven Artistic Typography Synthesis with Large Language Models on ModelScope
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Jun-Yan, Cheng, Zhi-Qi, Li, Chenyang, Sun, Jingdong, Xiang, Wangmeng, Hu, Yusen, Lin, Xianhui, Kang, Xiaoyang, Jin, Zengke, Luo, Bin, Geng, Yifeng, Xie, Xuansong, Zhou, Jingren |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MetaDesigner: Advancing Artistic Typography Through AI-Driven, User-Centric, and Multilingual WordArt Synthesis
par: He, Jun-Yan, et autres
Publié: (2024)
par: He, Jun-Yan, et autres
Publié: (2024)
ShoeModel: Learning to Wear on the User-specified Shoes via Diffusion Model
par: Chen, Binghui, et autres
Publié: (2024)
par: Chen, Binghui, et autres
Publié: (2024)
A Fast Text-Driven Approach for Generating Artistic Content
par: Lupascu, Marian, et autres
Publié: (2022)
par: Lupascu, Marian, et autres
Publié: (2022)
DyRoNet: Dynamic Routing and Low-Rank Adapters for Autonomous Driving Streaming Perception
par: Huang, Xiang, et autres
Publié: (2024)
par: Huang, Xiang, et autres
Publié: (2024)
FIGURA: A Modular Prompt Engineering Method for Artistic Figure Photography in Safety-Filtered Text-to-Image Models
par: Cazzaniga, Luca
Publié: (2026)
par: Cazzaniga, Luca
Publié: (2026)
A Shift In Artistic Practices through Artificial Intelligence
par: Tatar, Kıvanç, et autres
Publié: (2023)
par: Tatar, Kıvanç, et autres
Publié: (2023)
SceneDreamer360: Text-Driven 3D-Consistent Scene Generation with Panoramic Gaussian Splatting
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
VirtualModel: Generating Object-ID-retentive Human-object Interaction Image by Diffusion Model for E-commerce Marketing
par: Chen, Binghui, et autres
Publié: (2024)
par: Chen, Binghui, et autres
Publié: (2024)
VitaGlyph: Vitalizing Artistic Typography with Flexible Dual-branch Diffusion Models
par: Feng, Kailai, et autres
Publié: (2024)
par: Feng, Kailai, et autres
Publié: (2024)
DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement
par: Lu, Renjie, et autres
Publié: (2026)
par: Lu, Renjie, et autres
Publié: (2026)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
par: Sun, Yanpeng, et autres
Publié: (2024)
par: Sun, Yanpeng, et autres
Publié: (2024)
TreeMeshGPT: Artistic Mesh Generation with Autoregressive Tree Sequencing
par: Lionar, Stefan, et autres
Publié: (2025)
par: Lionar, Stefan, et autres
Publié: (2025)
Dynamic Multimodal Expression Generation for LLM-Driven Pedagogical Agents: From User Experience Perspective
par: Wan, Ninghao, et autres
Publié: (2026)
par: Wan, Ninghao, et autres
Publié: (2026)
TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis
par: Liu, Hao, et autres
Publié: (2025)
par: Liu, Hao, et autres
Publié: (2025)
MIDI-LLM: Adapting Large Language Models for Text-to-MIDI Music Generation
par: Wu, Shih-Lun, et autres
Publié: (2025)
par: Wu, Shih-Lun, et autres
Publié: (2025)
FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models
par: Li, Yixuan, et autres
Publié: (2024)
par: Li, Yixuan, et autres
Publié: (2024)
UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
par: Jiang, Haoyu, et autres
Publié: (2024)
par: Jiang, Haoyu, et autres
Publié: (2024)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
WordCraft: Interactive Artistic Typography with Attention Awareness and Noise Blending
par: Wang, Zhe, et autres
Publié: (2025)
par: Wang, Zhe, et autres
Publié: (2025)
Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation
par: Wu, Yi, et autres
Publié: (2025)
par: Wu, Yi, et autres
Publié: (2025)
QuantTune: Optimizing Model Quantization with Adaptive Outlier-Driven Fine Tuning
par: Chen, Jiun-Man, et autres
Publié: (2024)
par: Chen, Jiun-Man, et autres
Publié: (2024)
DiffBrush:Just Painting the Art by Your Hands
par: Chu, Jiaming, et autres
Publié: (2025)
par: Chu, Jiaming, et autres
Publié: (2025)
Multi-task Prompt Words Learning for Social Media Content Generation
par: Xue, Haochen, et autres
Publié: (2024)
par: Xue, Haochen, et autres
Publié: (2024)
Towards Realistic Low-Light Image Enhancement via ISP Driven Data Modeling
par: Wang, Zhihua, et autres
Publié: (2025)
par: Wang, Zhihua, et autres
Publié: (2025)
Enhancing DETRs Variants through Improved Content Query and Similar Query Aggregation
par: Zhang, Yingying, et autres
Publié: (2024)
par: Zhang, Yingying, et autres
Publié: (2024)
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
par: Guan, Jiazhi, et autres
Publié: (2025)
par: Guan, Jiazhi, et autres
Publié: (2025)
Retrieval-Augmented Multimodal Model for Fake News Detection
par: Li, Yiheng, et autres
Publié: (2026)
par: Li, Yiheng, et autres
Publié: (2026)
User-Generated Content and Editors in Games: A Comprehensive Survey
par: Liu, Yuyue, et autres
Publié: (2024)
par: Liu, Yuyue, et autres
Publié: (2024)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
ChartAdapter: Large Vision-Language Model for Chart Summarization
par: Xu, Peixin, et autres
Publié: (2024)
par: Xu, Peixin, et autres
Publié: (2024)
Vocalize: Lead Acquisition and User Engagement through Gamified Voice Competitions
par: Teskeredzic, Edvin, et autres
Publié: (2025)
par: Teskeredzic, Edvin, et autres
Publié: (2025)
ModalImmune: Immunity Driven Unlearning via Self Destructive Training
par: Fu, Rong, et autres
Publié: (2026)
par: Fu, Rong, et autres
Publié: (2026)
Enhancing Student Feedback Using Predictive Models in Visual Literacy Courses
par: Friedman, Alon, et autres
Publié: (2024)
par: Friedman, Alon, et autres
Publié: (2024)
SOMONITOR: Combining Explainable AI & Large Language Models for Marketing Analytics
par: Farseev, Aleksandr, et autres
Publié: (2024)
par: Farseev, Aleksandr, et autres
Publié: (2024)
PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks
par: Wu, Jianyu, et autres
Publié: (2025)
par: Wu, Jianyu, et autres
Publié: (2025)
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
par: Deng, Ailin, et autres
Publié: (2025)
par: Deng, Ailin, et autres
Publié: (2025)
Modeling Layout Reading Order as Ordering Relations for Visually-rich Document Understanding
par: Zhang, Chong, et autres
Publié: (2024)
par: Zhang, Chong, et autres
Publié: (2024)
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation
par: Liu, Dancheng, et autres
Publié: (2025)
par: Liu, Dancheng, et autres
Publié: (2025)
A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification
par: Calbucura, Nicolas, et autres
Publié: (2025)
par: Calbucura, Nicolas, et autres
Publié: (2025)
Documents similaires
-
MetaDesigner: Advancing Artistic Typography Through AI-Driven, User-Centric, and Multilingual WordArt Synthesis
par: He, Jun-Yan, et autres
Publié: (2024) -
ShoeModel: Learning to Wear on the User-specified Shoes via Diffusion Model
par: Chen, Binghui, et autres
Publié: (2024) -
A Fast Text-Driven Approach for Generating Artistic Content
par: Lupascu, Marian, et autres
Publié: (2022) -
DyRoNet: Dynamic Routing and Low-Rank Adapters for Autonomous Driving Streaming Perception
par: Huang, Xiang, et autres
Publié: (2024) -
FIGURA: A Modular Prompt Engineering Method for Artistic Figure Photography in Safety-Filtered Text-to-Image Models
par: Cazzaniga, Luca
Publié: (2026)