Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Wenbo, Li, Guohao, Lan, Zhibin, Xu, Xue, Zhuang, Wanru, Liu, Jiachen, Xiao, Xinyan, Su, Jinsong |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
by: Zhuang, Wanru, et al.
Published: (2025)
by: Zhuang, Wanru, et al.
Published: (2025)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
by: Lan, Zhibin, et al.
Published: (2024)
by: Lan, Zhibin, et al.
Published: (2024)
UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
by: Shuai, Xincheng, et al.
Published: (2026)
by: Shuai, Xincheng, et al.
Published: (2026)
A Survey on Multi-modal Machine Translation: Tasks, Methods and Challenges
by: Shen, Huangjun, et al.
Published: (2024)
by: Shen, Huangjun, et al.
Published: (2024)
Glyph: Scaling Context Windows via Visual-Text Compression
by: Cheng, Jiale, et al.
Published: (2025)
by: Cheng, Jiale, et al.
Published: (2025)
Towards Cross-Modal Text-Molecule Retrieval with Better Modality Alignment
by: Song, Jia, et al.
Published: (2024)
by: Song, Jia, et al.
Published: (2024)
AnyArtisticGlyph: Multilingual Controllable Artistic Glyph Generation
by: Lu, Xiongbo, et al.
Published: (2025)
by: Lu, Xiongbo, et al.
Published: (2025)
UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis
by: Wang, Yuanrui, et al.
Published: (2025)
by: Wang, Yuanrui, et al.
Published: (2025)
Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
by: Liu, Zeyu, et al.
Published: (2024)
by: Liu, Zeyu, et al.
Published: (2024)
UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings
by: Lan, Zhibin, et al.
Published: (2025)
by: Lan, Zhibin, et al.
Published: (2025)
Text or Pixels? It Takes Half: On the Token Efficiency of Visual Text Inputs in Multimodal LLMs
by: Li, Yanhong, et al.
Published: (2025)
by: Li, Yanhong, et al.
Published: (2025)
Refining Text-to-Image Generation: Towards Accurate Training-Free Glyph-Enhanced Image Generation
by: Lakhanpal, Sanyam, et al.
Published: (2024)
by: Lakhanpal, Sanyam, et al.
Published: (2024)
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
by: Wang, Tong, et al.
Published: (2025)
by: Wang, Tong, et al.
Published: (2025)
DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation
by: Pan, Wei, et al.
Published: (2025)
by: Pan, Wei, et al.
Published: (2025)
TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-Control
by: Yan, Zhenyu, et al.
Published: (2024)
by: Yan, Zhenyu, et al.
Published: (2024)
Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization
by: Wen, Zhibin, et al.
Published: (2024)
by: Wen, Zhibin, et al.
Published: (2024)
EfficientTrain++: Generalized Curriculum Learning for Efficient Visual Backbone Training
by: Wang, Yulin, et al.
Published: (2024)
by: Wang, Yulin, et al.
Published: (2024)
Mechanochemical Backbone Editing for Controlled Degradation of Vinyl Polymers
by: Zhuang Li, et al.
Published: (2024)
by: Zhuang Li, et al.
Published: (2024)
MARVisT: Authoring Glyph-based Visualization in Mobile Augmented Reality
by: Zhu-Tian, Chen, et al.
Published: (2023)
by: Zhu-Tian, Chen, et al.
Published: (2023)
Countering the Over-Reliance Trap: Mitigating Object Hallucination for LVLMs via a Self-Validation Framework
by: Liu, Shiyu, et al.
Published: (2026)
by: Liu, Shiyu, et al.
Published: (2026)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
by: Lan, Zhibin, et al.
Published: (2025)
by: Lan, Zhibin, et al.
Published: (2025)
GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts
by: He, Junwen, et al.
Published: (2024)
by: He, Junwen, et al.
Published: (2024)
Unbiased Visual Reasoning with Controlled Visual Inputs
by: Li, Zhaonan, et al.
Published: (2025)
by: Li, Zhaonan, et al.
Published: (2025)
GlyphWeaver: Unlocking Glyph Design Creativity with Uniform Glyph DSL and AI
by: Liu, Can, et al.
Published: (2025)
by: Liu, Can, et al.
Published: (2025)
TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision
by: Gillani, Syeda Anshrah, et al.
Published: (2025)
by: Gillani, Syeda Anshrah, et al.
Published: (2025)
Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering
by: Liu, Zeyu, et al.
Published: (2024)
by: Liu, Zeyu, et al.
Published: (2024)
FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection
by: Zhang, Ruiqiang, et al.
Published: (2026)
by: Zhang, Ruiqiang, et al.
Published: (2026)
Digital Twin-Empowered Voltage Control for Power Systems
by: Xu, Jiachen, et al.
Published: (2024)
by: Xu, Jiachen, et al.
Published: (2024)
Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending
by: Hou, Jingqi, et al.
Published: (2026)
by: Hou, Jingqi, et al.
Published: (2026)
Pre-Training Protein Bi-level Representation Through Span Mask Strategy On 3D Protein Chains
by: Zhao, Jiale, et al.
Published: (2024)
by: Zhao, Jiale, et al.
Published: (2024)
HDGlyph: A Hierarchical Disentangled Glyph-Based Framework for Long-Tail Text Rendering in Diffusion Models
by: Zhuang, Shuhan, et al.
Published: (2025)
by: Zhuang, Shuhan, et al.
Published: (2025)
Synesthesia of Vehicles: Tactile Data Synthesis from Visual Inputs
by: Wang, Rui, et al.
Published: (2026)
by: Wang, Rui, et al.
Published: (2026)
Glyph-Based Uncertainty Visualization and Analysis of Time-Varying Vector Fields
by: Ouermi, Timbwaoga A. J., et al.
Published: (2024)
by: Ouermi, Timbwaoga A. J., et al.
Published: (2024)
Smart Predict-Then-Control: Control-Aware Surrogate Refinement for System Identification
by: Li, Jiachen, et al.
Published: (2025)
by: Li, Jiachen, et al.
Published: (2025)
Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation
by: Lan, Zhibin, et al.
Published: (2024)
by: Lan, Zhibin, et al.
Published: (2024)
VecGlypher: Unified Vector Glyph Generation with Language Models
by: Huang, Xiaoke, et al.
Published: (2026)
by: Huang, Xiaoke, et al.
Published: (2026)
GlyphDraw2: Automatic Generation of Complex Glyph Posters with Diffusion Models and Large Language Models
by: Ma, Jian, et al.
Published: (2024)
by: Ma, Jian, et al.
Published: (2024)
The Heterophilic Snowflake Hypothesis: Training and Empowering GNNs for Heterophilic Graphs
by: Wang, Kun, et al.
Published: (2024)
by: Wang, Kun, et al.
Published: (2024)
Glyph-Based Multiscale Visualization of Turbulent Multi-Physics Statistics
by: Cowe, Arisa, et al.
Published: (2025)
by: Cowe, Arisa, et al.
Published: (2025)
Similar Items
-
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
by: Zhuang, Wanru, et al.
Published: (2025) -
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
by: Lan, Zhibin, et al.
Published: (2024) -
UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion
by: Li, Wei, et al.
Published: (2024) -
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
by: Shuai, Xincheng, et al.
Published: (2026) -
A Survey on Multi-modal Machine Translation: Tasks, Methods and Challenges
by: Shen, Huangjun, et al.
Published: (2024)