GlyphBanana: Advancing Precise Text Rendering Through Agentic Workflows
Fuente:
arXiv
Salvato in:
| Autori principali: | Yan, Zexuan, Jin, Jiarui, Ma, Yue, Wang, Shijian, Hu, Jiahui, Jiao, Wenxiang, Lu, Yuan, Zhang, Linfeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents
di: Jin, Jiarui, et al.
Pubblicazione: (2026)
di: Jin, Jiarui, et al.
Pubblicazione: (2026)
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
di: Shuai, Xincheng, et al.
Pubblicazione: (2026)
di: Shuai, Xincheng, et al.
Pubblicazione: (2026)
Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
di: Liu, Zeyu, et al.
Pubblicazione: (2024)
di: Liu, Zeyu, et al.
Pubblicazione: (2024)
TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-Control
di: Yan, Zhenyu, et al.
Pubblicazione: (2024)
di: Yan, Zhenyu, et al.
Pubblicazione: (2024)
UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis
di: Wang, Yuanrui, et al.
Pubblicazione: (2025)
di: Wang, Yuanrui, et al.
Pubblicazione: (2025)
MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences
di: Wang, Shijian, et al.
Pubblicazione: (2026)
di: Wang, Shijian, et al.
Pubblicazione: (2026)
FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection
di: Zhang, Ruiqiang, et al.
Pubblicazione: (2026)
di: Zhang, Ruiqiang, et al.
Pubblicazione: (2026)
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
di: Wang, Tong, et al.
Pubblicazione: (2025)
di: Wang, Tong, et al.
Pubblicazione: (2025)
Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering
di: Liu, Zeyu, et al.
Pubblicazione: (2024)
di: Liu, Zeyu, et al.
Pubblicazione: (2024)
Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending
di: Hou, Jingqi, et al.
Pubblicazione: (2026)
di: Hou, Jingqi, et al.
Pubblicazione: (2026)
HDGlyph: A Hierarchical Disentangled Glyph-Based Framework for Long-Tail Text Rendering in Diffusion Models
di: Zhuang, Shuhan, et al.
Pubblicazione: (2025)
di: Zhuang, Shuhan, et al.
Pubblicazione: (2025)
AnyArtisticGlyph: Multilingual Controllable Artistic Glyph Generation
di: Lu, Xiongbo, et al.
Pubblicazione: (2025)
di: Lu, Xiongbo, et al.
Pubblicazione: (2025)
SOGS: Second-Order Anchor for Advanced 3D Gaussian Splatting
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts
di: He, Junwen, et al.
Pubblicazione: (2024)
di: He, Junwen, et al.
Pubblicazione: (2024)
EEdit: Rethinking the Spatial and Temporal Redundancy for Efficient Image Editing
di: Yan, Zexuan, et al.
Pubblicazione: (2025)
di: Yan, Zexuan, et al.
Pubblicazione: (2025)
GlyphDraw2: Automatic Generation of Complex Glyph Posters with Diffusion Models and Large Language Models
di: Ma, Jian, et al.
Pubblicazione: (2024)
di: Ma, Jian, et al.
Pubblicazione: (2024)
Synthetic Curriculum Reinforces Compositional Text-to-Image Generation
di: Wang, Shijian, et al.
Pubblicazione: (2025)
di: Wang, Shijian, et al.
Pubblicazione: (2025)
OmniGAIA: Towards Native Omni-Modal AI Agents
di: Li, Xiaoxi, et al.
Pubblicazione: (2026)
di: Li, Xiaoxi, et al.
Pubblicazione: (2026)
DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation
di: Pan, Wei, et al.
Pubblicazione: (2025)
di: Pan, Wei, et al.
Pubblicazione: (2025)
Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent
di: Xia, Bowei, et al.
Pubblicazione: (2026)
di: Xia, Bowei, et al.
Pubblicazione: (2026)
Agent Banana: High-Fidelity Image Editing with Agentic Thinking and Tooling
di: Ye, Ruijie, et al.
Pubblicazione: (2026)
di: Ye, Ruijie, et al.
Pubblicazione: (2026)
WaveShot: A Compact Portable Unmanned Surface Vessel for Dynamic Water Surface Videography and Media Production
di: Ma, Shijian, et al.
Pubblicazione: (2024)
di: Ma, Shijian, et al.
Pubblicazione: (2024)
LOGO: Video Text Spotting with Language Collaboration and Glyph Perception Model
di: Liu, Hongen, et al.
Pubblicazione: (2024)
di: Liu, Hongen, et al.
Pubblicazione: (2024)
Glyph: Scaling Context Windows via Visual-Text Compression
di: Cheng, Jiale, et al.
Pubblicazione: (2025)
di: Cheng, Jiale, et al.
Pubblicazione: (2025)
BizGen: Advancing Article-level Visual Text Rendering for Infographics Generation
di: Peng, Yuyang, et al.
Pubblicazione: (2025)
di: Peng, Yuyang, et al.
Pubblicazione: (2025)
LoSh: Long-Short Text Joint Prediction Network for Referring Video Object Segmentation
di: Yuan, Linfeng, et al.
Pubblicazione: (2023)
di: Yuan, Linfeng, et al.
Pubblicazione: (2023)
Decoupling Layout from Glyph in Online Chinese Handwriting Generation
di: Ren, Min-Si, et al.
Pubblicazione: (2024)
di: Ren, Min-Si, et al.
Pubblicazione: (2024)
WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing
di: Zhang, Hui, et al.
Pubblicazione: (2026)
di: Zhang, Hui, et al.
Pubblicazione: (2026)
EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering
di: Lu, Runnan, et al.
Pubblicazione: (2025)
di: Lu, Runnan, et al.
Pubblicazione: (2025)
Stroke Modeling Enables Vectorized Character Generation with Large Vectorized Glyph Model
di: Zhang, Xinyue, et al.
Pubblicazione: (2025)
di: Zhang, Xinyue, et al.
Pubblicazione: (2025)
FreGS: 3D Gaussian Splatting with Progressive Frequency Regularization
di: Zhang, Jiahui, et al.
Pubblicazione: (2024)
di: Zhang, Jiahui, et al.
Pubblicazione: (2024)
Versatile Transition Generation with Image-to-Video Diffusion
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
di: Yang, Zuhao, et al.
Pubblicazione: (2025)
PCR-GS: COLMAP-Free 3D Gaussian Splatting via Pose Co-Regularizations
di: Wei, Yu, et al.
Pubblicazione: (2025)
di: Wei, Yu, et al.
Pubblicazione: (2025)
Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
di: Qian, Yusu, et al.
Pubblicazione: (2025)
di: Qian, Yusu, et al.
Pubblicazione: (2025)
Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
di: Luo, Minxing, et al.
Pubblicazione: (2025)
di: Luo, Minxing, et al.
Pubblicazione: (2025)
TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision
di: Gillani, Syeda Anshrah, et al.
Pubblicazione: (2025)
di: Gillani, Syeda Anshrah, et al.
Pubblicazione: (2025)
Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training
di: Li, Wenbo, et al.
Pubblicazione: (2024)
di: Li, Wenbo, et al.
Pubblicazione: (2024)
Refining Text-to-Image Generation: Towards Accurate Training-Free Glyph-Enhanced Image Generation
di: Lakhanpal, Sanyam, et al.
Pubblicazione: (2024)
di: Lakhanpal, Sanyam, et al.
Pubblicazione: (2024)
ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations
di: Jiang, Bowen, et al.
Pubblicazione: (2025)
di: Jiang, Bowen, et al.
Pubblicazione: (2025)
Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning
di: Wang, Shijian, et al.
Pubblicazione: (2025)
di: Wang, Shijian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents
di: Jin, Jiarui, et al.
Pubblicazione: (2026) -
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
di: Shuai, Xincheng, et al.
Pubblicazione: (2026) -
Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
di: Liu, Zeyu, et al.
Pubblicazione: (2024) -
TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-Control
di: Yan, Zhenyu, et al.
Pubblicazione: (2024) -
UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis
di: Wang, Yuanrui, et al.
Pubblicazione: (2025)