TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering
Fuente:
arXiv
Salvato in:
| Autori principali: | Mao, Dongxing, Wang, Yilin, Li, Linjie, Yang, Zhengyuan, Wang, Alex Jinpeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
TextEditBench: Evaluating Reasoning-aware Text Editing Beyond Rendering
di: Gui, Rui, et al.
Pubblicazione: (2025)
di: Gui, Rui, et al.
Pubblicazione: (2025)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
di: Lin, Yiqi, et al.
Pubblicazione: (2025)
di: Lin, Yiqi, et al.
Pubblicazione: (2025)
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards
di: Cui, Mingxuan, et al.
Pubblicazione: (2026)
di: Cui, Mingxuan, et al.
Pubblicazione: (2026)
Fast Prompt Alignment for Text-to-Image Generation
di: Mrini, Khalil, et al.
Pubblicazione: (2024)
di: Mrini, Khalil, et al.
Pubblicazione: (2024)
RepText: Rendering Visual Text via Replicating
di: Wang, Haofan, et al.
Pubblicazione: (2025)
di: Wang, Haofan, et al.
Pubblicazione: (2025)
SafeText: Safe Text-to-image Models via Aligning the Text Encoder
di: Hu, Yuepeng, et al.
Pubblicazione: (2025)
di: Hu, Yuepeng, et al.
Pubblicazione: (2025)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
Skeletons Speak Louder than Text: A Motion-Aware Pretraining Paradigm for Video-Based Person Re-Identification
di: Lin, Rifen, et al.
Pubblicazione: (2025)
di: Lin, Rifen, et al.
Pubblicazione: (2025)
VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
Glance: Accelerating Diffusion Models with 1 Sample
di: Dong, Zhuobai, et al.
Pubblicazione: (2025)
di: Dong, Zhuobai, et al.
Pubblicazione: (2025)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
di: Zheng, Xiangxi, et al.
Pubblicazione: (2025)
di: Zheng, Xiangxi, et al.
Pubblicazione: (2025)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
AttnDreamBooth: Towards Text-Aligned Personalized Text-to-Image Generation
di: Pang, Lianyu, et al.
Pubblicazione: (2024)
di: Pang, Lianyu, et al.
Pubblicazione: (2024)
See the Text: From Tokenization to Visual Reading
di: Xing, Ling, et al.
Pubblicazione: (2025)
di: Xing, Ling, et al.
Pubblicazione: (2025)
EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering
di: Lu, Runnan, et al.
Pubblicazione: (2025)
di: Lu, Runnan, et al.
Pubblicazione: (2025)
VidProM: A Million-scale Real Prompt-Gallery Dataset for Text-to-Video Diffusion Models
di: Wang, Wenhao, et al.
Pubblicazione: (2024)
di: Wang, Wenhao, et al.
Pubblicazione: (2024)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
di: Zhu, Hanshen, et al.
Pubblicazione: (2026)
di: Zhu, Hanshen, et al.
Pubblicazione: (2026)
FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
di: Yi, Junchao, et al.
Pubblicazione: (2026)
di: Yi, Junchao, et al.
Pubblicazione: (2026)
First Creating Backgrounds Then Rendering Texts: A New Paradigm for Visual Text Blending
di: Li, Zhenhang, et al.
Pubblicazione: (2024)
di: Li, Zhenhang, et al.
Pubblicazione: (2024)
Conditional Text-to-Image Generation with Reference Guidance
di: Kim, Taewook, et al.
Pubblicazione: (2024)
di: Kim, Taewook, et al.
Pubblicazione: (2024)
Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment
di: Kou, Tengchuan, et al.
Pubblicazione: (2024)
di: Kou, Tengchuan, et al.
Pubblicazione: (2024)
AlignIT: Enhancing Prompt Alignment in Customization of Text-to-Image Models
di: Agarwal, Aishwarya, et al.
Pubblicazione: (2024)
di: Agarwal, Aishwarya, et al.
Pubblicazione: (2024)
Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
di: Qiu, Jielin, et al.
Pubblicazione: (2024)
di: Qiu, Jielin, et al.
Pubblicazione: (2024)
Parrot Captions Teach CLIP to Spot Text
di: Lin, Yiqi, et al.
Pubblicazione: (2023)
di: Lin, Yiqi, et al.
Pubblicazione: (2023)
ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment
di: Weng, Wanjiang, et al.
Pubblicazione: (2025)
di: Weng, Wanjiang, et al.
Pubblicazione: (2025)
TIPO: Text to Image with Text Presampling for Prompt Optimization
di: Yeh, Shih-Ying, et al.
Pubblicazione: (2024)
di: Yeh, Shih-Ying, et al.
Pubblicazione: (2024)
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
di: Cheng, Jiale, et al.
Pubblicazione: (2025)
di: Cheng, Jiale, et al.
Pubblicazione: (2025)
Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization
di: Zhao, Zidong, et al.
Pubblicazione: (2026)
di: Zhao, Zidong, et al.
Pubblicazione: (2026)
TIP-I2V: A Million-Scale Real Text and Image Prompt Dataset for Image-to-Video Generation
di: Wang, Wenhao, et al.
Pubblicazione: (2024)
di: Wang, Wenhao, et al.
Pubblicazione: (2024)
FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection
di: Zhang, Ruiqiang, et al.
Pubblicazione: (2026)
di: Zhang, Ruiqiang, et al.
Pubblicazione: (2026)
DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding
di: Wu, Yuchuan, et al.
Pubblicazione: (2026)
di: Wu, Yuchuan, et al.
Pubblicazione: (2026)
Generating Animated Layouts as Structured Text Representations
di: Shin, Yeonsang, et al.
Pubblicazione: (2025)
di: Shin, Yeonsang, et al.
Pubblicazione: (2025)
Text Grouping Adapter: Adapting Pre-trained Text Detector for Layout Analysis
di: Bi, Tianci, et al.
Pubblicazione: (2024)
di: Bi, Tianci, et al.
Pubblicazione: (2024)
Prompt-Softbox-Prompt: A Free-Text Embedding Control for Image Editing
di: Yang, Yitong, et al.
Pubblicazione: (2024)
di: Yang, Yitong, et al.
Pubblicazione: (2024)
Zero-Painter: Training-Free Layout Control for Text-to-Image Synthesis
di: Ohanyan, Marianna, et al.
Pubblicazione: (2024)
di: Ohanyan, Marianna, et al.
Pubblicazione: (2024)
Documenti analoghi
-
TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025) -
TextEditBench: Evaluating Reasoning-aware Text Editing Beyond Rendering
di: Gui, Rui, et al.
Pubblicazione: (2025) -
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025) -
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
di: Lin, Yiqi, et al.
Pubblicazione: (2025) -
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)