TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fallah, Forouzan, Patel, Maitreya, Chatterjee, Agneet, Morariu, Vlad I., Baral, Chitta, Yang, Yezhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AcT2I: Evaluating and Improving Action Depiction in Text-to-Image Models
par: Malaviya, Vatsal, et autres
Publié: (2025)
par: Malaviya, Vatsal, et autres
Publié: (2025)
$λ$-ECLIPSE: Multi-Concept Personalized Text-to-Image Diffusion Models by Leveraging CLIP Latent Space
par: Patel, Maitreya, et autres
Publié: (2024)
par: Patel, Maitreya, et autres
Publié: (2024)
ConceptBed: Evaluating Concept Learning Abilities of Text-to-Image Diffusion Models
par: Patel, Maitreya, et autres
Publié: (2023)
par: Patel, Maitreya, et autres
Publié: (2023)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
par: Cheng, Sheng, et autres
Publié: (2024)
par: Cheng, Sheng, et autres
Publié: (2024)
On the Robustness of Language Guidance for Low-Level Vision Tasks: Findings from Depth Estimation
par: Chatterjee, Agneet, et autres
Publié: (2024)
par: Chatterjee, Agneet, et autres
Publié: (2024)
Investigating VLM Hallucination from a Cognitive Psychology Perspective: A First Step Toward Interpretation with Intriguing Observations
par: Liu, Xiangrui, et autres
Publié: (2025)
par: Liu, Xiangrui, et autres
Publié: (2025)
REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models
par: Chatterjee, Agneet, et autres
Publié: (2024)
par: Chatterjee, Agneet, et autres
Publié: (2024)
TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives
par: Patel, Maitreya, et autres
Publié: (2024)
par: Patel, Maitreya, et autres
Publié: (2024)
Help Me Identify: Is an LLM+VQA System All We Need to Identify Visual Concepts?
par: Sampat, Shailaja Keyur, et autres
Publié: (2024)
par: Sampat, Shailaja Keyur, et autres
Publié: (2024)
RefEdit: A Benchmark and Method for Improving Instruction-based Image Editing Model on Referring Expressions
par: Pathiraja, Bimsara, et autres
Publié: (2025)
par: Pathiraja, Bimsara, et autres
Publié: (2025)
VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning
par: Yilmaz, Nilay, et autres
Publié: (2025)
par: Yilmaz, Nilay, et autres
Publié: (2025)
Lost in Translation? Translation Errors and Challenges for Fair Assessment of Text-to-Image Models on Multilingual Concepts
par: Saxon, Michael, et autres
Publié: (2024)
par: Saxon, Michael, et autres
Publié: (2024)
EraseFlow: Learning Concept Erasure Policies via GFlowNet-Driven Alignment
par: Kusumba, Abhiram, et autres
Publié: (2025)
par: Kusumba, Abhiram, et autres
Publié: (2025)
Chimera: Compositional Image Generation using Part-based Concepting
par: Singh, Shivam, et autres
Publié: (2025)
par: Singh, Shivam, et autres
Publié: (2025)
Getting it Right: Improving Spatial Consistency in Text-to-Image Models
par: Chatterjee, Agneet, et autres
Publié: (2024)
par: Chatterjee, Agneet, et autres
Publié: (2024)
Harnessing Synthetic Preference Data for Enhancing Temporal Understanding of Video-LLMs
par: Vani, Sameep, et autres
Publié: (2025)
par: Vani, Sameep, et autres
Publié: (2025)
Dual Caption Preference Optimization for Diffusion Models
par: Saeidi, Amir, et autres
Publié: (2025)
par: Saeidi, Amir, et autres
Publié: (2025)
WOUAF: Weight Modulation for User Attribution and Fingerprinting in Text-to-Image Diffusion Models
par: Kim, Changhoon, et autres
Publié: (2023)
par: Kim, Changhoon, et autres
Publié: (2023)
Map&Make: Schema Guided Text to Table Generation
par: Ahuja, Naman, et autres
Publié: (2025)
par: Ahuja, Naman, et autres
Publié: (2025)
Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation
par: Chatterjee, Agneet, et autres
Publié: (2025)
par: Chatterjee, Agneet, et autres
Publié: (2025)
TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
par: Ozaki, Shintaro, et autres
Publié: (2025)
par: Ozaki, Shintaro, et autres
Publié: (2025)
Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Text
par: Rahman, Mizanur, et autres
Publié: (2025)
par: Rahman, Mizanur, et autres
Publié: (2025)
Text Prompt Injection of Vision Language Models
par: Zhu, Ruizhe
Publié: (2025)
par: Zhu, Ruizhe
Publié: (2025)
Fast Prompt Alignment for Text-to-Image Generation
par: Mrini, Khalil, et autres
Publié: (2024)
par: Mrini, Khalil, et autres
Publié: (2024)
Optimizing Prompts for Text-to-Image Generation
par: Hao, Yaru, et autres
Publié: (2022)
par: Hao, Yaru, et autres
Publié: (2022)
VL-GLUE: A Suite of Fundamental yet Challenging Visuo-Linguistic Reasoning Tasks
par: Sampat, Shailaja Keyur, et autres
Publié: (2024)
par: Sampat, Shailaja Keyur, et autres
Publié: (2024)
ActionCOMET: A Zero-shot Approach to Learn Image-specific Commonsense Concepts about Actions
par: Sampat, Shailaja Keyur, et autres
Publié: (2024)
par: Sampat, Shailaja Keyur, et autres
Publié: (2024)
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
par: Gao, Xin, et autres
Publié: (2026)
par: Gao, Xin, et autres
Publié: (2026)
Investigating and Addressing Hallucinations of LLMs in Tasks Involving Negation
par: Varshney, Neeraj, et autres
Publié: (2024)
par: Varshney, Neeraj, et autres
Publié: (2024)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
par: Li, Sijie, et autres
Publié: (2026)
par: Li, Sijie, et autres
Publié: (2026)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
par: Chen, Kaijie, et autres
Publié: (2025)
par: Chen, Kaijie, et autres
Publié: (2025)
Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries
par: Wu, Yin, et autres
Publié: (2025)
par: Wu, Yin, et autres
Publié: (2025)
Universal Prompt Optimizer for Safe Text-to-Image Generation
par: Wu, Zongyu, et autres
Publié: (2024)
par: Wu, Zongyu, et autres
Publié: (2024)
The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation
par: Gao, Bingjie, et autres
Publié: (2025)
par: Gao, Bingjie, et autres
Publié: (2025)
Text-Conditioned Background Generation for Editable Multi-Layer Documents
par: Kang, Taewon, et autres
Publié: (2025)
par: Kang, Taewon, et autres
Publié: (2025)
Evaluating Text-to-Visual Generation with Image-to-Text Generation
par: Lin, Zhiqiu, et autres
Publié: (2024)
par: Lin, Zhiqiu, et autres
Publié: (2024)
On Mechanistic Knowledge Localization in Text-to-Image Generative Models
par: Basu, Samyadeep, et autres
Publié: (2024)
par: Basu, Samyadeep, et autres
Publié: (2024)
RareFlow: Physics-Aware Flow-Matching for Cross-Sensor Super-Resolution of Rare-Earth Features
par: Fallah, Forouzan, et autres
Publié: (2025)
par: Fallah, Forouzan, et autres
Publié: (2025)
Asynchronous Remote Sensing Time-Series Fusion for Cloud Removal and Anytime Reconstruction
par: Fallah, Forouzan, et autres
Publié: (2026)
par: Fallah, Forouzan, et autres
Publié: (2026)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
par: Han, Jiaming, et autres
Publié: (2025)
par: Han, Jiaming, et autres
Publié: (2025)
Documents similaires
-
AcT2I: Evaluating and Improving Action Depiction in Text-to-Image Models
par: Malaviya, Vatsal, et autres
Publié: (2025) -
$λ$-ECLIPSE: Multi-Concept Personalized Text-to-Image Diffusion Models by Leveraging CLIP Latent Space
par: Patel, Maitreya, et autres
Publié: (2024) -
ConceptBed: Evaluating Concept Learning Abilities of Text-to-Image Diffusion Models
par: Patel, Maitreya, et autres
Publié: (2023) -
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
par: Cheng, Sheng, et autres
Publié: (2024) -
On the Robustness of Language Guidance for Low-Level Vision Tasks: Findings from Depth Estimation
par: Chatterjee, Agneet, et autres
Publié: (2024)