Evaluating Text-to-Visual Generation with Image-to-Text Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Zhiqiu, Pathak, Deepak, Li, Baiqi, Li, Jiayao, Xia, Xide, Neubig, Graham, Zhang, Pengchuan, Ramanan, Deva |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
por: Li, Baiqi, et al.
Publicado: (2024)
por: Li, Baiqi, et al.
Publicado: (2024)
Language Models as Black-Box Optimizers for Vision-Language Models
por: Liu, Shihong, et al.
Publicado: (2023)
por: Liu, Shihong, et al.
Publicado: (2023)
Revisiting the Role of Language Priors in Vision-Language Models
por: Lin, Zhiqiu, et al.
Publicado: (2023)
por: Lin, Zhiqiu, et al.
Publicado: (2023)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024)
por: Li, Baiqi, et al.
Publicado: (2024)
DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter
por: Dong, Ziyi, et al.
Publicado: (2022)
por: Dong, Ziyi, et al.
Publicado: (2022)
Discriminative Probing and Tuning for Text-to-Image Generation
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
por: Chen, Junyu, et al.
Publicado: (2025)
por: Chen, Junyu, et al.
Publicado: (2025)
Learning Video Context as Interleaved Multimodal Sequences
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
G-Refine: A General Quality Refiner for Text-to-Image Generation
por: Li, Chunyi, et al.
Publicado: (2024)
por: Li, Chunyi, et al.
Publicado: (2024)
DeepMoLM: Leveraging Visual and Geometric Structural Information for Molecule-Text Modeling
por: Lan, Jing, et al.
Publicado: (2026)
por: Lan, Jing, et al.
Publicado: (2026)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
por: Han, Jiaming, et al.
Publicado: (2025)
por: Han, Jiaming, et al.
Publicado: (2025)
Toward Automatic Relevance Judgment using Vision--Language Models for Image--Text Retrieval Evaluation
por: Yang, Jheng-Hong, et al.
Publicado: (2024)
por: Yang, Jheng-Hong, et al.
Publicado: (2024)
Beyond Coarse-Grained Matching in Video-Text Retrieval
por: Chen, Aozhu, et al.
Publicado: (2024)
por: Chen, Aozhu, et al.
Publicado: (2024)
V-FAT: Benchmarking Visual Fidelity Against Text-bias
por: Wang, Ziteng, et al.
Publicado: (2026)
por: Wang, Ziteng, et al.
Publicado: (2026)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
por: Huang, Yuesheng, et al.
Publicado: (2025)
por: Huang, Yuesheng, et al.
Publicado: (2025)
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
por: Luo, Jianjie, et al.
Publicado: (2024)
por: Luo, Jianjie, et al.
Publicado: (2024)
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
por: S, Sridhar, et al.
Publicado: (2025)
por: S, Sridhar, et al.
Publicado: (2025)
A Fast Text-Driven Approach for Generating Artistic Content
por: Lupascu, Marian, et al.
Publicado: (2022)
por: Lupascu, Marian, et al.
Publicado: (2022)
Building a Precise Video Language with Human-AI Oversight
por: Lin, Zhiqiu, et al.
Publicado: (2026)
por: Lin, Zhiqiu, et al.
Publicado: (2026)
Identity-Preserving Text-to-Video Generation by Frequency Decomposition
por: Yuan, Shenghai, et al.
Publicado: (2024)
por: Yuan, Shenghai, et al.
Publicado: (2024)
Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective
por: Zhu, Xiangru, et al.
Publicado: (2024)
por: Zhu, Xiangru, et al.
Publicado: (2024)
Ask Questions with Double Hints: Visual Question Generation with Answer-awareness and Region-reference
por: Shen, Kai, et al.
Publicado: (2024)
por: Shen, Kai, et al.
Publicado: (2024)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
por: Lv, Zheqi, et al.
Publicado: (2025)
por: Lv, Zheqi, et al.
Publicado: (2025)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
por: Yang, Shuyu, et al.
Publicado: (2024)
por: Yang, Shuyu, et al.
Publicado: (2024)
VP3D: Unleashing 2D Visual Prompt for Text-to-3D Generation
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
por: Li, Yongqi, et al.
Publicado: (2024)
por: Li, Yongqi, et al.
Publicado: (2024)
Towards Understanding Camera Motions in Any Video
por: Lin, Zhiqiu, et al.
Publicado: (2025)
por: Lin, Zhiqiu, et al.
Publicado: (2025)
Hand1000: Generating Realistic Hands from Text with Only 1,000 Images
por: Zhang, Haozhuo, et al.
Publicado: (2024)
por: Zhang, Haozhuo, et al.
Publicado: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
TAVGBench: Benchmarking Text to Audible-Video Generation
por: Mao, Yuxin, et al.
Publicado: (2024)
por: Mao, Yuxin, et al.
Publicado: (2024)
Safe-VAR: Safe Visual Autoregressive Model for Text-to-Image Generative Watermarking
por: Wang, Ziyi, et al.
Publicado: (2025)
por: Wang, Ziyi, et al.
Publicado: (2025)
Towards Flexible Evaluation for Generative Visual Question Answering
por: Ji, Huishan, et al.
Publicado: (2024)
por: Ji, Huishan, et al.
Publicado: (2024)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
por: Xu, Jiaqi, et al.
Publicado: (2023)
por: Xu, Jiaqi, et al.
Publicado: (2023)
Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades
por: Taghipour, Ashkan, et al.
Publicado: (2026)
por: Taghipour, Ashkan, et al.
Publicado: (2026)
Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective
por: Wang, Bing, et al.
Publicado: (2025)
por: Wang, Bing, et al.
Publicado: (2025)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
por: Xie, Zequn, et al.
Publicado: (2026)
por: Xie, Zequn, et al.
Publicado: (2026)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
por: Han, Wei, et al.
Publicado: (2023)
por: Han, Wei, et al.
Publicado: (2023)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
por: Gao, Jiayi, et al.
Publicado: (2025)
por: Gao, Jiayi, et al.
Publicado: (2025)
Ejemplares similares
-
GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
por: Li, Baiqi, et al.
Publicado: (2024) -
Language Models as Black-Box Optimizers for Vision-Language Models
por: Liu, Shihong, et al.
Publicado: (2023) -
Revisiting the Role of Language Priors in Vision-Language Models
por: Lin, Zhiqiu, et al.
Publicado: (2023) -
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024) -
DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter
por: Dong, Ziyi, et al.
Publicado: (2022)