GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Baiqi, Lin, Zhiqiu, Pathak, Deepak, Li, Jiayao, Fei, Yixin, Wu, Kewen, Ling, Tiffany, Xia, Xide, Zhang, Pengchuan, Neubig, Graham, Ramanan, Deva |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating Text-to-Visual Generation with Image-to-Text Generation
par: Lin, Zhiqiu, et autres
Publié: (2024)
par: Lin, Zhiqiu, et autres
Publié: (2024)
Language Models as Black-Box Optimizers for Vision-Language Models
par: Liu, Shihong, et autres
Publié: (2023)
par: Liu, Shihong, et autres
Publié: (2023)
Revisiting the Role of Language Priors in Vision-Language Models
par: Lin, Zhiqiu, et autres
Publié: (2023)
par: Lin, Zhiqiu, et autres
Publié: (2023)
Learning Video Context as Interleaved Multimodal Sequences
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
Face Consistency Benchmark for GenAI Video
par: Podstawski, Michal, et autres
Publié: (2025)
par: Podstawski, Michal, et autres
Publié: (2025)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
par: Li, Baiqi, et autres
Publié: (2024)
par: Li, Baiqi, et autres
Publié: (2024)
Mitigating GenAI-powered Evidence Pollution for Out-of-Context Multimodal Misinformation Detection
par: Yan, Zehong, et autres
Publié: (2025)
par: Yan, Zehong, et autres
Publié: (2025)
Building a Precise Video Language with Human-AI Oversight
par: Lin, Zhiqiu, et autres
Publié: (2026)
par: Lin, Zhiqiu, et autres
Publié: (2026)
Towards Understanding Camera Motions in Any Video
par: Lin, Zhiqiu, et autres
Publié: (2025)
par: Lin, Zhiqiu, et autres
Publié: (2025)
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
par: Lin, Zhiqiu, et autres
Publié: (2023)
par: Lin, Zhiqiu, et autres
Publié: (2023)
MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter
par: Liu, Zhiyuan, et autres
Publié: (2023)
par: Liu, Zhiyuan, et autres
Publié: (2023)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026)
par: Li, Minghan, et autres
Publié: (2026)
Immersive Fantasy Based on Digital Nostalgia: Environmental Narratives for the Korean Millennials and Gen Z
par: Doh, Yerin, et autres
Publié: (2025)
par: Doh, Yerin, et autres
Publié: (2025)
Seeing Text in the Dark: Algorithm and Benchmark
par: Xu, Chengpei, et autres
Publié: (2024)
par: Xu, Chengpei, et autres
Publié: (2024)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
par: Wang, Sen, et autres
Publié: (2025)
par: Wang, Sen, et autres
Publié: (2025)
UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
Priority prediction of Asian Hornet sighting report using machine learning methods
par: Liu, Yixin, et autres
Publié: (2021)
par: Liu, Yixin, et autres
Publié: (2021)
ProtT3: Protein-to-Text Generation for Text-based Protein Understanding
par: Liu, Zhiyuan, et autres
Publié: (2024)
par: Liu, Zhiyuan, et autres
Publié: (2024)
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
par: Xu, Pengju, et autres
Publié: (2025)
par: Xu, Pengju, et autres
Publié: (2025)
Evaluating the Usability of Microgestures for Text Editing Tasks in Virtual Reality
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
AdaptaGen: Domain-Specific Image Generation through Hierarchical Semantic Optimization Framework
par: Zhang, Suoxiang, et autres
Publié: (2025)
par: Zhang, Suoxiang, et autres
Publié: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
par: Hao, Bowen, et autres
Publié: (2025)
par: Hao, Bowen, et autres
Publié: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025)
par: Zhou, Sheng, et autres
Publié: (2025)
CalliffusionV2: Personalized Natural Calligraphy Generation with Flexible Multi-modal Control
par: Liao, Qisheng, et autres
Publié: (2024)
par: Liao, Qisheng, et autres
Publié: (2024)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
par: Yang, Shuyu, et autres
Publié: (2024)
par: Yang, Shuyu, et autres
Publié: (2024)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
par: Yin, Zhiyu, et autres
Publié: (2026)
par: Yin, Zhiyu, et autres
Publié: (2026)
FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models
par: Li, Yixuan, et autres
Publié: (2024)
par: Li, Yixuan, et autres
Publié: (2024)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
par: Wang, Xinran, et autres
Publié: (2026)
par: Wang, Xinran, et autres
Publié: (2026)
Segmenting Watermarked Texts From Language Models
par: Li, Xingchi, et autres
Publié: (2024)
par: Li, Xingchi, et autres
Publié: (2024)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search
par: Sun, Jintao, et autres
Publié: (2024)
par: Sun, Jintao, et autres
Publié: (2024)
TCAN: Text-oriented Cross Attention Network for Multimodal Sentiment Analysis
par: Quan, Weize, et autres
Publié: (2024)
par: Quan, Weize, et autres
Publié: (2024)
Beyond Coarse-Grained Matching in Video-Text Retrieval
par: Chen, Aozhu, et autres
Publié: (2024)
par: Chen, Aozhu, et autres
Publié: (2024)
A Fast Text-Driven Approach for Generating Artistic Content
par: Lupascu, Marian, et autres
Publié: (2022)
par: Lupascu, Marian, et autres
Publié: (2022)
T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
par: Li, Yili, et autres
Publié: (2025)
par: Li, Yili, et autres
Publié: (2025)
MindFuse: Towards GenAI Explainability in Marketing Strategy Co-Creation
par: Farseev, Aleksandr, et autres
Publié: (2025)
par: Farseev, Aleksandr, et autres
Publié: (2025)
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
par: Ling, Jun, et autres
Publié: (2024)
par: Ling, Jun, et autres
Publié: (2024)
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
Documents similaires
-
Evaluating Text-to-Visual Generation with Image-to-Text Generation
par: Lin, Zhiqiu, et autres
Publié: (2024) -
Language Models as Black-Box Optimizers for Vision-Language Models
par: Liu, Shihong, et autres
Publié: (2023) -
Revisiting the Role of Language Priors in Vision-Language Models
par: Lin, Zhiqiu, et autres
Publié: (2023) -
Learning Video Context as Interleaved Multimodal Sequences
par: Lin, Kevin Qinghong, et autres
Publié: (2024) -
Face Consistency Benchmark for GenAI Video
par: Podstawski, Michal, et autres
Publié: (2025)