Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lim, Youngsun, Choi, Hojun, Shim, Hyunjung |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Addressing Image Hallucination in Text-to-Image Generation through Factual Image Retrieval
par: Lim, Youngsun, et autres
Publié: (2024)
par: Lim, Youngsun, et autres
Publié: (2024)
Label-Augmented Dataset Distillation
par: Kang, Seoungyoon, et autres
Publié: (2024)
par: Kang, Seoungyoon, et autres
Publié: (2024)
CoT-PL: Chain-of-Thought Pseudo-Labeling for Open-Vocabulary Object Detection
par: Choi, Hojun, et autres
Publié: (2025)
par: Choi, Hojun, et autres
Publié: (2025)
Sampling Bag of Views for Open-Vocabulary Object Detection
par: Choi, Hojun, et autres
Publié: (2024)
par: Choi, Hojun, et autres
Publié: (2024)
Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts
par: Yu, Seungjun, et autres
Publié: (2025)
par: Yu, Seungjun, et autres
Publié: (2025)
What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging
par: Kang, Inha, et autres
Publié: (2025)
par: Kang, Inha, et autres
Publié: (2025)
FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models
par: Lim, Youngsun, et autres
Publié: (2026)
par: Lim, Youngsun, et autres
Publié: (2026)
Memory-Efficient Fine-Tuning for Quantized Diffusion Model
par: Ryu, Hyogon, et autres
Publié: (2024)
par: Ryu, Hyogon, et autres
Publié: (2024)
Scribble-Guided Diffusion for Training-free Text-to-Image Generation
par: Lee, Seonho, et autres
Publié: (2024)
par: Lee, Seonho, et autres
Publié: (2024)
Precision matters: Precision-aware ensemble for weakly supervised semantic segmentation
par: Park, Junsung, et autres
Publié: (2024)
par: Park, Junsung, et autres
Publié: (2024)
Classifier-guided CLIP Distillation for Unsupervised Multi-label Classification
par: Kim, Dongseob, et autres
Publié: (2025)
par: Kim, Dongseob, et autres
Publié: (2025)
WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
par: Yu, Seungjun, et autres
Publié: (2025)
par: Yu, Seungjun, et autres
Publié: (2025)
MomentMix Augmentation with Length-Aware DETR for Temporally Robust Moment Retrieval
par: Park, Seojeong, et autres
Publié: (2024)
par: Park, Seojeong, et autres
Publié: (2024)
Grounding Driving VLA via Inverse Kinematics
par: Park, Junsung, et autres
Publié: (2026)
par: Park, Junsung, et autres
Publié: (2026)
TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation
par: Park, NaHyeon, et autres
Publié: (2024)
par: Park, NaHyeon, et autres
Publié: (2024)
Rethinking Data Augmentation for Robust LiDAR Semantic Segmentation in Adverse Weather
par: Park, Junsung, et autres
Publié: (2024)
par: Park, Junsung, et autres
Publié: (2024)
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)
par: Wu, Jinge, et autres
Publié: (2024)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
par: Ahir, Param, et autres
Publié: (2023)
par: Ahir, Param, et autres
Publié: (2023)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
par: Chen, Pingyi, et autres
Publié: (2024)
par: Chen, Pingyi, et autres
Publié: (2024)
Knowledge-based learning in Text-RAG and Image-RAG
par: Shim, Alexander, et autres
Publié: (2026)
par: Shim, Alexander, et autres
Publié: (2026)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
par: Özdemir, Övgü, et autres
Publié: (2024)
par: Özdemir, Övgü, et autres
Publié: (2024)
Clustering-based Image-Text Graph Matching for Domain Generalization
par: Park, Nokyung, et autres
Publié: (2023)
par: Park, Nokyung, et autres
Publié: (2023)
TerraQ: Spatiotemporal Question-Answering on Satellite Image Archives
par: Kefalidis, Sergios-Anestis, et autres
Publié: (2025)
par: Kefalidis, Sergios-Anestis, et autres
Publié: (2025)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
par: Han, Wei, et autres
Publié: (2023)
par: Han, Wei, et autres
Publié: (2023)
No Thing, Nothing: Highlighting Safety-Critical Classes for Robust LiDAR Semantic Segmentation in Adverse Weather
par: Park, Junsung, et autres
Publié: (2025)
par: Park, Junsung, et autres
Publié: (2025)
Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding
par: An, Na Min, et autres
Publié: (2025)
par: An, Na Min, et autres
Publié: (2025)
Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering
par: Peter, Ojonugwa Oluwafemi Ejiga, et autres
Publié: (2026)
par: Peter, Ojonugwa Oluwafemi Ejiga, et autres
Publié: (2026)
3D-Aware Vision-Language Models Fine-Tuning with Geometric Distillation
par: Lee, Seonho, et autres
Publié: (2025)
par: Lee, Seonho, et autres
Publié: (2025)
Text-Guided Variational Image Generation for Industrial Anomaly Detection and Segmentation
par: Lee, Mingyu, et autres
Publié: (2024)
par: Lee, Mingyu, et autres
Publié: (2024)
World-To-Image: Grounding Text-to-Image Generation with Agent-Driven World Knowledge
par: Son, Moo Hyun, et autres
Publié: (2025)
par: Son, Moo Hyun, et autres
Publié: (2025)
FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering
par: Tong, Chaodong, et autres
Publié: (2026)
par: Tong, Chaodong, et autres
Publié: (2026)
Evaluating Text-to-Image Generative Models: An Empirical Study on Human Image Synthesis
par: Chen, Muxi, et autres
Publié: (2024)
par: Chen, Muxi, et autres
Publié: (2024)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
par: Oh, Ju-Young, et autres
Publié: (2025)
par: Oh, Ju-Young, et autres
Publié: (2025)
VidCtx: Context-aware Video Question Answering with Image Models
par: Goulas, Andreas, et autres
Publié: (2024)
par: Goulas, Andreas, et autres
Publié: (2024)
How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions
par: An, Na Min, et autres
Publié: (2025)
par: An, Na Min, et autres
Publié: (2025)
ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
par: Wu, Yike, et autres
Publié: (2025)
par: Wu, Yike, et autres
Publié: (2025)
Fine-Grained Image-Text Correspondence with Cost Aggregation for Open-Vocabulary Part Segmentation
par: Choi, Jiho, et autres
Publié: (2025)
par: Choi, Jiho, et autres
Publié: (2025)
Guidance Matters: Rethinking the Evaluation Pitfall for Text-to-Image Generation
par: Xie, Dian, et autres
Publié: (2026)
par: Xie, Dian, et autres
Publié: (2026)
Why Settle for One? Text-to-ImageSet Generation and Evaluation
par: Jia, Chengyou, et autres
Publié: (2025)
par: Jia, Chengyou, et autres
Publié: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
par: Choi, Changin, et autres
Publié: (2025)
par: Choi, Changin, et autres
Publié: (2025)
Documents similaires
-
Addressing Image Hallucination in Text-to-Image Generation through Factual Image Retrieval
par: Lim, Youngsun, et autres
Publié: (2024) -
Label-Augmented Dataset Distillation
par: Kang, Seoungyoon, et autres
Publié: (2024) -
CoT-PL: Chain-of-Thought Pseudo-Labeling for Open-Vocabulary Object Detection
par: Choi, Hojun, et autres
Publié: (2025) -
Sampling Bag of Views for Open-Vocabulary Object Detection
par: Choi, Hojun, et autres
Publié: (2024) -
Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts
par: Yu, Seungjun, et autres
Publié: (2025)