Visual question answering based evaluation metrics for text-to-image generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Miyamoto, Mizuki, Morita, Ryugo, Zhou, Jinjia |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Block based Adaptive Compressive Sensing with Sampling Rate Control
par: Iwama, Kosuke, et autres
Publié: (2024)
par: Iwama, Kosuke, et autres
Publié: (2024)
Audio-Visual Driven Compression for Low-Bitrate Talking Head Videos
par: Takahashi, Riku, et autres
Publié: (2025)
par: Takahashi, Riku, et autres
Publié: (2025)
Edge-based Denoising Image Compression
par: Morita, Ryugo, et autres
Publié: (2024)
par: Morita, Ryugo, et autres
Publié: (2024)
Bidirectional Learned Facial Animation Codec for Low Bitrate Talking Head Videos
par: Takahashi, Riku, et autres
Publié: (2025)
par: Takahashi, Riku, et autres
Publié: (2025)
TKG-DM: Training-free Chroma Key Content Generation Diffusion Model
par: Morita, Ryugo, et autres
Publié: (2024)
par: Morita, Ryugo, et autres
Publié: (2024)
Visual question answering-based image-finding generation for pulmonary nodules on chest CT from structured annotations
par: Nagao, Maiko, et autres
Publié: (2026)
par: Nagao, Maiko, et autres
Publié: (2026)
Visual question answering: from early developments to recent advances -- a survey
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
Multi-perspective Contrastive Logit Distillation
par: Wang, Qi, et autres
Publié: (2024)
par: Wang, Qi, et autres
Publié: (2024)
TopKD: Top-scaled Knowledge Distillation
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
TAUE: Training-free Noise Transplant and Cultivation Diffusion Model
par: Nagai, Daichi, et autres
Publié: (2025)
par: Nagai, Daichi, et autres
Publié: (2025)
Exploring text-to-image generation for historical document image retrieval
par: Cote, Melissa, et autres
Publié: (2025)
par: Cote, Melissa, et autres
Publié: (2025)
PointT2I: LLM-based text-to-image generation via keypoints
par: Lee, Taekyung, et autres
Publié: (2025)
par: Lee, Taekyung, et autres
Publié: (2025)
KG-CMI: Knowledge graph enhanced cross-Mamba interaction for medical visual question answering
par: Zheng, Xianyao, et autres
Publié: (2026)
par: Zheng, Xianyao, et autres
Publié: (2026)
LGTM: Training-Free Light-Guided Text-to-Image Diffusion Model via Initial Noise Manipulation
par: Morita, Ryugo, et autres
Publié: (2026)
par: Morita, Ryugo, et autres
Publié: (2026)
LimeCross: Context-Conditioned Layered Image Editing with Structural Consistency
par: Morita, Ryugo, et autres
Publié: (2026)
par: Morita, Ryugo, et autres
Publié: (2026)
Consistent text-to-image generation via scene de-contextualization
par: Tang, Song, et autres
Publié: (2025)
par: Tang, Song, et autres
Publié: (2025)
Coarse Semantic Injection for LLM-Conditioned Structured Indoor Prediction
par: Zhu, Shuliang, et autres
Publié: (2026)
par: Zhu, Shuliang, et autres
Publié: (2026)
IMAGE-ALCHEMY: Advancing subject fidelity in personalised text-to-image generation
par: Tiwari, Amritanshu, et autres
Publié: (2025)
par: Tiwari, Amritanshu, et autres
Publié: (2025)
Trinity Detector:text-assisted and attention mechanisms based spectral fusion for diffusion generation image detection
par: Song, Jiawei, et autres
Publié: (2024)
par: Song, Jiawei, et autres
Publié: (2024)
CMI-MTL: Cross-Mamba interaction based multi-task learning for medical visual question answering
par: Jin, Qiangguo, et autres
Publié: (2025)
par: Jin, Qiangguo, et autres
Publié: (2025)
Dark Miner: Defend against undesirable generation for text-to-image diffusion models
par: Meng, Zheling, et autres
Publié: (2024)
par: Meng, Zheling, et autres
Publié: (2024)
Investigation to answer three key questions concerning plant pest identification and development of a practical identification framework
par: Wayama, Ryosuke, et autres
Publié: (2024)
par: Wayama, Ryosuke, et autres
Publié: (2024)
Adaptive Sampling Scheduler
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
Performance evaluation of deep learning models for image analysis: considerations for visual control and statistical metrics
par: Bertram, Christof A., et autres
Publié: (2026)
par: Bertram, Christof A., et autres
Publié: (2026)
Efficient scene text image super-resolution with semantic guidance
par: TomyEnrique, LeoWu, et autres
Publié: (2024)
par: TomyEnrique, LeoWu, et autres
Publié: (2024)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
par: Imam, Mohamed Fazli, et autres
Publié: (2025)
par: Imam, Mohamed Fazli, et autres
Publié: (2025)
Understanding implementation pitfalls of distance-based metrics for image segmentation
par: Podobnik, Gasper, et autres
Publié: (2024)
par: Podobnik, Gasper, et autres
Publié: (2024)
Quantifying the uncertainty of model-based synthetic image quality metrics
par: Bench, Ciaran, et autres
Publié: (2025)
par: Bench, Ciaran, et autres
Publié: (2025)
Several questions of visual generation in 2024
par: Gu, Shuyang
Publié: (2024)
par: Gu, Shuyang
Publié: (2024)
Metrics that matter: Evaluating image quality metrics for medical image generation
par: Deo, Yash, et autres
Publié: (2025)
par: Deo, Yash, et autres
Publié: (2025)
Decomposed evaluations of geographic disparities in text-to-image models
par: Sureddy, Abhishek, et autres
Publié: (2024)
par: Sureddy, Abhishek, et autres
Publié: (2024)
Anchor Learning with Potential Cluster Constraints for Multi-view Clustering
par: Chen, Yawei, et autres
Publié: (2024)
par: Chen, Yawei, et autres
Publié: (2024)
TurboEdit: Instant text-based image editing
par: Wu, Zongze, et autres
Publié: (2024)
par: Wu, Zongze, et autres
Publié: (2024)
Learn from Balance: Rectifying Knowledge Transfer for Long-Tailed Scenarios
par: Huang, Xinlei, et autres
Publié: (2024)
par: Huang, Xinlei, et autres
Publié: (2024)
Learning text-to-video retrieval from image captioning
par: Ventura, Lucas, et autres
Publié: (2024)
par: Ventura, Lucas, et autres
Publié: (2024)
Hyper-parameter tuning for text guided image editing
par: Zhang, Shiwen
Publié: (2024)
par: Zhang, Shiwen
Publié: (2024)
LEAST: "Local" text-conditioned image style transfer
par: Singh, Silky, et autres
Publié: (2024)
par: Singh, Silky, et autres
Publié: (2024)
ImagenHub: Standardizing the evaluation of conditional image generation models
par: Ku, Max, et autres
Publié: (2023)
par: Ku, Max, et autres
Publié: (2023)
Exploring scalable medical image encoders beyond text supervision
par: Pérez-García, Fernando, et autres
Publié: (2024)
par: Pérez-García, Fernando, et autres
Publié: (2024)
Ranking-aware adapter for text-driven image ordering with CLIP
par: Yu, Wei-Hsiang, et autres
Publié: (2024)
par: Yu, Wei-Hsiang, et autres
Publié: (2024)
Documents similaires
-
Block based Adaptive Compressive Sensing with Sampling Rate Control
par: Iwama, Kosuke, et autres
Publié: (2024) -
Audio-Visual Driven Compression for Low-Bitrate Talking Head Videos
par: Takahashi, Riku, et autres
Publié: (2025) -
Edge-based Denoising Image Compression
par: Morita, Ryugo, et autres
Publié: (2024) -
Bidirectional Learned Facial Animation Codec for Low Bitrate Talking Head Videos
par: Takahashi, Riku, et autres
Publié: (2025) -
TKG-DM: Training-free Chroma Key Content Generation Diffusion Model
par: Morita, Ryugo, et autres
Publié: (2024)