Visual question answering based evaluation metrics for text-to-image generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Miyamoto, Mizuki, Morita, Ryugo, Zhou, Jinjia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Block based Adaptive Compressive Sensing with Sampling Rate Control
di: Iwama, Kosuke, et al.
Pubblicazione: (2024)
di: Iwama, Kosuke, et al.
Pubblicazione: (2024)
Audio-Visual Driven Compression for Low-Bitrate Talking Head Videos
di: Takahashi, Riku, et al.
Pubblicazione: (2025)
di: Takahashi, Riku, et al.
Pubblicazione: (2025)
Edge-based Denoising Image Compression
di: Morita, Ryugo, et al.
Pubblicazione: (2024)
di: Morita, Ryugo, et al.
Pubblicazione: (2024)
Bidirectional Learned Facial Animation Codec for Low Bitrate Talking Head Videos
di: Takahashi, Riku, et al.
Pubblicazione: (2025)
di: Takahashi, Riku, et al.
Pubblicazione: (2025)
TKG-DM: Training-free Chroma Key Content Generation Diffusion Model
di: Morita, Ryugo, et al.
Pubblicazione: (2024)
di: Morita, Ryugo, et al.
Pubblicazione: (2024)
Visual question answering-based image-finding generation for pulmonary nodules on chest CT from structured annotations
di: Nagao, Maiko, et al.
Pubblicazione: (2026)
di: Nagao, Maiko, et al.
Pubblicazione: (2026)
Visual question answering: from early developments to recent advances -- a survey
di: Huynh, Ngoc Dung, et al.
Pubblicazione: (2025)
di: Huynh, Ngoc Dung, et al.
Pubblicazione: (2025)
Multi-perspective Contrastive Logit Distillation
di: Wang, Qi, et al.
Pubblicazione: (2024)
di: Wang, Qi, et al.
Pubblicazione: (2024)
TopKD: Top-scaled Knowledge Distillation
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
TAUE: Training-free Noise Transplant and Cultivation Diffusion Model
di: Nagai, Daichi, et al.
Pubblicazione: (2025)
di: Nagai, Daichi, et al.
Pubblicazione: (2025)
Exploring text-to-image generation for historical document image retrieval
di: Cote, Melissa, et al.
Pubblicazione: (2025)
di: Cote, Melissa, et al.
Pubblicazione: (2025)
PointT2I: LLM-based text-to-image generation via keypoints
di: Lee, Taekyung, et al.
Pubblicazione: (2025)
di: Lee, Taekyung, et al.
Pubblicazione: (2025)
KG-CMI: Knowledge graph enhanced cross-Mamba interaction for medical visual question answering
di: Zheng, Xianyao, et al.
Pubblicazione: (2026)
di: Zheng, Xianyao, et al.
Pubblicazione: (2026)
LGTM: Training-Free Light-Guided Text-to-Image Diffusion Model via Initial Noise Manipulation
di: Morita, Ryugo, et al.
Pubblicazione: (2026)
di: Morita, Ryugo, et al.
Pubblicazione: (2026)
LimeCross: Context-Conditioned Layered Image Editing with Structural Consistency
di: Morita, Ryugo, et al.
Pubblicazione: (2026)
di: Morita, Ryugo, et al.
Pubblicazione: (2026)
Consistent text-to-image generation via scene de-contextualization
di: Tang, Song, et al.
Pubblicazione: (2025)
di: Tang, Song, et al.
Pubblicazione: (2025)
Coarse Semantic Injection for LLM-Conditioned Structured Indoor Prediction
di: Zhu, Shuliang, et al.
Pubblicazione: (2026)
di: Zhu, Shuliang, et al.
Pubblicazione: (2026)
IMAGE-ALCHEMY: Advancing subject fidelity in personalised text-to-image generation
di: Tiwari, Amritanshu, et al.
Pubblicazione: (2025)
di: Tiwari, Amritanshu, et al.
Pubblicazione: (2025)
Trinity Detector:text-assisted and attention mechanisms based spectral fusion for diffusion generation image detection
di: Song, Jiawei, et al.
Pubblicazione: (2024)
di: Song, Jiawei, et al.
Pubblicazione: (2024)
CMI-MTL: Cross-Mamba interaction based multi-task learning for medical visual question answering
di: Jin, Qiangguo, et al.
Pubblicazione: (2025)
di: Jin, Qiangguo, et al.
Pubblicazione: (2025)
Dark Miner: Defend against undesirable generation for text-to-image diffusion models
di: Meng, Zheling, et al.
Pubblicazione: (2024)
di: Meng, Zheling, et al.
Pubblicazione: (2024)
Investigation to answer three key questions concerning plant pest identification and development of a practical identification framework
di: Wayama, Ryosuke, et al.
Pubblicazione: (2024)
di: Wayama, Ryosuke, et al.
Pubblicazione: (2024)
Adaptive Sampling Scheduler
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
Performance evaluation of deep learning models for image analysis: considerations for visual control and statistical metrics
di: Bertram, Christof A., et al.
Pubblicazione: (2026)
di: Bertram, Christof A., et al.
Pubblicazione: (2026)
Efficient scene text image super-resolution with semantic guidance
di: TomyEnrique, LeoWu, et al.
Pubblicazione: (2024)
di: TomyEnrique, LeoWu, et al.
Pubblicazione: (2024)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
Understanding implementation pitfalls of distance-based metrics for image segmentation
di: Podobnik, Gasper, et al.
Pubblicazione: (2024)
di: Podobnik, Gasper, et al.
Pubblicazione: (2024)
Quantifying the uncertainty of model-based synthetic image quality metrics
di: Bench, Ciaran, et al.
Pubblicazione: (2025)
di: Bench, Ciaran, et al.
Pubblicazione: (2025)
Several questions of visual generation in 2024
di: Gu, Shuyang
Pubblicazione: (2024)
di: Gu, Shuyang
Pubblicazione: (2024)
Metrics that matter: Evaluating image quality metrics for medical image generation
di: Deo, Yash, et al.
Pubblicazione: (2025)
di: Deo, Yash, et al.
Pubblicazione: (2025)
Decomposed evaluations of geographic disparities in text-to-image models
di: Sureddy, Abhishek, et al.
Pubblicazione: (2024)
di: Sureddy, Abhishek, et al.
Pubblicazione: (2024)
Anchor Learning with Potential Cluster Constraints for Multi-view Clustering
di: Chen, Yawei, et al.
Pubblicazione: (2024)
di: Chen, Yawei, et al.
Pubblicazione: (2024)
TurboEdit: Instant text-based image editing
di: Wu, Zongze, et al.
Pubblicazione: (2024)
di: Wu, Zongze, et al.
Pubblicazione: (2024)
Learn from Balance: Rectifying Knowledge Transfer for Long-Tailed Scenarios
di: Huang, Xinlei, et al.
Pubblicazione: (2024)
di: Huang, Xinlei, et al.
Pubblicazione: (2024)
Learning text-to-video retrieval from image captioning
di: Ventura, Lucas, et al.
Pubblicazione: (2024)
di: Ventura, Lucas, et al.
Pubblicazione: (2024)
Hyper-parameter tuning for text guided image editing
di: Zhang, Shiwen
Pubblicazione: (2024)
di: Zhang, Shiwen
Pubblicazione: (2024)
LEAST: "Local" text-conditioned image style transfer
di: Singh, Silky, et al.
Pubblicazione: (2024)
di: Singh, Silky, et al.
Pubblicazione: (2024)
ImagenHub: Standardizing the evaluation of conditional image generation models
di: Ku, Max, et al.
Pubblicazione: (2023)
di: Ku, Max, et al.
Pubblicazione: (2023)
Exploring scalable medical image encoders beyond text supervision
di: Pérez-García, Fernando, et al.
Pubblicazione: (2024)
di: Pérez-García, Fernando, et al.
Pubblicazione: (2024)
Ranking-aware adapter for text-driven image ordering with CLIP
di: Yu, Wei-Hsiang, et al.
Pubblicazione: (2024)
di: Yu, Wei-Hsiang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Block based Adaptive Compressive Sensing with Sampling Rate Control
di: Iwama, Kosuke, et al.
Pubblicazione: (2024) -
Audio-Visual Driven Compression for Low-Bitrate Talking Head Videos
di: Takahashi, Riku, et al.
Pubblicazione: (2025) -
Edge-based Denoising Image Compression
di: Morita, Ryugo, et al.
Pubblicazione: (2024) -
Bidirectional Learned Facial Animation Codec for Low Bitrate Talking Head Videos
di: Takahashi, Riku, et al.
Pubblicazione: (2025) -
TKG-DM: Training-free Chroma Key Content Generation Diffusion Model
di: Morita, Ryugo, et al.
Pubblicazione: (2024)