KALE: An Artwork Image Captioning System Augmented with Heterogeneous Graph
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Yanbei, Ehinger, Krista A., Lau, Jey Han |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)
PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)
BLIP3-KALE: Knowledge Augmented Large-Scale Dense Captions
di: Awadalla, Anas, et al.
Pubblicazione: (2024)
di: Awadalla, Anas, et al.
Pubblicazione: (2024)
Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
di: Ma, Xueqi, et al.
Pubblicazione: (2025)
di: Ma, Xueqi, et al.
Pubblicazione: (2025)
Improving Denoising Diffusion Models via Simultaneous Estimation of Image and Noise
di: Zhang, Zhenkai, et al.
Pubblicazione: (2023)
di: Zhang, Zhenkai, et al.
Pubblicazione: (2023)
Open-World Amodal Appearance Completion
di: Ao, Jiayang, et al.
Pubblicazione: (2024)
di: Ao, Jiayang, et al.
Pubblicazione: (2024)
Reframing Image Difference Captioning with BLIP2IDC and Synthetic Augmentation
di: Evennou, Gautier, et al.
Pubblicazione: (2024)
di: Evennou, Gautier, et al.
Pubblicazione: (2024)
RACap: Relation-Aware Prompting for Lightweight Retrieval-Augmented Image Captioning
di: Long, Xiaosheng, et al.
Pubblicazione: (2025)
di: Long, Xiaosheng, et al.
Pubblicazione: (2025)
Towards Retrieval-Augmented Architectures for Image Captioning
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
CaptionFool: Universal Image Captioning Model Attacks
di: Parekh, Swapnil
Pubblicazione: (2026)
di: Parekh, Swapnil
Pubblicazione: (2026)
Explainable, Multi-modal Wound Infection Classification from Images Augmented with Generated Captions
di: Busaranuvong, Palawat, et al.
Pubblicazione: (2025)
di: Busaranuvong, Palawat, et al.
Pubblicazione: (2025)
AGIC: Attention-Guided Image Captioning to Improve Caption Relevance
di: Teja, L. D. M. S. Sai, et al.
Pubblicazione: (2025)
di: Teja, L. D. M. S. Sai, et al.
Pubblicazione: (2025)
Is Your Text-to-Image Model Robust to Caption Noise?
di: Yu, Weichen, et al.
Pubblicazione: (2024)
di: Yu, Weichen, et al.
Pubblicazione: (2024)
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
di: Kim, Ye-Chan, et al.
Pubblicazione: (2026)
di: Kim, Ye-Chan, et al.
Pubblicazione: (2026)
Learning to Synthesize Graphics Programs for Geometric Artworks
di: Bing, Qi, et al.
Pubblicazione: (2024)
di: Bing, Qi, et al.
Pubblicazione: (2024)
Masked Generative Story Transformer with Character Guidance and Caption Augmentation
di: Papadimitriou, Christos, et al.
Pubblicazione: (2024)
di: Papadimitriou, Christos, et al.
Pubblicazione: (2024)
Image Captioning in news report scenario
di: Liu, Tianrui, et al.
Pubblicazione: (2024)
di: Liu, Tianrui, et al.
Pubblicazione: (2024)
Automated Image Captioning with CNNs and Transformers
di: Cahyono, Joshua Adrian, et al.
Pubblicazione: (2024)
di: Cahyono, Joshua Adrian, et al.
Pubblicazione: (2024)
Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning
di: You, Xiaoxing, et al.
Pubblicazione: (2025)
di: You, Xiaoxing, et al.
Pubblicazione: (2025)
KnobGen: Controlling the Sophistication of Artwork in Sketch-Based Diffusion Models
di: Navard, Pouyan, et al.
Pubblicazione: (2024)
di: Navard, Pouyan, et al.
Pubblicazione: (2024)
CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning
di: Tang, Zhijiang, et al.
Pubblicazione: (2026)
di: Tang, Zhijiang, et al.
Pubblicazione: (2026)
Image Embedding Sampling Method for Diverse Captioning
di: Waheed, Sania, et al.
Pubblicazione: (2025)
di: Waheed, Sania, et al.
Pubblicazione: (2025)
Top-Down Semantic Refinement for Image Captioning
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
CIC-BART-SSA: Controllable Image Captioning with Structured Semantic Augmentation
di: Basioti, Kalliopi, et al.
Pubblicazione: (2024)
di: Basioti, Kalliopi, et al.
Pubblicazione: (2024)
Semi-Supervised Image Captioning Considering Wasserstein Graph Matching
di: Yang, Yang
Pubblicazione: (2024)
di: Yang, Yang
Pubblicazione: (2024)
Dense Video Captioning using Graph-based Sentence Summarization
di: Zhang, Zhiwang, et al.
Pubblicazione: (2025)
di: Zhang, Zhiwang, et al.
Pubblicazione: (2025)
ReflectCAP: Detailed Image Captioning with Reflective Memory
di: Min, Kyungmin, et al.
Pubblicazione: (2026)
di: Min, Kyungmin, et al.
Pubblicazione: (2026)
An Ensemble Model with Attention Based Mechanism for Image Captioning
di: Badarneh, Israa Al, et al.
Pubblicazione: (2025)
di: Badarneh, Israa Al, et al.
Pubblicazione: (2025)
Describe Anything: Detailed Localized Image and Video Captioning
di: Lian, Long, et al.
Pubblicazione: (2025)
di: Lian, Long, et al.
Pubblicazione: (2025)
Generating Accurate and Detailed Captions for High-Resolution Images
di: Lee, Hankyeol, et al.
Pubblicazione: (2025)
di: Lee, Hankyeol, et al.
Pubblicazione: (2025)
Text-only Synthesis for Image Captioning
di: Zhou, Qing, et al.
Pubblicazione: (2024)
di: Zhou, Qing, et al.
Pubblicazione: (2024)
XMeCap: Meme Caption Generation with Sub-Image Adaptability
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
Uterine Ultrasound Image Captioning Using Deep Learning Techniques
di: Boulesnane, Abdennour, et al.
Pubblicazione: (2024)
di: Boulesnane, Abdennour, et al.
Pubblicazione: (2024)
KTVIC: A Vietnamese Image Captioning Dataset on the Life Domain
di: Pham, Anh-Cuong, et al.
Pubblicazione: (2024)
di: Pham, Anh-Cuong, et al.
Pubblicazione: (2024)
The Role of Data Curation in Image Captioning
di: Li, Wenyan, et al.
Pubblicazione: (2023)
di: Li, Wenyan, et al.
Pubblicazione: (2023)
Graph-Based Captioning: Enhancing Visual Descriptions by Interconnecting Region Captions
di: Hsieh, Yu-Guan, et al.
Pubblicazione: (2024)
di: Hsieh, Yu-Guan, et al.
Pubblicazione: (2024)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
di: Zhang, Yan, et al.
Pubblicazione: (2025)
di: Zhang, Yan, et al.
Pubblicazione: (2025)
From Pixels to Posts: Retrieval-Augmented Fashion Captioning and Hashtag Generation
di: Gondal, Moazzam Umer, et al.
Pubblicazione: (2025)
di: Gondal, Moazzam Umer, et al.
Pubblicazione: (2025)
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
di: Wang, Xinran, et al.
Pubblicazione: (2024)
di: Wang, Xinran, et al.
Pubblicazione: (2024)
Enhancing Image Caption Generation Using Reinforcement Learning with Human Feedback
di: L, Adarsh N, et al.
Pubblicazione: (2024)
di: L, Adarsh N, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
di: Jiang, Yanbei, et al.
Pubblicazione: (2025) -
PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning
di: Jiang, Yanbei, et al.
Pubblicazione: (2025) -
BLIP3-KALE: Knowledge Augmented Large-Scale Dense Captions
di: Awadalla, Anas, et al.
Pubblicazione: (2024) -
Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
di: Ma, Xueqi, et al.
Pubblicazione: (2025) -
Improving Denoising Diffusion Models via Simultaneous Estimation of Image and Noise
di: Zhang, Zhenkai, et al.
Pubblicazione: (2023)