Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Sixing, Gu, Zhibin, Zhang, Ziqi, Pan, Weiguo, Li, Bing, Wang, Ying, Liu, Hongzhe |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
por: Wei, Yuancheng, et al.
Publicado: (2026)
por: Wei, Yuancheng, et al.
Publicado: (2026)
PathoSyn: Imaging-Pathology MRI Synthesis via Disentangled Deviation Diffusion
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
por: Zhuang, Wanru, et al.
Publicado: (2025)
por: Zhuang, Wanru, et al.
Publicado: (2025)
CaptionFool: Universal Image Captioning Model Attacks
por: Parekh, Swapnil
Publicado: (2026)
por: Parekh, Swapnil
Publicado: (2026)
Describe Anything: Detailed Localized Image and Video Captioning
por: Lian, Long, et al.
Publicado: (2025)
por: Lian, Long, et al.
Publicado: (2025)
CAPEEN: Image Captioning with Early Exits and Knowledge Distillation
por: Bajpai, Divya Jyoti, et al.
Publicado: (2024)
por: Bajpai, Divya Jyoti, et al.
Publicado: (2024)
AGIC: Attention-Guided Image Captioning to Improve Caption Relevance
por: Teja, L. D. M. S. Sai, et al.
Publicado: (2025)
por: Teja, L. D. M. S. Sai, et al.
Publicado: (2025)
Image Captioning in news report scenario
por: Liu, Tianrui, et al.
Publicado: (2024)
por: Liu, Tianrui, et al.
Publicado: (2024)
Exploring Annotation-free Image Captioning with Retrieval-augmented Pseudo Sentence Generation
por: Li, Zhiyuan, et al.
Publicado: (2023)
por: Li, Zhiyuan, et al.
Publicado: (2023)
XMeCap: Meme Caption Generation with Sub-Image Adaptability
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
Automated Image Captioning with CNNs and Transformers
por: Cahyono, Joshua Adrian, et al.
Publicado: (2024)
por: Cahyono, Joshua Adrian, et al.
Publicado: (2024)
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
por: Wang, Xinran, et al.
Publicado: (2024)
por: Wang, Xinran, et al.
Publicado: (2024)
The Role of Data Curation in Image Captioning
por: Li, Wenyan, et al.
Publicado: (2023)
por: Li, Wenyan, et al.
Publicado: (2023)
Generalizable Geometric Image Caption Synthesis
por: Xin, Yue, et al.
Publicado: (2025)
por: Xin, Yue, et al.
Publicado: (2025)
Text-only Synthesis for Image Captioning
por: Zhou, Qing, et al.
Publicado: (2024)
por: Zhou, Qing, et al.
Publicado: (2024)
Accurate and Fast Compressed Video Captioning
por: Shen, Yaojie, et al.
Publicado: (2023)
por: Shen, Yaojie, et al.
Publicado: (2023)
Image Embedding Sampling Method for Diverse Captioning
por: Waheed, Sania, et al.
Publicado: (2025)
por: Waheed, Sania, et al.
Publicado: (2025)
Top-Down Semantic Refinement for Image Captioning
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Sam-Guided Enhanced Fine-Grained Encoding with Mixed Semantic Learning for Medical Image Captioning
por: Zhang, Zhenyu, et al.
Publicado: (2023)
por: Zhang, Zhenyu, et al.
Publicado: (2023)
Cross Modification Attention Based Deliberation Model for Image Captioning
por: Lian, Zheng, et al.
Publicado: (2021)
por: Lian, Zheng, et al.
Publicado: (2021)
RACap: Relation-Aware Prompting for Lightweight Retrieval-Augmented Image Captioning
por: Long, Xiaosheng, et al.
Publicado: (2025)
por: Long, Xiaosheng, et al.
Publicado: (2025)
Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning
por: You, Xiaoxing, et al.
Publicado: (2025)
por: You, Xiaoxing, et al.
Publicado: (2025)
ReflectCAP: Detailed Image Captioning with Reflective Memory
por: Min, Kyungmin, et al.
Publicado: (2026)
por: Min, Kyungmin, et al.
Publicado: (2026)
An Ensemble Model with Attention Based Mechanism for Image Captioning
por: Badarneh, Israa Al, et al.
Publicado: (2025)
por: Badarneh, Israa Al, et al.
Publicado: (2025)
Generating Accurate and Detailed Captions for High-Resolution Images
por: Lee, Hankyeol, et al.
Publicado: (2025)
por: Lee, Hankyeol, et al.
Publicado: (2025)
Is Your Text-to-Image Model Robust to Caption Noise?
por: Yu, Weichen, et al.
Publicado: (2024)
por: Yu, Weichen, et al.
Publicado: (2024)
MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment
por: Banerjee, Sagarika, et al.
Publicado: (2026)
por: Banerjee, Sagarika, et al.
Publicado: (2026)
I2EBench: A Comprehensive Benchmark for Instruction-based Image Editing
por: Ma, Yiwei, et al.
Publicado: (2024)
por: Ma, Yiwei, et al.
Publicado: (2024)
DualCap: Enhancing Lightweight Image Captioning via Dual Retrieval with Similar Scenes Visual Prompts
por: Li, Binbin, et al.
Publicado: (2025)
por: Li, Binbin, et al.
Publicado: (2025)
Frequency Dynamic Convolution for Dense Image Prediction
por: Chen, Linwei, et al.
Publicado: (2025)
por: Chen, Linwei, et al.
Publicado: (2025)
Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education
por: Wang, Junling, et al.
Publicado: (2026)
por: Wang, Junling, et al.
Publicado: (2026)
Uterine Ultrasound Image Captioning Using Deep Learning Techniques
por: Boulesnane, Abdennour, et al.
Publicado: (2024)
por: Boulesnane, Abdennour, et al.
Publicado: (2024)
KALE: An Artwork Image Captioning System Augmented with Heterogeneous Graph
por: Jiang, Yanbei, et al.
Publicado: (2024)
por: Jiang, Yanbei, et al.
Publicado: (2024)
KTVIC: A Vietnamese Image Captioning Dataset on the Life Domain
por: Pham, Anh-Cuong, et al.
Publicado: (2024)
por: Pham, Anh-Cuong, et al.
Publicado: (2024)
RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature
por: Li, Hanzheng, et al.
Publicado: (2025)
por: Li, Hanzheng, et al.
Publicado: (2025)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)
por: Wu, Shengqiong, et al.
Publicado: (2025)
InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
por: Fan, Tiehan, et al.
Publicado: (2024)
por: Fan, Tiehan, et al.
Publicado: (2024)
Unleashing Diffusion and State Space Models for Medical Image Segmentation
por: Wu, Rong, et al.
Publicado: (2025)
por: Wu, Rong, et al.
Publicado: (2025)
PixLore: A Dataset-driven Approach to Rich Image Captioning
por: Bonilla-Salvador, Diego, et al.
Publicado: (2023)
por: Bonilla-Salvador, Diego, et al.
Publicado: (2023)
CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning
por: Tang, Zhijiang, et al.
Publicado: (2026)
por: Tang, Zhijiang, et al.
Publicado: (2026)
Ejemplares similares
-
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
por: Wei, Yuancheng, et al.
Publicado: (2026) -
PathoSyn: Imaging-Pathology MRI Synthesis via Disentangled Deviation Diffusion
por: Wang, Jian, et al.
Publicado: (2025) -
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
por: Zhuang, Wanru, et al.
Publicado: (2025) -
CaptionFool: Universal Image Captioning Model Attacks
por: Parekh, Swapnil
Publicado: (2026) -
Describe Anything: Detailed Localized Image and Video Captioning
por: Lian, Long, et al.
Publicado: (2025)