Transformer based Multitask Learning for Image Captioning and Object Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Basak, Debolena, Srijith, P. K., Desarkar, Maunendra Sankar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BoK: Introducing Bag-of-Keywords Loss for Interpretable Dialogue Response Generation
di: Dey, Suvodip, et al.
Pubblicazione: (2025)
di: Dey, Suvodip, et al.
Pubblicazione: (2025)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
di: Chaffin, Antoine, et al.
Pubblicazione: (2024)
di: Chaffin, Antoine, et al.
Pubblicazione: (2024)
NLIP_Lab-IITH Multilingual MT System for WAT24 MT Shared Task
di: Brahma, Maharaj, et al.
Pubblicazione: (2024)
di: Brahma, Maharaj, et al.
Pubblicazione: (2024)
DIWALI: Diversity and Inclusivity aWare cuLture specific Items for India: Dataset and Assessment of LLMs for Cultural Text Adaptation in Indian Context
di: Sahoo, Pramit, et al.
Pubblicazione: (2025)
di: Sahoo, Pramit, et al.
Pubblicazione: (2025)
Regional Attention-Enhanced Swin Transformer for Clinically Relevant Medical Image Captioning
di: Naz, Zubia, et al.
Pubblicazione: (2025)
di: Naz, Zubia, et al.
Pubblicazione: (2025)
NLIP_Lab-IITH Low-Resource MT System for WMT24 Indic MT Shared Task
di: Sahoo, Pramit, et al.
Pubblicazione: (2024)
di: Sahoo, Pramit, et al.
Pubblicazione: (2024)
Unsupervised Domain Adaptation with Global and Local Graph Neural Networks in Limited Labeled Data Scenario: Application to Disaster Management
di: Ghosh, Samujjwal, et al.
Pubblicazione: (2021)
di: Ghosh, Samujjwal, et al.
Pubblicazione: (2021)
From Image Captioning to Visual Storytelling
di: Passadakis, Admitos, et al.
Pubblicazione: (2025)
di: Passadakis, Admitos, et al.
Pubblicazione: (2025)
TROPE: TRaining-Free Object-Part Enhancement for Seamlessly Improving Fine-Grained Zero-Shot Image Captioning
di: Feinglass, Joshua, et al.
Pubblicazione: (2024)
di: Feinglass, Joshua, et al.
Pubblicazione: (2024)
Image Captioning via Compact Bidirectional Architecture
di: Song, Zijie, et al.
Pubblicazione: (2022)
di: Song, Zijie, et al.
Pubblicazione: (2022)
MUNIChus: Multilingual News Image Captioning Benchmark
di: Chen, Yuji, et al.
Pubblicazione: (2026)
di: Chen, Yuji, et al.
Pubblicazione: (2026)
Understanding Retrieval Robustness for Retrieval-Augmented Image Captioning
di: Li, Wenyan, et al.
Pubblicazione: (2024)
di: Li, Wenyan, et al.
Pubblicazione: (2024)
Temporal Image Caption Retrieval Competition -- Description and Results
di: Pokrywka, Jakub, et al.
Pubblicazione: (2024)
di: Pokrywka, Jakub, et al.
Pubblicazione: (2024)
The Devil is in the EOS: Sequence Training for Detailed Image Captioning
di: Mohamed, Abdelrahman, et al.
Pubblicazione: (2025)
di: Mohamed, Abdelrahman, et al.
Pubblicazione: (2025)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
di: Cheng, Sheng, et al.
Pubblicazione: (2024)
di: Cheng, Sheng, et al.
Pubblicazione: (2024)
VIXEN: Visual Text Comparison Network for Image Difference Captioning
di: Black, Alexander, et al.
Pubblicazione: (2024)
di: Black, Alexander, et al.
Pubblicazione: (2024)
Altogether: Image Captioning via Re-aligning Alt-text
di: Xu, Hu, et al.
Pubblicazione: (2024)
di: Xu, Hu, et al.
Pubblicazione: (2024)
OmniCaptioner: One Captioner to Rule Them All
di: Lu, Yiting, et al.
Pubblicazione: (2025)
di: Lu, Yiting, et al.
Pubblicazione: (2025)
See or Guess: Counterfactually Regularized Image Captioning
di: Cao, Qian, et al.
Pubblicazione: (2024)
di: Cao, Qian, et al.
Pubblicazione: (2024)
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
di: Byun, Sanghyun, et al.
Pubblicazione: (2025)
di: Byun, Sanghyun, et al.
Pubblicazione: (2025)
Improving Image Captioning by Mimicking Human Reformulation Feedback at Inference-time
di: Berger, Uri, et al.
Pubblicazione: (2025)
di: Berger, Uri, et al.
Pubblicazione: (2025)
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
di: Cheng, Kanzhi, et al.
Pubblicazione: (2025)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2025)
Discovering Meaningful Units with Visually Grounded Semantics from Image Captions
di: Behjati, Melika, et al.
Pubblicazione: (2025)
di: Behjati, Melika, et al.
Pubblicazione: (2025)
#PraCegoVer: A Large Dataset for Image Captioning in Portuguese
di: Santos, Gabriel Oliveira dos, et al.
Pubblicazione: (2021)
di: Santos, Gabriel Oliveira dos, et al.
Pubblicazione: (2021)
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
di: Chen, Xiaofu, et al.
Pubblicazione: (2025)
di: Chen, Xiaofu, et al.
Pubblicazione: (2025)
Towards Adaptable and Interactive Image Captioning with Data Augmentation and Episodic Memory
di: Anagnostopoulou, Aliki, et al.
Pubblicazione: (2023)
di: Anagnostopoulou, Aliki, et al.
Pubblicazione: (2023)
Brazilian Portuguese Image Captioning with Transformers: A Study on Cross-Native-Translated Dataset
di: Bromonschenkel, Gabriel, et al.
Pubblicazione: (2026)
di: Bromonschenkel, Gabriel, et al.
Pubblicazione: (2026)
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
di: Zhang, Junzhe, et al.
Pubblicazione: (2024)
di: Zhang, Junzhe, et al.
Pubblicazione: (2024)
Diffusion-RSCC: Diffusion Probabilistic Model for Change Captioning in Remote Sensing Images
di: Yu, Xiaofei, et al.
Pubblicazione: (2024)
di: Yu, Xiaofei, et al.
Pubblicazione: (2024)
Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions
di: Shen, Yijun, et al.
Pubblicazione: (2025)
di: Shen, Yijun, et al.
Pubblicazione: (2025)
Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction
di: Fonseca, Rui, et al.
Pubblicazione: (2025)
di: Fonseca, Rui, et al.
Pubblicazione: (2025)
Transformer with Controlled Attention for Synchronous Motion Captioning
di: Radouane, Karim, et al.
Pubblicazione: (2024)
di: Radouane, Karim, et al.
Pubblicazione: (2024)
Text-only Synthesis for Image Captioning
di: Zhou, Qing, et al.
Pubblicazione: (2024)
di: Zhou, Qing, et al.
Pubblicazione: (2024)
The Role of Data Curation in Image Captioning
di: Li, Wenyan, et al.
Pubblicazione: (2023)
di: Li, Wenyan, et al.
Pubblicazione: (2023)
Polos: Multimodal Metric Learning from Human Feedback for Image Captioning
di: Wada, Yuiga, et al.
Pubblicazione: (2024)
di: Wada, Yuiga, et al.
Pubblicazione: (2024)
Surveying the Landscape of Image Captioning Evaluation: A Comprehensive Taxonomy, Trends and Metrics Analysis
di: Berger, Uri, et al.
Pubblicazione: (2024)
di: Berger, Uri, et al.
Pubblicazione: (2024)
CultureCLIP: Empowering CLIP with Cultural Awareness through Synthetic Images and Contextualized Captions
di: Huang, Yuchen, et al.
Pubblicazione: (2025)
di: Huang, Yuchen, et al.
Pubblicazione: (2025)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
di: Xing, Long, et al.
Pubblicazione: (2025)
di: Xing, Long, et al.
Pubblicazione: (2025)
Transformer-based Multimodal Change Detection with Multitask Consistency Constraints
di: Liu, Biyuan, et al.
Pubblicazione: (2023)
di: Liu, Biyuan, et al.
Pubblicazione: (2023)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
di: Xing, Long, et al.
Pubblicazione: (2025)
di: Xing, Long, et al.
Pubblicazione: (2025)
Documenti analoghi
-
BoK: Introducing Bag-of-Keywords Loss for Interpretable Dialogue Response Generation
di: Dey, Suvodip, et al.
Pubblicazione: (2025) -
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
di: Chaffin, Antoine, et al.
Pubblicazione: (2024) -
NLIP_Lab-IITH Multilingual MT System for WAT24 MT Shared Task
di: Brahma, Maharaj, et al.
Pubblicazione: (2024) -
DIWALI: Diversity and Inclusivity aWare cuLture specific Items for India: Dataset and Assessment of LLMs for Cultural Text Adaptation in Indian Context
di: Sahoo, Pramit, et al.
Pubblicazione: (2025) -
Regional Attention-Enhanced Swin Transformer for Clinically Relevant Medical Image Captioning
di: Naz, Zubia, et al.
Pubblicazione: (2025)