Image Captioning via Compact Bidirectional Architecture
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Zijie, Zhou, Yuanen, Hu, Zhenzhen, Liu, Daqing, Ben, Huixia, Hong, Richang, Wang, Meng |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
par: Song, Zijie, et autres
Publié: (2023)
par: Song, Zijie, et autres
Publié: (2023)
Grid Jigsaw Representation with CLIP: A New Perspective on Image Clustering
par: Song, Zijie, et autres
Publié: (2023)
par: Song, Zijie, et autres
Publié: (2023)
Video Flow as Time Series: Discovering Temporal Consistency and Variability for VideoQA
par: Song, Zijie, et autres
Publié: (2025)
par: Song, Zijie, et autres
Publié: (2025)
Bidirectional Learning of Facial Action Units and Expressions via Structured Semantic Mapping across Heterogeneous Datasets
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
From Image Captioning to Visual Storytelling
par: Passadakis, Admitos, et autres
Publié: (2025)
par: Passadakis, Admitos, et autres
Publié: (2025)
Altogether: Image Captioning via Re-aligning Alt-text
par: Xu, Hu, et autres
Publié: (2024)
par: Xu, Hu, et autres
Publié: (2024)
Disentangling Foreground and Background for vision-Language Navigation via Online Augmentation
par: Xu, Yunbo, et autres
Publié: (2025)
par: Xu, Yunbo, et autres
Publié: (2025)
Towards Retrieval-Augmented Architectures for Image Captioning
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2025)
par: Xiao, Jian, et autres
Publié: (2025)
StgcDiff: Spatial-Temporal Graph Condition Diffusion for Sign Language Transition Generation
par: He, Jiashu, et autres
Publié: (2025)
par: He, Jiashu, et autres
Publié: (2025)
See or Guess: Counterfactually Regularized Image Captioning
par: Cao, Qian, et autres
Publié: (2024)
par: Cao, Qian, et autres
Publié: (2024)
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
par: Byun, Sanghyun, et autres
Publié: (2025)
par: Byun, Sanghyun, et autres
Publié: (2025)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
par: Chaffin, Antoine, et autres
Publié: (2024)
par: Chaffin, Antoine, et autres
Publié: (2024)
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
par: Cheng, Kanzhi, et autres
Publié: (2025)
par: Cheng, Kanzhi, et autres
Publié: (2025)
DenseAnnotate: Enabling Scalable Dense Caption Collection for Images and 3D Scenes via Spoken Descriptions
par: Lin, Xiaoyu, et autres
Publié: (2025)
par: Lin, Xiaoyu, et autres
Publié: (2025)
MUNIChus: Multilingual News Image Captioning Benchmark
par: Chen, Yuji, et autres
Publié: (2026)
par: Chen, Yuji, et autres
Publié: (2026)
BACON: Improving Clarity of Image Captions via Bag-of-Concept Graphs
par: Yang, Zhantao, et autres
Publié: (2024)
par: Yang, Zhantao, et autres
Publié: (2024)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
Text-only Synthesis for Image Captioning
par: Zhou, Qing, et autres
Publié: (2024)
par: Zhou, Qing, et autres
Publié: (2024)
Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations
par: Zhang, Xuesong, et autres
Publié: (2024)
par: Zhang, Xuesong, et autres
Publié: (2024)
Understanding Retrieval Robustness for Retrieval-Augmented Image Captioning
par: Li, Wenyan, et autres
Publié: (2024)
par: Li, Wenyan, et autres
Publié: (2024)
Temporal Image Caption Retrieval Competition -- Description and Results
par: Pokrywka, Jakub, et autres
Publié: (2024)
par: Pokrywka, Jakub, et autres
Publié: (2024)
The Devil is in the EOS: Sequence Training for Detailed Image Captioning
par: Mohamed, Abdelrahman, et autres
Publié: (2025)
par: Mohamed, Abdelrahman, et autres
Publié: (2025)
OmniCaptioner: One Captioner to Rule Them All
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions
par: Shen, Yijun, et autres
Publié: (2025)
par: Shen, Yijun, et autres
Publié: (2025)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
par: Cheng, Sheng, et autres
Publié: (2024)
par: Cheng, Sheng, et autres
Publié: (2024)
VIXEN: Visual Text Comparison Network for Image Difference Captioning
par: Black, Alexander, et autres
Publié: (2024)
par: Black, Alexander, et autres
Publié: (2024)
Transformer based Multitask Learning for Image Captioning and Object Detection
par: Basak, Debolena, et autres
Publié: (2024)
par: Basak, Debolena, et autres
Publié: (2024)
Static for Dynamic: Towards a Deeper Understanding of Dynamic Facial Expressions Using Static Expression Data
par: Chen, Yin, et autres
Publié: (2024)
par: Chen, Yin, et autres
Publié: (2024)
Improving Image Captioning by Mimicking Human Reformulation Feedback at Inference-time
par: Berger, Uri, et autres
Publié: (2025)
par: Berger, Uri, et autres
Publié: (2025)
Discovering Meaningful Units with Visually Grounded Semantics from Image Captions
par: Behjati, Melika, et autres
Publié: (2025)
par: Behjati, Melika, et autres
Publié: (2025)
#PraCegoVer: A Large Dataset for Image Captioning in Portuguese
par: Santos, Gabriel Oliveira dos, et autres
Publié: (2021)
par: Santos, Gabriel Oliveira dos, et autres
Publié: (2021)
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
par: Chen, Xiaofu, et autres
Publié: (2025)
par: Chen, Xiaofu, et autres
Publié: (2025)
Towards Adaptable and Interactive Image Captioning with Data Augmentation and Episodic Memory
par: Anagnostopoulou, Aliki, et autres
Publié: (2023)
par: Anagnostopoulou, Aliki, et autres
Publié: (2023)
Redemption Score: A Multi-Modal Evaluation Framework for Image Captioning via Distributional, Perceptual, and Linguistic Signal Triangulation
par: Dahal, Ashim, et autres
Publié: (2025)
par: Dahal, Ashim, et autres
Publié: (2025)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2024)
par: Xiao, Jian, et autres
Publié: (2024)
Regional Attention-Enhanced Swin Transformer for Clinically Relevant Medical Image Captioning
par: Naz, Zubia, et autres
Publié: (2025)
par: Naz, Zubia, et autres
Publié: (2025)
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
par: Zhang, Junzhe, et autres
Publié: (2024)
par: Zhang, Junzhe, et autres
Publié: (2024)
Diffusion-RSCC: Diffusion Probabilistic Model for Change Captioning in Remote Sensing Images
par: Yu, Xiaofei, et autres
Publié: (2024)
par: Yu, Xiaofei, et autres
Publié: (2024)
Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction
par: Fonseca, Rui, et autres
Publié: (2025)
par: Fonseca, Rui, et autres
Publié: (2025)
Documents similaires
-
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
par: Song, Zijie, et autres
Publié: (2023) -
Grid Jigsaw Representation with CLIP: A New Perspective on Image Clustering
par: Song, Zijie, et autres
Publié: (2023) -
Video Flow as Time Series: Discovering Temporal Consistency and Variability for VideoQA
par: Song, Zijie, et autres
Publié: (2025) -
Bidirectional Learning of Facial Action Units and Expressions via Structured Semantic Mapping across Heterogeneous Datasets
par: Li, Jia, et autres
Publié: (2026) -
From Image Captioning to Visual Storytelling
par: Passadakis, Admitos, et autres
Publié: (2025)